值得关注:AI 模型关键更新,可能影响机器人能力栈与产品路线
Google 推出 Gemini Omni 1.1 Flash,为开发者提供更强的生成式视频控制能力。新模型支持场景扩展(可分析最多 10 秒先前上下文,以 10 秒为增量累计延长至 40 秒)、指定首尾帧生成平滑过渡,以及 4K 高清输出。
聚焦人形、具身、产品演示、量产交付和商业落地,AI 动态作为补充。
过去24小时,人形机器人领域迎来高光时刻:2026世界人形机器人运动会落幕,天骄队百米跑出8.64秒,超越人类世界纪录,智元机器人以18金登顶奖牌榜,展示运动能力显著进展。产业层面,小鹏机器人业务完成超9亿美元融资,估值超63亿美元,并称IRON人形机器人将量产;LimX Dynamics展示TRON 2在中药房全流程作业,体现灵巧操作与真实场景落地。AI模型方面,通义千问与智谱分别开源高效多模态模型,算力需求推动亚马逊大幅增加英伟达芯片采购。整体看,人形机器人从竞技演示走向量产与场景验证,具身智能与AI模型协同演进。
查看完整日报值得关注:AI 模型关键更新,可能影响机器人能力栈与产品路线
Google 推出 Gemini Omni 1.1 Flash,为开发者提供更强的生成式视频控制能力。新模型支持场景扩展(可分析最多 10 秒先前上下文,以 10 秒为增量累计延长至 40 秒)、指定首尾帧生成平滑过渡,以及 4K 高清输出。
值得关注:Google DeepMind 发布 Gemini Omni 1.1 Flash,标志着多模态模型在可控性上的迭代,对具身智能开发者的模型选型具有参考价值。
Google DeepMind 于 8 月 27 日发布 Gemini Omni 1.1 Flash 模型,主打让开发者能够以更高控制度构建应用。由于官方公告未附详细说明,目前仅知这是对 Omni 1.1 Flash 的迭代,具体能力改进和参数细节有待后续披露。
值得关注:AI 模型关键更新,可能影响机器人能力栈与产品路线
Ox Alpha = GLM-5.3 Flash AA = 57,以1/100的前沿价格, 由纯国产芯片驱动。在OpenRouter上实现了近20%的周token份额(第一)。 感谢大家的支持。
值得关注:AI 模型关键更新,可能影响机器人能力栈与产品路线
Google DeepMind 推出 Gemini 3.5 Transcribe 语音转文本模型,支持流式与非流式两种 API。据 Artificial Analysis 评测,其流式与非流式平均词错率分别为 4.0% 和 2.6%,支持超 85 种语言、自定义词汇及最多三人说话人识别。
值得关注:AI 模型关键更新,可能影响机器人能力栈与产品路线
通义千问发布 Qwen3.8-Flash,一款多模态 MoE 模型,作为 Qwen4 架构的早期预览并开放权重。该模型总参数 125B,每 token 仅激活 6B,训练成本仅为 Qwen3.7-Plus 的 1/9,性能全面超越后者。生产版 API 定价 $0.16/1M 输入 tokens 和 $0.47/1M 输出 tokens,原生上下文 262K,可扩展至 1M。
值得关注:前Meta科学家创立的Perceptron推出视觉AI模型,聚焦工厂场景的机器导航与视觉智能,有望推动具身智能在工业落地。
Perceptron公司由前Meta科学家创立,推出AI模型,声称可帮助机器在环境中导航,同时提供深度视觉智能。该公司旨在将视觉AI应用于工厂车间,提升机器感知与理解能力,推动工业场景的智能化升级。
值得关注:AI 模型关键更新,可能影响机器人能力栈与产品路线
智谱上线并开源 GLM-5.3-Flash(320B-A18B),这是 GLM-5 系列首个原生多模态模型,AA 综合智能指数 57 分,与 Claude Opus 4.8 持平。其定价为 GLM-5.3 的 1/10,限时折扣内为 Opus 4.8 的 1/40,并已接入 ZCode 等平台开放 API 调用。该模型采用稀疏注意力与线性注意力混合架构,推理服务已跑在国产芯片集群上。
值得关注:S1模型仅凭一个视频示例即可学会10分钟长任务,无需微调,显著降低数据采集成本,有望加速具身智能在真实场景中的快速部署。
Skild AI推出S1基础模型,可仅凭一个视频示例学会从未见过的长达10分钟任务,无需微调,并通过上下文学习实现实时操作。这标志着机器人学习在少样本泛化上迈出重要一步。
值得关注:NVIDIA Robotics 官方介绍 SONIC 技术,聚焦人形机器人全身控制,虽无细节但反映头部厂商在机器人控制算法方向的布局。
NVIDIA Robotics 官方账号发布消息,介绍 SONIC 技术,称其助力提升人形机器人全身控制的敏捷性与运动能力。原文未提供具体技术细节或演示信息,信源信息有限。
值得关注:NVIDIA 展示 Cosmos 3 后训练与 Aigen、Linker Vision 的实战用例,体现世界模型在行业场景的微调部署能力,对 Physical AI 落地有风向标意义。
NVIDIA Robotics 官方发布 Cosmos 3 后训练在合作伙伴 Aigen 和 Linker Vision 场景中的应用演示,展示世界模型在行业任务中的微调与部署能力。X 平台信息有限,具体技术细节与效果未展开,可关注后续文档或发布。
值得关注:NVIDIA实测推测解码将Jetson上Qwen 27B推理速度提升近2.7倍,边缘AI加速方案可降低机器人端侧模型推理延迟,具备工程参考价值。
NVIDIA Robotics在X平台介绍推测解码技术,称可显著加速Jetson边缘设备上的生成式AI推理:Qwen 3.8 27B从13 token/s提升至35 token/s,Nemotron 3.5 Lightning从65提升至115。该技术对端侧机器人部署具有潜在价值。
值得关注:Diligent Robotics将世界模型引入医院机器人Moxi 2.0,代表Physical AI在医疗场景的实用化突破,具商业参考价值。
Diligent Robotics 发布医院机器人 Moxi 2.0,集成 Physical AI 世界模型,以增强对动态医疗环境的理解与自主决策能力,推动医院自动化从预设任务向智能化协作升级。该产品面向医疗场景,体现了具身智能在垂直行业的落地。更多性能参数与上市信息有待公布。
值得关注:Figure AI以众包人类视频扩充具身数据,直击行业数据稀缺瓶颈,其路径和效果值得持续跟踪。
据Humanoids Daily报道,Figure AI发布Index项目,通过众包方式收集真实世界的人类视频数据,用于训练其Helix具身智能模型。目前关于具体数据规模、采集方式和模型效果等细节尚未披露,信源信息有限。
值得关注:官方公开基于百万小时第一视角视频训练机器人的基础设施,凸显数据基础设施对具身智能迭代的关键作用。
Dyna Robotics 今日公开其训练基础设施,用于在超过 100 万小时的自我中心视频上重复训练机器人模型 Dyna-2。该公司指出,基础设施是快速迭代模型、数据和硬件三要素的关键,但具体技术细节尚未披露,信源信息有限。
值得关注:Seeing Machines从车载感知跨界发布人形机器人Physical AI平台,体现传统视觉厂商向具身智能转型的趋势。
Seeing Machines宣布启动Physical AI平台,用于驱动新一代人形机器人。该公司通过官方新闻稿披露这一消息,但摘要未提供具体技术细节和产品参数。目前信息有限,仅能确认其正式进军具身智能领域。
值得关注:NVIDIA官方背书Qwen3.8-27B在Jetson上的边缘推理表现,结合推理与智能体能力,为端侧具身智能模型选型提供新选项。
英伟达机器人官方账号宣布,Qwen3.8-27B模型已支持边缘部署,具备强大推理与智能体能力,并支持通过MTP实现投机解码,在NVIDIA Jetson平台上可实现快速响应的本地推理。该模型有望用于机器人和具身智能的端侧计算。
值得关注:NVIDIA Robotics官方发布WAMs与VLAs机器人学习内容,显示其将世界模型与动作模型结合,推动具身智能基础研究。
NVIDIA Robotics官方账号发布与Cosmos Labs相关的机器人学习内容,聚焦WAMs(世界动作模型)和VLAs(视觉-语言-动作模型)。具体是否包含新模型、论文或工具尚不明确,仅从标题可见其聚焦机器人学习前沿方向。
值得关注:教授创业公司半年斩获5亿元融资,主攻具身通用大脑,显示资本高度看好具身智能核心算法赛道。
西湖大学教授创立的具身智能公司,专注研发具身通用大脑,在半年内合计完成四轮融资,总额达5亿元人民币。原文未披露公司具体名称与产品细节,信息来自硬氪首发。
值得关注:三星设立RX部门专攻人形机器人并采用世界模型AI,显示科技巨头加速布局具身智能,将推动产业竞争。
三星宣布加速内部人形机器人开发,成立专门的RX部门,并引入世界模型AI技术。信源未提供更多细节,具体产品路线和部门规划尚不明朗,仅据标题概括。
值得关注:Ego2Robot将1940小时人类操作视频转化为18561小时机器人训练数据,大幅降低数据采集成本,推动具身智能数据规模化。
阿里巴巴Qwen团队发布Ego2Robot,一种将第一人称人类操作视频转化为机器人训练数据的流程。该流程从约1940小时的第一人称操作视频中,生成了18561小时的合成机器人数据,大幅扩展了机器人学习的数据来源。目前信息来自社交媒体转发,原始发布细节有限。