Destro AI 出隐身:用 $8M 种子轮让机器人与人类协同调度物流
物流智能层创业公司 Destro 周二出隐身,获 800 万美元种子轮,由 Base10 Partners 和 Bonfire Ventures 领投。公司不自研机器人,而是用基于开源权重视觉-语言-动作模型的 Mothership 操作系统同时调度机器人与人工。其方案已在 Yusen Logistics 一个设施试点后扩展至 26 台机器人部署,并在南加州启动 17 台机器人的新试点。
物流智能层创业公司 Destro 周二出隐身,获 800 万美元种子轮,由 Base10 Partners 和 Bonfire Ventures 领投。公司不自研机器人,而是用基于开源权重视觉-语言-动作模型的 Mothership 操作系统同时调度机器人与人工。其方案已在 Yusen Logistics 一个设施试点后扩展至 26 台机器人部署,并在南加州启动 17 台机器人的新试点。
特斯拉计划到 2026 年底实现每周生产 1,000 台 Optimus 人形机器人,但部分员工不愿参与 Optimus 的数据采集与训练工作,原因是这些机器人未来可能取代他们的岗位。
Microsoft Research 的研究挑战了机器人 AI 推理必须完全依赖机载 GPU 的假设,显示卸载到边缘或云端 GPU 可提升任务成功率、响应速度和精度。
NVIDIA 于 9 月 22-23 日在新加坡举办 AI Day,与合作伙伴展示东南亚地区的 AI 进展。
NVIDIA 在多伦多 ROSCon 大会上发布 Isaac ROS 5.0,新增面向智能体的工作流、Isaac skills 和对 ROS Lyrical 与 Ubuntu 24.04 的支持。
NVIDIA 指出 Physical AI 规模化部署需要贯穿硬件、软件、AI 与运行环境全生命周期的安全体系,并推出 Halos——首个也是唯一的 Physical AI 全栈安全系统。
Google 在 CHI 2026 发表研究原型 AgentHands,为 XR 中的 AI 智能体生成与语音同步的手势,使对话具备空间 grounding。系统通过眼动注视与场景重建注册物体 3D 边界框,由后端 LLM 在回复中内嵌 GestureEvents,并在头显端用词级时间戳与 TTS 同步播放动画。
Google DeepMind 发布 Gemini Robotics ER 2,定位为机器人的高层具身推理大脑,可编排 VLA 模型、导航 API 等底层工具完成多步任务。
推荐理由:官方发布详细列出了视频理解、进度追踪、多机协作的量化指标与获取入口,读者可据此评估机器人任务编排能力的变化。
Google DeepMind 发布 Gemini Robotics 2,包含 VLA 模型 Gemini Robotics 2、具身推理模型 Gemini Robotics ER 2 和端侧模型 Gemini Robotics On-Device 2,实现全身控制、精细操作和多机器人协作。
推荐理由:官方发布同时给出三个模型的分工、适配速度数字和安全基准,读者可以据此评估具身智能模型进入全身控制和多机协作的实际进展。
NVIDIA 发布 Cosmos-H-Dreams,一个动作条件驱动的手术机器人实时生成式仿真器,将 Cosmos-H-Surgical-Simulator 蒸馏为因果、少步数的学生模型,并通过 FlashDreams 流式推理库在单张 NVIDIA RTX PRO 6000 上从约每秒10帧提升到约160帧的交互运行。
Pollen Robotics 发布开源低成本系统 Grabette,用手持夹爪录制操作任务并自动转成机器人可用的 LeRobot 数据集,无需机器人或遥操作设备。
Mistral AI 发布首款具身导航模型 Robostral Navigate,8B 参数,仅用单个 RGB 相机加自然语言指令即可自主导航,R2R-CE validation unseen 成功率 76.6%,validation seen 为 79.4%,比最佳单相机方案高 9.7 分,比最佳深度或多相机系统高 4.5 分。
LeRobot v0.6.0 发布,引入 VLA-JEPA、FastWAM、LingBot-VA 三种会预测未来的世界模型策略,新增 GR00T N1.7、MolmoAct2、EO-1 等多个 VLA,以及统一奖励模型 API(Robometer、TOPReward)。
推荐理由:官方发布页完整列出各项新能力与配套工具,读者可以据此评估这次版本更新对机器人学习工作流的实际影响。
Google DeepMind 推出 Google DeepMind Accelerator: Robotics 项目,从欧洲选出 15 家早期机器人初创公司,于伦敦启动为期 3 个月的密集辅导和技术支持。
Reachy Mini 对话应用现在可以通过 MCP 调用托管在公开 Hugging Face Spaces 上的远程工具,无需修改应用即可为机器人添加查天气、搜索网页等新能力。
Mistral 收购工业仿真公司 Emmi AI,加码面向航空航天、汽车、半导体和能源等行业的 Physics AI 基础研究。
Berkeley AI Research 提出 GRASP,一种基于梯度的世界模型规划器,让长时程规划更稳定可靠。其核心做法有三点:把轨迹提升到虚拟状态使优化在时间上并行、在状态迭代中直接引入随机性以实现探索、重塑梯度让动作获得干净的信号并避开脆弱的“状态-输入”梯度。
Google DeepMind 发布 Gemini Robotics-ER 1.6,面向机器人的具身推理模型,在指向、计数、成功检测等空间与物理推理上较 Gemini Robotics-ER 1.5 和 Gemini 3.0 Flash 明显提升,并新增仪表读取能力,可解读压力表和视镜。
Hugging Face LeRobot 发布 v0.5.0,合并超过 200 个 PR、新增 50 多位贡献者。
推荐理由:官方完整发布说明覆盖硬件、策略、数据集和代码库四大方向,读者可据此评估升级对机器人训练与部署的实际影响。
NXP 发布实践指南,讲解如何在嵌入式机器人平台上录制可靠数据集并微调 ACT 与 SmolVLA 等 VLA 策略,并展示 NXP i.MX 95 SoC 优化后的实时性能。
Google DeepMind 发布 SIMA 2,将 Gemini 模型嵌入智能体核心,使其从跟随指令进化为能思考目标、与用户对话并自我改进的通用游戏智能体。
推荐理由:官方介绍 SIMA 2 如何借 Gemini 从执行指令走向推理与自改进,读者可了解具身智能体训练路径。
NVIDIA Isaac for Healthcare v0.4 提供 SO-ARM 入门工作流,帮助开发者构建自主手术助理机器人,覆盖数据采集、训练与部署全流程。
NVIDIA 推出的 Isaac for Healthcare v0.4 提供 SO-ARM 起始工作流,可端到端构建自主手术辅助机器人:用 SO-ARM101 和 LeRobot 采集仿真与真实遥操作数据,post-train GR00T N1.5,在 Isaac Lab 评估后部署到真实硬件。
Hugging Face 团队发布 LeRobot v0.4.0,引入支持超过 400GB 数据集的 LeRobotDataset v3.0 分块格式与流式加载,并集成 Physical Intelligence 的 pi0、pi0.5 和 NVIDIA 的 GR00T N1.5 等 VLA 模型。
推荐理由:Hugging Face 官方详述 LeRobot v0.4.0 各项升级,读者可以据此评估新的数据格式、VLA 模型集成和硬件插件如何用于自己的机器人学习项目。
Hugging Face 发布 LeRobotDataset:v3,将多个 episode 合并到同一 Parquet 和 MP4 文件并通过关系型元数据检索,解决 v2 每集一文件在扩展到数百万 episode 时的文件系统瓶颈。
Hugging Face LeRobot 团队认为机器人泛化本质上是一个数据问题,正通过简化录制流程、简化上传至 Hugging Face Hub、降低硬件成本,让社区数据集快速增长。目前社区贡献主要集中在 So100 和 Koch 机械臂与操作任务,但自动驾驶、辅助机器人、移动导航等领域同样受益。随着数据采集大众化,数据策展成为下一个挑战。
Hugging Face 宣布收购开源机器人公司 Pollen Robotics,这是其第五次收购,将开售旗舰人形机器人 Reachy 2,售价 $70,000,已用于 Cornell 和 Carnegie Mellon 等实验室。
推荐理由:官方宣布收购开源机器人公司并开放 Reachy 2 订购,读者可据此了解 Hugging Face 从软件平台走向机器人硬件的路线。
NVIDIA 在 GTC 2025 上发布三项面向物理 AI 的开源资源:70 亿参数的 Cosmos Transfer 世界基础模型、含超过 32 万条轨迹共 15 TB 数据的 Physical AI Dataset,以及首个开放的人形机器人推理与技能基础模型 NVIDIA Isaac GR00T N1。
推荐理由:官方一次放出 Cosmos Transfer、开放数据集和 GR00T N1 三项资源,开发者可直接获取模型权重与数据用于机器人和自动驾驶研发。
Yaak 与 LeRobot 团队发布开源自驾数据集 L2D(Learning to Drive),R4 版含 100 万个 episode、5000+ 小时驾驶、90+ TB 多模态数据,采集自德国 30 个城市的 60 辆驾校电动车。
Hugging Face 宣布将 Physical Intelligence 开发的 π0 和 π0-FAST 视觉-语言-动作(VLA)机器人基础模型移植到 LeRobot 仓库。
Hugging Face LeRobot 团队提出 LeRobotDataset 格式,用视频编码存储机器人数据集的视觉模态,数据集平均仅为其原大小的 14%(最佳情况可达 0.2%),且保持完整训练能力。解码方面,单帧加载时间与 PNG 压缩图像相当,解码多连续帧时仅为 PNG 加载时间的 25%-50%。该格式轻量、易分享(与 Hub 原生集成)并配有在线可视化工具。
开源人形机器人 Reachy 的开发商 Pollen Robotics 发布开源库 pollen-vision,提供面向机器人的零样本视觉模型统一接口,无需训练即可开箱使用。