Embodied AI Daily具身智能科研日报 试用版
DAILY BRIEF 2026.09.19 · UTC+8

具身智能日报

从 Figure 的家庭泛化读到 Index 数据,再从社区博客追到机器人编程评测。

回溯试刊

生成于 2026-09-22 14:25(UTC+8)。可匿名反馈;同一浏览器内可修改或撤回。

查看往期 ↗

近 7 天延伸阅读

01BlogFigure · 官方博客

Helix 2.5: Zero-Shot 30-Home Generalization

Figure Helix 2.5 官方文章封面
Helix 2.5 · 官方封面 · 图源:Figure · 官方博客

Figure 展示 Helix 2.5 在 30 个未见家庭中的整理、叠毛巾和铺床任务,并将泛化能力与 Index 人类行为数据预训练联系起来。

人类视频家庭泛化
WHY IT MATTERS

值得追问人类数据究竟改善了视觉泛化还是动作先验;评估时要分清新环境泛化与新任务泛化。

问题与做法

家庭布局和物体差异会让机器人在训练场景中学到的技能失效。Figure 的路线是先用 Index 人类行为数据预训练,再用机器人数据适配整理玩具、叠毛巾、铺床三类行为,最后进入未见住宅测试。

技术变化

重点是将行为训练与具体住宅解耦:每项任务在 30 个家庭共用一个固定模型,不针对测试住宅调整权重。所谓零样本泛化针对环境和物体,而不是从未训练过这些任务。

结果与结论

Figure 报告,Helix 2.5 使用前代一半的适配数据,达到相当的成功率,同时迁移到未见家庭;还在模型大小与下游训练固定时,将预训练数据扩大 8 倍,观察到动作预测误差规律性下降。这支持人类数据有助迁移,但不等于已证明任意家务或模型规模的通用扩展规律。

阅读边界:公司自述与演示,未独立复现实验;不是 9 月 19 日的新发布。

顺着引用继续读
  • Introducing Index

    原博客明确链接的数据项目;2026-08-25 的背景材料。Figure 专有采集体系,不等于公开可下载数据集。

阅读原文
02BlogZunnan Xu · HF 社区作者

From Coding Agents to Physical Agents: Code as a New Interface Between AI and the Physical World

通过策略代码连接感知与控制接口的桌面操作示意图
代码如何连接感知与控制 · 原文示意图 · 图源:Zunnan Xu · HF 社区作者

这篇社区文章从代码作为策略、世界表示和工具接口的角度,梳理编程 Agent 如何进入物理任务。

编程 Agent机器人评测
WHY IT MATTERS

对小组更有用的问题是:Agent 能否根据实验反馈修改工具与训练流程,而不仅是生成一次动作指令。

核心问题

机器人能否像编程助手一样,先写程序、执行、观察失败,再修改程序?文章用搬积木说明:程序调用定位、抓取和放置接口,并加入“是否可达”“是否抓住”的条件检查。

主要观点

作者把代码作为连接模型与物理系统的中间表示:它能显式表达分支和重试,也能组合感知、规划、控制模块。文章进一步把这套思路串到场景构建、可编程世界模型和编辑流程,贡献主要是研究路线梳理。

结论与边界

是否成功取决于模型与接口共同承担了多少工作:调用完整抓取技能,与自行决定末端轨迹,并不是同等难度。代码可读也不代表底层控制可靠。本文没有给出一个统一的新模型或综合性能提升,价值在于提出可检验的接口与反馈问题。

阅读边界:这是作者观点梳理,不是 Hugging Face / LeRobot 官方成果发布,也不是统一实验证据。

顺着引用继续读
  • awesome-code-as-x

    文章明确链接的作者资源清单;仅延伸阅读,不新增 GitHub 采集仓库。

  • Introducing RLE-Bench

    由文章所链接的 RLE-Bench 项目页追到团队博客,标注更新于 2026-09-09。覆盖交互控制、策略开发、感知与机械设计;这是旧背景,不算本日新动态。

阅读原文

论文补充

03PaperarXiv

Prioritized Rollouts for Efficient World Model-based Vision-Language-Action Policy Optimization

U-GROW 用策略不确定性选择更值得展开世界模型推演的状态。

机器人学习
WHY IT MATTERS

可检查有限算力下,将推演预算集中到关键状态是否比均匀采样更有效。

问题与创新

世界模型能替机器人生成训练经历,但大量推演本身也耗算力。U-GROW 不平均分配推演,而是优先从策略拿不准、可能影响任务成败的状态出发。创新点在推演起点的选择,而非重做策略优化目标。

方法

方法通过改变去噪步数后动作预测是否一致来估计不确定性,剔除难以恢复的失败尾段,再混合优先采样和均匀采样。保留均匀部分是为了兼顾状态覆盖,避免训练只围绕少数困难位置。

实验结论

论文表 1 中,与使用相同世界模型及推演预算的 VLA-MBPO 相比,RoboTwin 四项任务平均成功率从 54.3% 到 58.8%(+4.5 个百分点),LIBERO 从 87.7% 到 89.1%(+1.4 个百分点)。证据支持更有效地分配推演预算;不直接等于实际训练时间同比下降。

阅读边界:已补读论文方法与实验章节;以上数值及结论为作者报告,未运行代码或独立复现实验。

作者信息

Yifei Sheng · Haoxiang Ren · Zhilong Zhang · Haonan Wang · Runjie Xu · Yihao Sun · Nan Tang · Zhichao Wu · Lei Yuan · Haoxin Lin · Yang Yu

阅读原文