DAILY BRIEF 2026.09.19 · UTC+8
具身智能日报
从 Figure 的家庭泛化读到 Index 数据,再从社区博客追到机器人编程评测。
回溯试刊生成于 2026-09-22 14:25(UTC+8)。可匿名反馈;同一浏览器内可修改或撤回。
查看往期 ↗
近 7 天延伸阅读
01BlogFigure · 官方博客
Helix 2.5 · 官方封面 · 图源:Figure · 官方博客 · 图片暂不可用,可查看原站
Figure 展示 Helix 2.5 在 30 个未见家庭中的整理、叠毛巾和铺床任务,并将泛化能力与 Index 人类行为数据预训练联系起来。
人类视频家庭泛化
WHY IT MATTERS值得追问人类数据究竟改善了视觉泛化还是动作先验;评估时要分清新环境泛化与新任务泛化。
问题与做法
家庭布局和物体差异会让机器人在训练场景中学到的技能失效。Figure 的路线是先用 Index 人类行为数据预训练,再用机器人数据适配整理玩具、叠毛巾、铺床三类行为,最后进入未见住宅测试。
技术变化
重点是将行为训练与具体住宅解耦:每项任务在 30 个家庭共用一个固定模型,不针对测试住宅调整权重。所谓零样本泛化针对环境和物体,而不是从未训练过这些任务。
结果与结论
Figure 报告,Helix 2.5 使用前代一半的适配数据,达到相当的成功率,同时迁移到未见家庭;还在模型大小与下游训练固定时,将预训练数据扩大 8 倍,观察到动作预测误差规律性下降。这支持人类数据有助迁移,但不等于已证明任意家务或模型规模的通用扩展规律。
阅读边界:公司自述与演示,未独立复现实验;不是 9 月 19 日的新发布。
依据:发布方原文
阅读原文 ↗
02BlogZunnan Xu · HF 社区作者
代码如何连接感知与控制 · 原文示意图 · 图源:Zunnan Xu · HF 社区作者 · 图片暂不可用,可查看原站
这篇社区文章从代码作为策略、世界表示和工具接口的角度,梳理编程 Agent 如何进入物理任务。
编程 Agent机器人评测
WHY IT MATTERS对小组更有用的问题是:Agent 能否根据实验反馈修改工具与训练流程,而不仅是生成一次动作指令。
核心问题
机器人能否像编程助手一样,先写程序、执行、观察失败,再修改程序?文章用搬积木说明:程序调用定位、抓取和放置接口,并加入“是否可达”“是否抓住”的条件检查。
主要观点
作者把代码作为连接模型与物理系统的中间表示:它能显式表达分支和重试,也能组合感知、规划、控制模块。文章进一步把这套思路串到场景构建、可编程世界模型和编辑流程,贡献主要是研究路线梳理。
结论与边界
是否成功取决于模型与接口共同承担了多少工作:调用完整抓取技能,与自行决定末端轨迹,并不是同等难度。代码可读也不代表底层控制可靠。本文没有给出一个统一的新模型或综合性能提升,价值在于提出可检验的接口与反馈问题。
阅读边界:这是作者观点梳理,不是 Hugging Face / LeRobot 官方成果发布,也不是统一实验证据。
依据:发布方原文
阅读原文 ↗
论文补充
03PaperarXiv
U-GROW 用策略不确定性选择更值得展开世界模型推演的状态。
机器人学习
WHY IT MATTERS可检查有限算力下,将推演预算集中到关键状态是否比均匀采样更有效。
问题与创新
世界模型能替机器人生成训练经历,但大量推演本身也耗算力。U-GROW 不平均分配推演,而是优先从策略拿不准、可能影响任务成败的状态出发。创新点在推演起点的选择,而非重做策略优化目标。
方法
方法通过改变去噪步数后动作预测是否一致来估计不确定性,剔除难以恢复的失败尾段,再混合优先采样和均匀采样。保留均匀部分是为了兼顾状态覆盖,避免训练只围绕少数困难位置。
实验结论
论文表 1 中,与使用相同世界模型及推演预算的 VLA-MBPO 相比,RoboTwin 四项任务平均成功率从 54.3% 到 58.8%(+4.5 个百分点),LIBERO 从 87.7% 到 89.1%(+1.4 个百分点)。证据支持更有效地分配推演预算;不直接等于实际训练时间同比下降。
阅读边界:已补读论文方法与实验章节;以上数值及结论为作者报告,未运行代码或独立复现实验。
依据:方法与实验原文 · arXiv v1
作者信息 +
Yifei Sheng · Haoxiang Ren · Zhilong Zhang · Haonan Wang · Runjie Xu · Yihao Sun · Nan Tang · Zhichao Wu · Lei Yuan · Haoxin Lin · Yang Yu
阅读原文 ↗