Figure 03 最值得看的地方,不是“相机更多、触觉更灵敏”这些参数本身,而是 Figure 正在把视觉、近距离手部反馈、触觉和数据回传绑成同一条闭环。对做 humanoid 的团队来说,这件事的启发很直接:感知系统不能只回答“看见了什么”,还要能支撑抓取前的最后确认、接触后的滑移判断、失败后的数据回放,以及下一版策略该从哪里改。
这篇不是再写一遍 Figure 03 发布稿,也不把 Figure 的官方指标直接等同于成熟量产能力。它只抓一个工程问题:如果一台 humanoid 要从演示走向家庭、物流或工厂里的连续任务,感知和触觉该承担哪些责任,哪些指标看起来漂亮但还不能证明系统真的闭环。
先给结论
Figure 03 的感知升级可以拆成四层:主视觉给全局和操作视野,掌心相机补抓取近场盲区,触觉传感器判断接触和滑移,10 Gbps mmWave 数据卸载把失败样本带回训练与复盘链路。单看任意一层,都容易被写成参数新闻;合在一起看,它更像一套为 Helix 和 fleet learning 准备的感知闭环。
真正要问的不是“Figure 03 的相机是不是更好”,而是:
- 主相机被遮挡时,手部近场反馈能不能继续支撑动作修正?
- 物体已经接触后,系统能不能区分“夹住了”和“快滑了”?
- 一次失败能不能被回放成可训练、可标注、可归因的数据,而不是只剩一段视频?
- 更高频、更低延迟的视觉流,会不会被控制、日志、算力和数据管线吃掉收益?
Figure 03 官方披露了哪些感知信号
Figure 在 Introducing Figure 03 中说,Figure 03 为 Helix 重新设计了 sensory suite 和 hand system。官方给出的关键信号包括:
- 下一代视觉系统面向 high-frequency visuomotor control。
- 新相机架构提供 2 倍帧率、四分之一延迟,以及每个相机 60% 更宽视场。
- 每只手集成掌心相机,用于抓取过程里的近距离、低延迟视觉反馈。
- 手指采用更柔顺的指尖和第一代内部开发触觉传感器。
- 每个指尖传感器可检测小到 3 克压力的力信号,用于区分稳定抓取和即将滑移。
- 整机支持 10 Gbps mmWave 数据卸载,用于 fleet 数据回传和持续学习。
这些指标不能孤立看。对 humanoid 来说,视觉、手部近场、触觉和数据回传分别对应四个不同问题:看得见、抓得稳、知道自己快失败了、失败后能复盘。缺任何一层,系统都可能只是在 demo 里显得聪明。
| 你先看到的 Figure 03 信号 | 第一判断层 | 先找哪些证据 | 今天先不要得出什么结论 |
|---|---|---|---|
| 主相机帧率更高、延迟更低、视场更宽 | 视觉到控制的闭环预算 | 端到端延迟、重观察频率、动作修正时刻、遮挡后恢复时间 | 不要只用相机参数证明操作能力已经稳定 |
| 手掌加入近距离相机 | 抓取末端盲区补偿 | 柜内、袋装物、遮挡场景下的最后 5 厘米轨迹和抓取成功率 | 不要把掌心相机当成主视觉的简单备份 |
| 指尖更柔顺,接触面积更大 | 机械接触和控制策略共同边界 | 接触面积、物体形变、夹持力变化、重复抓取后的表面磨损 | 不要把“更柔软”直接等同于“更安全”或“更会抓” |
| 触觉传感器能检测 3 克压力 | 接触状态与滑移预判 | 滑移前信号、阈值标定、误报 / 漏报、不同材质上的稳定性 | 不要只看灵敏度数字,忽略耐久、标定和长期漂移 |
| 10 Gbps mmWave 数据卸载 | fleet learning 与失败回放链路 | 上传触发条件、数据切片粒度、失败标签、版本对齐、隐私边界 | 不要把带宽当成学习闭环已经成立的证据 |
为什么掌心相机比“多一个相机”更重要
在 humanoid 操作里,最麻烦的很多失败发生在主相机已经不再好用的时候:手伸进柜子、身体挡住视线、物体被手掌遮住、袋子和布料发生形变,或者目标进入最后几厘米的接触阶段。这个时候,主视觉看到的是“动作差不多到了”,但手端真实接触可能已经偏了。
掌心相机的价值不在于替代头部或躯干相机,而是在抓取末端给系统多一个近场观察入口。它应该回答的是:手指和物体之间现在到底发生了什么,目标是不是被手自己遮住了,接触面是不是正在偏离,下一步是继续闭合、微调姿态,还是放弃重抓。
如果你在做自己的 humanoid 项目,别急着照抄“手上也放相机”。更实际的顺序是先找出你的失败盲区:是主视觉遮挡,还是手眼标定漂,还是末端轨迹不准,还是接触反馈缺失。只有当失败真的集中在近场不可见和最后接触阶段时,手端相机才是高优先级。
触觉不是让手变聪明的魔法
Figure 说其第一代触觉传感器以耐久、长期可靠性和高保真感知为原则,并能检测小到 3 克压力。这个指标很吸引人,但工程上更该追问三件事。
第一,触觉信号能不能稳定映射到动作决策。系统不是为了记录压力而记录压力,而是为了判断该不该继续闭合、减小力、调整姿态、重抓或放弃。
第二,触觉能不能和视觉、关节电流、指尖几何一起对齐。一个软袋被抓住时,视觉可能看起来成功,电流可能还没报警,但触觉已经能看出滑移趋势;反过来,触觉误报也可能让策略过早放弃。
第三,触觉传感器是否能在真实使用里保持一致。家用和物流场景里会有灰尘、磨损、冲击、温度变化、软硬物混杂和长时间重复接触。只谈灵敏度,不谈漂移、耐久、标定和更换成本,很容易把触觉写成假成熟。
| 如果你在做自己的 humanoid 手部感知 | 先设的 gate | 最低验证方式 | 先不要做什么 |
|---|---|---|---|
| 主视觉经常被手或物体遮挡 | 近场观察是否真的改变动作结果 | 同一批遮挡任务,对比有无手端视角的重抓次数和失败类型 | 不要只为了覆盖视角盲区堆更多相机 |
| 抓住后一抬就滑 | 滑移信号是否早于失败出现 | 记录滑移前 0.5 到 2 秒的触觉、电流、视觉和姿态变化 | 不要先盲目加夹持力或换更硬指尖 |
| 不同材质物体表现差异很大 | 触觉阈值是否按材质和形变分桶 | 硬盒、薄袋、布料、低摩擦件分别跑重复抓取和误判统计 | 不要用单一阈值覆盖所有物体 |
| demo 能看,长测后信号漂 | 传感器稳定性和可维护性 | 连续抓取后复测零点、噪声、接触响应和更换校准时间 | 不要在没有漂移数据前宣布触觉方案可产品化 |
| 失败视频很多,但策略不知道怎么改 | 数据回放是否能对齐接触事件 | 把视频、触觉、关节、电流、任务状态对齐到同一条时间线 | 不要只保存成功片段,也不要把失败留成会议印象 |
10 Gbps 数据卸载说明了什么
Figure 把 10 Gbps mmWave 数据卸载放在 Figure 03 的 Helix 设计里,这个细节很重要。因为如果一台机器人要靠 fleet learning 持续变好,它必须把现场数据带回来,而且最好不是靠工程师手动拷盘、临时挑视频、事后凭印象标注。
但带宽只是入口,不是闭环。真正的闭环还需要知道哪些片段该上传,失败如何自动切片,触觉和视觉如何对齐,任务版本和模型版本如何记录,哪些家庭或商业数据不能进入训练池。没有这些,10 Gbps 只能说明“传得快”,不能说明“学得对”。
对小团队来说,没必要一开始就追 10 Gbps mmWave。更现实的第一步是把失败事件切片做好:每次抓取失败前后 5 秒,保存主相机、手端相机或等价近场视角、关节状态、指尖或夹爪反馈、任务 ID、软件版本和人工接管标记。哪怕带宽不高,只要失败包结构稳定,迭代速度也会明显提高。
和 Helix 的关系:感知升级最终要服务动作
Helix 的核心不是“看懂世界”这么简单。Figure 在 Helix 文章里把它描述成 System 2 和 System 1 的组合:System 2 负责较慢的场景理解和语言理解,System 1 负责更快的 visuomotor action。Figure 03 的高频低延迟视觉、掌心相机和触觉,最终都要服务这条从感知到动作的路径。
这也是为什么本文不把 Figure 03 的感知升级写成摄像头清单。对 humanoid 来说,感知系统一旦离开动作闭环,就会滑成“看起来信息更多”;只有当它能改变抓取、避障、重观察、接管和训练回流,它才真正算工程资产。
这篇该怎么读
如果你是在跟 Figure 进展,今天可以把 Figure 03 的感知和触觉看成电池、BotQ、家庭场景之外的另一条底层线:Figure 不只在做一个更漂亮的本体,而是在为 Helix、家庭任务、商业抓取和 fleet learning 补传感、接触和数据接口。
如果你是在做自己的机器人,今天先别问“要不要买同款相机、同款触觉”。先问你的系统失败是不是集中在视觉遮挡、近场接触、滑移预判、数据回放这四类问题上。如果不是,盲目堆传感器只会让标定、同步、带宽和维护成本一起上涨。
延伸阅读
- Figure 03 电池说明了什么:人形机器人续航、安全和快充不是一个参数问题
- Figure Helix 是什么:VLA、全身控制和家务机器人的工程拆解
- 人形机器人灵巧手怎么做原型:从欠驱动抓取、接触反馈到维护回放
- 人形机器人视觉系统怎么搭:从相机布局、标定到低延迟闭环的实作指南