折了 785 件没见过的衣服,只错 7 次——苦涩的教训终于收走了机器人这一局
ACT-2 Preview: Generalizing Reliability
Sunday Robotics 在 7 月放出了家用机器人基座模型 ACT-2 的预览,成绩很扎眼:785 次自主折衣,成功 778 次,成功率 99.1%,覆盖 9 类衣物、XXS 到 8XL 的尺码,衣服堆在床上、装在筐里、掉在地上都算。关键在后半句:评测全部在没见过的房子里做,用的是同一份权重,每进一个新家零适配——不采数据、不补演示、不做任何针对性微调。
值得读的不是这个成功率,厂商自己报的成功率永远该打折扣,这个也一样。值得读的是他们顺手做的那组消融实验:把预训练数据从零加到满,实验室里的成绩和真实家里的成绩之间那道差距,从 82 个百分点一路掉到 0。机器人一直是「苦涩的教训」最大的反例——第 1 篇里 Sutton 说规模终将压倒人工设计,可机器人没有互联网那样现成的数据源,学会的东西一出实验室就不管用。这是第一次有人把「规模能不能解决机器人的泛化」画成了一条能看的曲线。而一个月前,Anthropic 从完全不同的方向撞上了同一个结论。
泛化差距是怎么被填平的
机器人学习里有个老问题:拿实验室采的数据做后训练(post-training,在预训练模型之上用少量针对性数据继续训练),模型在采数据的那个环境里会变得很可靠,换个房间就崩。Sunday 把它量化成「泛化差距」:同一套后训练之后,见过的环境成功率减去没见过的环境成功率。
他们固定后训练流程,只改预训练数据量,每档背后是 50 次真机评测。完全不预训练时,见过的环境 96%,没见过的只有 14%,差距 82 个百分点;数据给到 12%,差距降到 10;25% 降到 8;50% 降到 4;全部用上,两边都是 100%,差距归零。这条曲线的实际含义是:差距一旦为零,实验室成绩就可以当真实世界成绩用,团队能在自己屋里快速迭代,不必每改一次都跑去别人家验证——研发速度的瓶颈就此挪了位置。另一组对照同样值得注意:同样的数据量,按质量筛过的子集和随机抽的差得离谱——12.5% 那一档,高质量筛选 75.6%,均匀抽样只有 43.8%。
一条示范就能教会一种新折法
更激进的结论在后面。他们把同一个预训练模型复制四份,每份只喂一条示范——一条,各讲一种不同的折衣手法——做最普通的监督微调,再拿一件训练里没出现过的衣服去考。四个模型都把各自新学的手法做了出来。据作者所知,这是第一次有端到端模型能从单条示范里学会新行为,并把它泛化到没见过的环境。这个转折在语言模型那边发生过:GPT-1 还得为每个任务专门微调,到了 GPT-3 给几个例子就能干,Sunday 引的正是这条类比。产业含义很直接:学一个新行为的边际成本从「采几百条数据」掉到「演示一遍」,机器人公司的成本结构就换了一个量级。
他们给自己划的边界,比成绩更值得抄
这篇最该被同行拿走的其实是评测方法。Sunday 提了一个叫 Solve 的标准,要求任何机器人成果同时报三样东西:性能(成功率、质量、速度)、范围(成绩在多大的环境和物体分布上成立)、适配成本(每换一个部署点还要补多少数据、演示、微调和人工干预)。理由很直白:在一个房间、一件准备好的衣服上做到 99.1%,和在没见过的家里零适配做到 99.1%,是完全不同的两件事,报出来却是同一个数字。演示视频之所以无法比较、无法累积,正是因为条件从来没被写清楚过。
他们照这个标准把自己框住了。范围事先声明:只算常规会折的衣物,袜子、内衣、配饰明确排除,因为那些本来就不是拿来折的。评分规则也事先锁定、事后不改:五星起评,多折进两英寸以上、对应边错位超两英寸、袖子裤腿露在外面、叠上去歪出三分之一,各扣一星;每次先由一名标注员打分,再由另一人独立复核。778 次成功折叠平均 4.72 星,98.3% 拿到四星以上,单件中位耗时 2 分 13 秒。表现最差的是雪纺衬衫,94.7%——太软太易变形,抓握和对齐找不到稳定的几何特征。
另一边:一只机器狗,9 分 35 秒
一个月前 Anthropic 的 Frontier Red Team 发了 Project Fetch 二期,路径完全不同,结论撞在一起。2025 年 8 月的一期实验里,他们让不懂机器人的员工分两队去操作一只现成的四足机器狗——连上摄像头和激光雷达、写控制程序、检测沙滩球——一队能用 Claude Opus 4.1,一队只能靠互联网和自己,前者明显更快。当时他们也试过让模型自己干,Opus 4.1 连「怎么连上机器狗」都过不去。
二期让 Opus 4.7 单干。两队人都完成过的那四项任务,无 Claude 组花了 361 分钟,Claude 组 181 分钟,Opus 4.7 用了 9 分 35 秒,分别快 37.7 倍和 18.9 倍。人只剩三件事:把跑着 Claude Code 的笔记本插到机器狗上、输初始提示、批准命令。代码量也反了过来:Claude 组写了 10,309 行,模型自己只写 1,045 行,效果还更好。Anthropic 特意补了一句:这些进步不是为提升机器人能力专门做的,和 LLM 历史上的很多进步一样,它们是从更一般的规模化里长出来的。失败的地方他们也照实说了:把沙滩球稳稳推回起点这步模型做不到——要不停感知球偏了多少、这一下和上一下什么关系、下一步怎么修,恰恰是人练几次就上手的闭环控制。
本文为 AKL AI Club 原创撰写的导读,不是原文翻译;著作权归原文作者所有。 篇目由编辑独立选取,来源均经人工核实。