AKL AI CLUB BETA ← 前沿导读
FRONTIER · 路线之争

折了 785 件没见过的衣服,只错 7 次——苦涩的教训终于收走了机器人这一局

ACT-2 Preview: Generalizing Reliability

Sunday Robotics 团队 两位创始人分别是 ALOHA 的作者 Tony Zhao 和 Diffusion Policy 与 UMI 夹爪的作者 Cheng Chi——这几项工作是今天机器人模仿学习的通用底座 · 自研数据采集手套与家务机器人 Memo,从硬件、模型到车队数据全栈自己做,今年秋天进入家庭 Beta
2026 年 7 月
为什么选它第 1 篇「苦涩的教训」最大的反例一直是机器人:没有互联网级的数据源,规模化在这儿不灵。这篇把反例拆了——预训练一放大,实验室与真实家庭的泛化差距从 82 个百分点归零。附带那套叫 Solve 的报告规范,比 99.1% 更值得行业抄走。

Sunday Robotics 在 7 月放出了家用机器人基座模型 ACT-2 的预览,成绩很扎眼:785 次自主折衣,成功 778 次,成功率 99.1%,覆盖 9 类衣物、XXS 到 8XL 的尺码,衣服堆在床上、装在筐里、掉在地上都算。关键在后半句:评测全部在没见过的房子里做,用的是同一份权重,每进一个新家零适配——不采数据、不补演示、不做任何针对性微调。

值得读的不是这个成功率,厂商自己报的成功率永远该打折扣,这个也一样。值得读的是他们顺手做的那组消融实验:把预训练数据从零加到满,实验室里的成绩和真实家里的成绩之间那道差距,从 82 个百分点一路掉到 0。机器人一直是「苦涩的教训」最大的反例——第 1 篇里 Sutton 说规模终将压倒人工设计,可机器人没有互联网那样现成的数据源,学会的东西一出实验室就不管用。这是第一次有人把「规模能不能解决机器人的泛化」画成了一条能看的曲线。而一个月前,Anthropic 从完全不同的方向撞上了同一个结论。

泛化差距是怎么被填平的

机器人学习里有个老问题:拿实验室采的数据做后训练(post-training,在预训练模型之上用少量针对性数据继续训练),模型在采数据的那个环境里会变得很可靠,换个房间就崩。Sunday 把它量化成「泛化差距」:同一套后训练之后,见过的环境成功率减去没见过的环境成功率。

他们固定后训练流程,只改预训练数据量,每档背后是 50 次真机评测。完全不预训练时,见过的环境 96%,没见过的只有 14%,差距 82 个百分点;数据给到 12%,差距降到 10;25% 降到 8;50% 降到 4;全部用上,两边都是 100%,差距归零。这条曲线的实际含义是:差距一旦为零,实验室成绩就可以当真实世界成绩用,团队能在自己屋里快速迭代,不必每改一次都跑去别人家验证——研发速度的瓶颈就此挪了位置。另一组对照同样值得注意:同样的数据量,按质量筛过的子集和随机抽的差得离谱——12.5% 那一档,高质量筛选 75.6%,均匀抽样只有 43.8%。

一条示范就能教会一种新折法

更激进的结论在后面。他们把同一个预训练模型复制四份,每份只喂一条示范——一条,各讲一种不同的折衣手法——做最普通的监督微调,再拿一件训练里没出现过的衣服去考。四个模型都把各自新学的手法做了出来。据作者所知,这是第一次有端到端模型能从单条示范里学会新行为,并把它泛化到没见过的环境。这个转折在语言模型那边发生过:GPT-1 还得为每个任务专门微调,到了 GPT-3 给几个例子就能干,Sunday 引的正是这条类比。产业含义很直接:学一个新行为的边际成本从「采几百条数据」掉到「演示一遍」,机器人公司的成本结构就换了一个量级。

他们给自己划的边界,比成绩更值得抄

这篇最该被同行拿走的其实是评测方法。Sunday 提了一个叫 Solve 的标准,要求任何机器人成果同时报三样东西:性能(成功率、质量、速度)、范围(成绩在多大的环境和物体分布上成立)、适配成本(每换一个部署点还要补多少数据、演示、微调和人工干预)。理由很直白:在一个房间、一件准备好的衣服上做到 99.1%,和在没见过的家里零适配做到 99.1%,是完全不同的两件事,报出来却是同一个数字。演示视频之所以无法比较、无法累积,正是因为条件从来没被写清楚过。

他们照这个标准把自己框住了。范围事先声明:只算常规会折的衣物,袜子、内衣、配饰明确排除,因为那些本来就不是拿来折的。评分规则也事先锁定、事后不改:五星起评,多折进两英寸以上、对应边错位超两英寸、袖子裤腿露在外面、叠上去歪出三分之一,各扣一星;每次先由一名标注员打分,再由另一人独立复核。778 次成功折叠平均 4.72 星,98.3% 拿到四星以上,单件中位耗时 2 分 13 秒。表现最差的是雪纺衬衫,94.7%——太软太易变形,抓握和对齐找不到稳定的几何特征。

另一边:一只机器狗,9 分 35 秒

一个月前 Anthropic 的 Frontier Red Team 发了 Project Fetch 二期,路径完全不同,结论撞在一起。2025 年 8 月的一期实验里,他们让不懂机器人的员工分两队去操作一只现成的四足机器狗——连上摄像头和激光雷达、写控制程序、检测沙滩球——一队能用 Claude Opus 4.1,一队只能靠互联网和自己,前者明显更快。当时他们也试过让模型自己干,Opus 4.1 连「怎么连上机器狗」都过不去。

二期让 Opus 4.7 单干。两队人都完成过的那四项任务,无 Claude 组花了 361 分钟,Claude 组 181 分钟,Opus 4.7 用了 9 分 35 秒,分别快 37.7 倍和 18.9 倍。人只剩三件事:把跑着 Claude Code 的笔记本插到机器狗上、输初始提示、批准命令。代码量也反了过来:Claude 组写了 10,309 行,模型自己只写 1,045 行,效果还更好。Anthropic 特意补了一句:这些进步不是为提升机器人能力专门做的,和 LLM 历史上的很多进步一样,它们是从更一般的规模化里长出来的。失败的地方他们也照实说了:把沙滩球稳稳推回起点这步模型做不到——要不停感知球偏了多少、这一下和上一下什么关系、下一步怎么修,恰恰是人练几次就上手的闭环控制。

苦涩的教训确实在机器人上兑现了,但兑现的方式给这条教训打了个补丁。Sunday 不是把现成数据堆大就完事——他们先花了一年多造一副手套:让采集手套和机器人的手在几何与传感器布局上完全一致,人戴着它干活,数据就能直接当机器人数据用,再用一套 Skill Transform 把画面里的人手人臂抹掉换成机械臂。换句话说,在规模生效之前,先有人把「什么东西可以被规模化」这个问题用硬件解掉了。第 1 篇讲的是别跟规模作对,这两篇加起来讲的是另一半:你仍然要极其用力地设计出一种能被规模化的数据形态,然后才轮到规模替你把剩下的事做完。机器人缺的从来不是算力,是一个像互联网之于文本那样的数据源。真正该被抄走的是 Solve 那套报告规范:第 25 篇把「AI 能写多大的程序」从演示变成了可复现的考卷,第 22 篇讲怎么把「感觉变差了」变成能测的东西,Solve 是同一个动作在机器人领域的版本——不声明范围和适配成本,任何成功率都既无法比较也无法累积,而这个行业被剪辑过的演示视频拖了多少年,业内人都清楚。但我不建议现在就把 99.1% 当结论。这是一份自己出题、自己评分的成绩单:范围是他们自己划的,标注团队是自己的,没有第三方复现,785 次也算不上大样本。折衣还是他们挑出来的第一个任务,吸尘、拉拉链、煮咖啡都没经受同一套标准的检验——按他们自己的定义,那些还不算 Solve。秋天进家庭 Beta 之后,真实用户的长尾会给出更诚实的答案。Anthropic 那边的边界同样清楚:模型是在写代码驱动一台现成的机器人,属于「会用物理工具」,不是学会了底层运动控制;而唯一失手的推球任务,恰恰是最需要毫秒级闭环的那种。今天的模型已经能把物理世界当成一个可以调用的接口,还不能把它当成一双手。
机器人苦涩的教训预训练规模泛化具身智能
去读原文 本文是原创导读,不是原文翻译——真正的细节、证据和微妙之处都在原文里。 原文Sunday Robotics · ACT-2 Preview: Generalizing Reliability → 原文Anthropic Frontier Red Team · Project Fetch: Phase Two →

本文为 AKL AI Club 原创撰写的导读,不是原文翻译;著作权归原文作者所有。 篇目由编辑独立选取,来源均经人工核实。