人类咖啡师 VS 具身咖啡师,你会怎么选?

同样一杯咖啡。
一杯来自经验丰富的人类咖啡师,另一杯来自一台不休息、不走神、还能连续工作的具身机器人。
你会选择哪一杯?
人类咖啡师,是怎么做好一杯咖啡的?
取下手柄、接粉、布粉、压粉,锁紧手柄;放好杯子,启动萃取;咖啡完成后取杯出品,再清理咖啡渣、冲洗手柄、将器具归位。
看似短短几分钟,背后却是一连串的观察和判断:
杯子放正了吗?手柄对准了吗?咖啡粉压实了吗?上一杯留下的咖啡渣清理干净了吗?
熟练的咖啡师,可以把这些动作做得行云流水。
但如果让他连续做 100 杯呢?
手会酸,人会累,注意力也会下降。毕竟,人不是机器。
于是,我们决定把这套完整的咖啡制作流程,教给一位不会累的“新同事”。
怎么教机器人做咖啡?
答案不是给机械臂写一份几十页的操作说明书,也不是为每一个动作设置一组固定坐标。
我们更像是在给它上“咖啡师实操课”。
第一步,是采集数据。
人类先在真实的咖啡机和器具前完成操作示范。系统同步记录机器人“看到了什么”和“应该怎么动”:相机画面、任务指令、机械臂的位置、运动轨迹以及抓取和放置动作,都会成为训练数据。
一条数据,就是一次完整或局部的操作示范。机器人要从这些示范里逐渐理解:看到手柄时应该怎样抓取,看到咖啡机时应该怎样对准,完成萃取后又该进入哪个步骤。
第二步,是训练模型。
我们使用少量真实操作数据,对自研 VLA 模型进行微调。VLA 分别代表视觉、语言和动作,它要解决的核心问题是:
“我看到了什么?”
“现在要完成什么任务?”
“下一步应该怎么动?”
经过训练后,模型会把画面、任务和动作联系起来。机器人不再只是机械地执行固定坐标,而是根据眼前的环境,预测下一步应该采取的动作。
第三步,是上机考试。
模型训练完成,并不意味着机器人立刻就能成为咖啡师。我们还要让它在真实设备上反复操作。
杯子稍微放偏了怎么办?手柄的位置发生变化怎么办?某一步动作没有完全做到位怎么办?
每一次失败,都会暴露新的问题。我们再补充对应的数据、调整训练内容、重新微调模型,让机器人逐渐学会应对真实环境中的变化。
这个过程可以简单概括为:
人类示范 → 数据采集 → 模型训练 → 真机测试 → 补充数据 → 再次训练。
经过不断迭代,原本分散的抓取、移动、接粉、压粉、萃取、出杯和清洁动作,最终被一个模型串成了一项完整的长程任务。
让机器人完成一个动作,并不稀奇。
真正困难的是:让它知道自己做到了哪一步,下一步该做什么,并且从第一步一直稳定执行到最后一步。

第 101 杯,它仍然不会累
在 WRC 2026 现场,这位具身咖啡师平均每天出杯超过 100 杯,累计制作超过 400 杯,是现场连续运行时间最长、出杯数量最多的咖啡项目。
它做一杯咖啡的时间与人类咖啡师相近。
但人类做完 100 杯,可能只想坐下来休息;它做完 100 杯,只会安静地开始第 101 杯。
有观众看完后评价:
“别的咖啡机器人都不动,只有你们的一直在做,而且和人做咖啡一样。”
所以,人类咖啡师与具身咖啡师,到底谁赢了?
如果你想要交流、创意和一杯带有个人风格的咖啡,人类咖啡师依然无可替代。
但如果你需要稳定地连续出杯,不疲惫、不走神、不间断,具身咖啡师正在展现另一种可能。
它不一定比人更快,却可以像人一样完整地做好一杯咖啡。
然后,一直做下去。
现在,面对吧台上的这两杯咖啡——要不要试试具身咖啡师做的?
