橡鹿杨建成:从厨房出发,具身智能如何走向真实世界丨 WRC 演讲实录
首页 > 电商学院 > 汉潮快讯 > 橡鹿杨建成:从厨房出发,具身智能如何走向真实世界丨 WRC 演讲实录

橡鹿杨建成:从厨房出发,具身智能如何走向真实世界丨 WRC 演讲实录

0人阅读|发布时间:2026-08-26
导读:橡鹿机器人本次发布的多模态烹饪 AI 基座 CookingMuse 厨启、3K 视觉 AI 炒菜机器人和具身烹饪机器人现炒方舟,也因此不只是三款产品,而是一条从模型、感知到具身执行的完整路径。

来源:极客公园

当具身智能成为科技行业最受关注的方向之一,一个更难的问题开始浮现:机器人如何离开演示环境,进入充满噪声、变化与不确定性的真实世界?橡鹿机器人创始人、董事长杨建成选择从厨房回答这个问题。

厨房或许是具身智能最严苛、也最接近日常生活的考场:输入并不标准,过程快速变化,结果还带有强烈的主观性。橡鹿机器人本次发布的多模态烹饪 AI 基座 CookingMuse 厨启、3K 视觉 AI 炒菜机器人和具身烹饪机器人现炒方舟,也因此不只是三款产品,而是一条从模型、感知到具身执行的完整路径。

「真实世界不会为了机器变得标准。具身智能要做的,是看见变化、理解变化,并用行动把结果追回来。」杨建成在 2026 世界机器人大会(WRC)橡鹿机器人「看见」产品发布会上表示。以下为杨建成本次演讲实录:

具身智能的真正考题,不在演示场,而在真实世界

今天我们谈具身智能,常常先谈机器人能做什么动作、能完成多少任务。但我更关心另一个问题:当机器人真正离开实验室,进入一个每天都在变化的环境,它还能不能稳定地把事情做好?如果智能只能在被整理好的条件里成立,它就还没有真正走进生活。

真实世界不会为了机器变得标准。环境、材料、设备和人的需求都在变化。具身智能需要在变化中持续感知、理解、决策和执行,再根据结果重新调整。厨房之所以重要,是因为它把这些难题集中在一个高频、刚需、直接关系普通人生活的场景里。

今天讨论未来厨房,我想先从一个朴素的愿望说起:未来的厨房,不应该让人学习更多,而应该让人少为吃饭操心。橡鹿给自己定过一个目标——在五平方米的空间里,用五十分钟解决一家三口的一日三餐。

我们今天谈 AI,常常会谈参数、算力和模型,但对普通人来说,技术最终要落在一件件具体的小事上。吃饭就是其中最日常、也最复杂的一件事。一天三顿饭看起来普通,却牵涉时间、健康、口味、成本和家庭关系。谁能真正解决这件事,谁就真正进入了人的生活。

这背后有三层期待。第一,人不必再专门学习怎么做饭,技术应该把人类积累的烹饪经验接住;第二,人不一定要走进厨房,回家后的时间应该更多留给家人;第三,这件事不能太贵,只有普通家庭承担得起,才会成为真正普遍的生活方式。

过去是「家里有什么就吃什么」,后来是「想吃什么就点什么」,今天新的问题是「我应该吃什么」。孩子、老人、术后人群和上班族,需要的并不是同一顿饭。所以未来厨房真正要回答的,不是会做多少道菜,而是能不能为眼前这个人做出合适的一餐。

这三个条件缺一不可。如果只是把专业厨房里的复杂设备搬进家庭,用户仍然需要学习和操作;如果一套系统只能服务少数高端人群,也无法改变大多数人的生活。我们希望把复杂留在机器内部,把简单留给使用者。

设想回到家以后,只要给冰箱拍一张照片,系统就能识别现有食材,结合家人的年龄、口味和身体状况给出建议,再把饭做出来。过去的人工智能更多是在教人怎么做,未来的人工智能应该进一步帮助人把事情做好。

从「执行问题」到「理解问题」:自动化与智能化的分水岭

厨房首先揭示了自动化与智能化之间的差别。自动化擅长在固定条件下重复动作;智能化则要在输入发生偏差时,仍然理解目标并对结果负责。对具身智能来说,真正困难的从来不是「动起来」,而是知道为什么动、怎样动,以及动作以后世界发生了什么。

过去五年,我们一直在追问:一道菜明明有菜谱,为什么还是很难复刻?后来我们发现,菜谱记录的是步骤,真正决定味道的,却往往是没有被写下来的判断。什么时候下料、什么时候翻炒、什么时候收汁,老师傅依靠的是多年形成的经验。

很多人都有类似的感受:小时候记得妈妈做的一道菜,长大后即使找到相同食材、按照相同步骤操作,也很难得到完全相同的味道。因为真正起作用的,是她对食材状态的熟悉,以及在每一个细微节点上的选择。这些选择通常不会被写进菜谱。

这也是家乡味难以离开原来厨房的原因。酸度差一点、火候慢一点、食材状态变一点,最后的味道就会不同。连锁餐饮面对的难题同样如此:食材、环境和操作人员每天都在变化,只靠固定 SOP,很难让结果始终稳定。

比如同样是酸,不同地区和不同人群能够接受的程度完全不同;同样叫「收汁」,不同菜品需要的浓度、温度和时间也不同。烹饪语言里有大量这样的经验词,它们对厨师来说清楚,对机器来说却不够精确。

过去,行业把烹饪看作执行问题;我们认为,更难的是理解问题。机器不仅要完成动作,还要知道锅里正在发生什么、当前状态离目标还有多远,以及下一步应该怎样调整。

老师傅的经验如果只能留在一个人身上,就会随着人员流动而损失;一家门店做得好的味道,也很难稳定复制到另一家门店。我们希望解决的不只是效率问题,还包括经验如何保存、品牌味型如何延续,以及地方风味如何跨越空间。

真实门店里的波动每天都在发生:早晚批次的食材不同,新员工和熟练员工的操作不同,设备使用时间长了以后状态也会不同。传统管理往往要求现场尽量消除差异,而 AI 需要进一步做到识别差异、理解差异,并主动修正差异。

因此,具身智能进入真实世界的第一道门槛,是把对环境的理解放进执行过程。机器不能等任务完成以后才发现结果不对,而要在过程中识别偏差、判断原因并主动修正。只有从执行预设走向理解变化,机器人才能承担真正的现场工作。

从「汁水合一」到精确动作:具身智能必须建立连续闭环

具身智能与只在数字世界中生成答案的 AI 不同。它作出的每一次判断,都会通过身体改变物理环境;改变后的环境又会成为下一次判断的输入。因此,它面对的不是一次性问答,而是一条持续发生、彼此影响的时间链。

厨房有高油、高盐、高湿和高温,变化又发生得非常快。更重要的是,「好吃」没有唯一答案。同一道菜,不同地区、不同人群可能有完全不同的标准。模型不仅要认识食材,还要理解味型、火候和人的偏好。

真实厨房里的变量远比想象中多。同一种蔬菜,季节不同,含水率不同;同一块肉,冷冻程度不同,下锅后的温度曲线也不同。甚至海拔改变后,水的沸点和加热效率都会变化。固定参数无法覆盖所有现场条件。

因此,我们要把「汁水合一」「炒到断生」这样的经验语言,转化为机器可以执行的数字:目标温度是多少,还要加热多久,锅内状态发生变化后应该怎样修正。感知、理解、决策、执行,再根据结果反馈重新判断,这必须形成一个连续闭环。

机器还要先学会「看锅」。我们通过视觉、红外测温等多模态感知,让系统识别食材部位、温度分布、含水状态和加热变化。人凭经验一眼看出的事情,机器必须用数据看清楚,并且在极短时间内作出反应。

把经验量化,并不意味着用一个数字替代厨师,而是把厨师隐含的判断拆解出来。系统要知道目标是什么、当前在哪里、偏差有多大,再决定增加火力、延长时间还是提前停止。只有目标、过程和反馈都被数字化,机器才可能真正理解烹饪。

烹饪过程不会等模型慢慢思考。锅温、汁水和食材状态持续变化,上一秒的判断会直接影响下一秒的结果。因此,系统既要看得准,也要反应得快,还要通过设备稳定完成动作。模型和机器本体必须共同进化。

感知之后还要执行。机器即使判断正确,如果温控、投料或翻炒动作不稳定,结果仍然会偏离。因此,烹饪 AI 不是一个单独的软件模型,而是视觉、传感器、算法和机器人本体共同组成的系统。

所以模型与本体不是两个可以分开讨论的问题。模型判断正确,如果投料、搅拌或温控执行不到位,结果仍然会偏离;本体产生的误差又会反过来污染感知。身体能否准确执行,本身就是智能的一部分。

真实厨房不是应用终点,而是模型训练的起点

具身智能不能只靠互联网数据理解世界。它必须进入真实场景,通过传感器观察,通过动作影响环境,再从反馈中学习行动与结果之间的关系。对烹饪 AI 来说,模型不是在演示里成立的,而是在厨房里一盘一盘炒出来的。

烹饪 AI 不能只在实验室里训练,真实厨房才是训练场。橡鹿设备已经覆盖约 1.3 万家门店,累计服务近 6 亿人次,并沉淀了大量菜谱和过程数据。真正困难的,不是把数据全部交给模型,而是判断哪些数据代表好的结果,并建立专业的评价和标注体系。

在此基础上,我们研发了多模态烹饪 AI 模型 CookingMuse 厨启。它学习的不只是菜谱,更包括用户评价、实时锅内状态、设备状态和动作结果。模型需要理解不同菜品背后的共性过程,再针对品牌味型和个人偏好进行调整。

如果每一道菜都单独写一套程序,那仍然只是更多的 SOP,不是真正的模型。模型需要从大量菜品中抽象出加热、脱水、上色、入味、收汁等共性过程,再把这些能力组合到新的菜品中。这样,它才能从「记住一份菜谱」走向「理解一种烹饪过程」。

口味数据的标注尤其困难。同一份菜交给不同的人评价,答案可能完全不同;如果模型把所有意见同等对待,就很容易学得模糊。我们需要区分专业判断、品牌标准和个人偏好,让模型知道什么是稳定的工艺目标,什么是可以因人而变的口味选择。

「好吃」本身具有很强的主观性。面对同一道菜,不同厨师和消费者可能给出不同答案。因此,数据量并不等于训练质量。我们必须把专业厨师的判断、消费者反馈和客观过程数据放在一起,逐步建立模型能够理解的评价标准。

商业化场景也会反过来推动模型成长。小吃、快餐、食堂和家庭对口味、速度、成本的要求不同,真实客户提出的问题会让模型不断补齐能力。数据、模型、设备和场景必须形成循环,烹饪 AI 才会越用越懂厨房。

为了兼顾反应速度和成本,我们采用云端与边缘端协同的方式:复杂知识在云端训练,关键判断在设备端实时完成。这样,模型才能在商业厨房里真正落地,而不是停留在演示里。

商业化也不是模型完成后的最后一步。机器人进入门店后产生过程数据,数据继续训练模型,模型再赋能更多机器人,最终形成「机器人—数据—模型—机器人」的飞轮。真实应用不断提出新问题,也不断扩大模型的能力边界。

从模型、感知到本体:一套进入真实世界的完整路径

CookingMuse 厨启、3K 视觉 AI 炒菜机器人和现炒方舟,如果只看成三款产品,就很难理解我们真正想做的事情。把它们放在一起,构成的是从模型、感知到具身执行的一条完整路径:模型理解烹饪,视觉看见变化,本体把判断变成连续动作。

模型最终要通过产品解决问题。现炒方舟是一套可移动的微型无人后厨,在约 1.2 米乘 2.4 米的空间里完成取料、烹饪、出餐和清洁,可以进入景区、露营地、活动现场等传统厨房难以覆盖的场景。

3K 视觉 AI 炒菜机器人则从「照着菜谱炒」走向「看着锅里炒」。它可以识别食材大小、投料多少、解冻状态和锅内变化,再判断什么时候收汁、什么时候调整火力。菜谱下发以后,机器也能在食材存在差异的情况下,尽量把结果拉回目标味型。

现炒方舟并不只是把炒菜机器人放进一个盒子里,而是重新组织后厨流程。食材如何存放、机器人如何抓取、烹饪完成后如何出餐和清洁,都需要一起设计。只有整条链路足够稳定,无人后厨才可能离开固定门店,进入更多临时和移动场景。

这意味着,质量管理可以从出餐后的检查,前移到烹饪过程本身。系统发现食材、投料或设备状态异常时,可以及时判断和干预,让技术真正承担对结果的责任。

3K 视觉 AI 的另一个价值,是让好菜谱更容易被分发。过去,菜谱发到不同门店以后,会因为食材切配、人员经验和设备状态不同而走样。机器能够看见这些差异,就有机会在执行过程中动态补偿,让同一道菜跨越门店和地区后仍然接近原来的味道。

我们也在尝试让同一套能力覆盖中餐、西餐、面食等更多品类。不同品类的动作不同,但底层仍然围绕食材状态、能量输入和目标结果展开。产品形态可以变化,模型对烹饪的理解应该逐步沉淀为通用能力。

我们还必须面对真实世界的成本和网络约束。厨房判断不能完全等待云端,否则结果返回时菜可能已经煳了;但把大模型全部放在端侧,又会让设备成本难以推广。云端与边缘端协同,不只是工程选择,也是具身智能能否规模化进入现实的条件。

两场「破坏性测试」:验证的不是菜谱,而是应对变化的能力

具身智能不能只用一段流畅演示证明自己。我们更愿意主动制造偏差,看系统在标准条件被破坏以后还能不能完成任务。因为真实世界每天都会发生类似的「破坏」:材料不同、温度不同、操作不同,机器必须学会接住这些变化。

我们做过两组对照测试。第一组使用相同的麻婆豆腐菜谱,其中一台机器额外加入一百克水。系统识别水量变化后,重新调整火力和收汁时间,最终让两份菜的浓度和味型保持接近。

第二组分别使用鲜肉和未完全解冻的肉。冻肉下锅会降低锅温并增加出水,固定程序往往难以应对。系统识别食材状态后调整加热路径,两份菜最终仍保持了接近的味型。

对有经验的厨师来说,多出来的水并不是一个抽象数字,而是锅里正在发生的变化:汁水更稀、升温更慢,需要重新判断收汁节点。机器要做到的,就是把这种现场判断转化为可以计算的反馈,而不是等到程序结束后才发现味道不对。

测试的意义不在于机器又会做两道菜,而在于它能否面对真实厨房的不确定性。标准化不应该要求所有食材、所有环境都一模一样,而应该允许现实存在波动,同时让最终结果尽可能稳定。

冻肉测试也是同样的逻辑。系统不是简单地给冻肉增加一个固定时间,而是持续观察温度和出水变化,再调整后续动作。我们关注的不是某一次测试的胜负,而是机器有没有形成面对变化时重新决策的能力。

具身智能走向真实世界,最后仍然要回到「人」

无论做了多少模型、传感器和机器人本体,最后都要回到一个问题:技术为什么进入真实世界?答案不是为了让机器展示更多动作,而是帮助人解决高频、具体、长期存在的问题。只有真正改善人的生活,具身智能才获得了意义。

从 CookingMuse 厨启、3K 视觉 AI 炒菜机器人到现炒方舟,橡鹿正在形成从感知、判断到执行的完整链路。它既可以服务米其林餐厅、快餐门店和食堂,也可以走进家庭,为不同年龄、口味和健康状态的人提供更适合的一餐。

对于餐饮企业,这套能力意味着更稳定的出品、更低的培训压力和更可控的经营;对于厨师,它不是抹去个人经验,而是让好经验能够被记录、放大和传承;对于消费者,最终感受到的应该是一顿更稳定、更合适、也更容易获得的现炒饭。

我们希望把厨师难以言传的经验转化为可以保存和传播的数据,让江西菜等地方风味走出本地之后仍然保持自己的性格,也让更多人的饮食偏好得到理解。未来,从 B 端到 C 端不是简单的产品迁移,而是模型、设备和生态的共同打通。

面向家庭以后,系统面对的不再只是一个品牌的统一标准,而是从婴幼儿到老人、从日常饮食到健康管理的不同需求。机器既要理解一道菜应该是什么味道,也要理解今天坐在餐桌前的人需要什么。

中国烹饪拥有非常丰富的菜系和经验,如果能够把这些经验沉淀为机器可以理解的知识,它们不仅可以服务国内不同城市,也有机会走向全球。技术不应该把所有味道变得一样,而应该帮助每一种风味更准确地表达自己。

未来,一个人的口味、过敏信息和健康需求可以在不同场景中得到连续理解:在公司食堂、餐厅和家里,系统都能给出更合适的选择。我们希望技术减少人每天反复做决定的负担,同时把选择权留给人,而不是用单一标准定义所有人的饮食。

从实验室走向真实世界,不是把一项技术搬到现场,而是让模型、本体、数据、成本和人的需求共同成立。机器人最终要看见的,不只是一道菜,而是每一个人;具身智能最终要理解的,也不只是一个任务,而是任务背后真实的人与生活。

我们做这件事,不是为了证明机器人能做多少道菜,而是希望人工智能真正进入日常生活:记录每一种味道,理解每一种需求,让每一个人都更容易获得一顿适合自己的好饭。机器人最终要看见的,不只是一道菜,而是每一个人。谢谢大家。

来源:互联网

免责声明:本文为转载,仅作信息分享交流之用。版权归原作者所有,如有侵权,请联系删除。

热门产品

解决方案

0311-85200850
在线咨询