这项研究由阿里巴巴集团达摩院与湖畔实验室联合完成,论文于2026年7月20日发布于预印本平台arXiv,编号为arXiv:2607.17977v1,方向为机器人学(cs.RO)。有兴趣深入了解技术细节的读者可以通过上述编号查询完整论文。
**一个机器人要真正"懂事",需要什么?**
教一个孩子收拾玩具,你不需要给他讲物理学原理。孩子会用眼睛看,用手去摸,判断玩具在哪里、有多大、该怎么拿,然后把它放到对的地方。这些对人类来说轻而易举的事情,对机器人来说却是一道道极高的门槛。它不仅要"看见",还要"理解",更要"动起来"——而且三件事要同时做对。
这正是阿里巴巴达摩院团队想要解决的核心问题。他们发布了一个名为RynnBrain 1.1的系列模型,可以把它理解为专门为机器人设计的"大脑芯片",负责处理视觉信息、理解空间关系、找到操作目标,并最终指导机器人的身体做出正确动作。这套大脑不是一个单一模型,而是按照不同"脑容量"打造的三个版本——2B、9B和122B-A10B,数字越大代表模型越复杂、能力越强,就像汽车发动机有1.5T和3.0T的区别。
与上一代产品RynnBrain 1.0相比,这次的1.1版本新增了两项关键能力:第一是能够预测机器人手爪应该接触物体的哪个具体位置,第二是能够从一张普通照片中推断出物体在真实三维空间中的位置和朝向。同时,团队还开发了配套的行动模块RynnBrain-VLA,让这套"大脑"能够直接驱动不同类型的真实机器人去完成任务。最终的测试结果显示,这套系统在多个国际标准评测中超越了包括GPT-5.4、Gemini 3 Pro等知名商业AI系统在内的所有对比模型。
**一、机器人的大脑长什么样**
这套系统的底层骨架基于阿里巴巴自研的Qwen3.5大语言模型,三个不同规模的版本分别是2B、9B和122B-A10B。这些模型都采用了一种叫做"解码器架构"的设计方案,核心思路是让同一套神经网络同时处理文字和图像,而不是用两套独立系统分别处理然后拼合结果。这就像用一个统一的大脑同时看图和读字,而不是左眼看图、右眼读字然后再让大脑综合——后者反而容易混乱。
在视觉输入方面,RynnBrain 1.1可以接受三种类型的画面:单张照片、多角度同时拍摄的多视角图像,以及连续画面构成的视频。对于视频,系统会均匀采样多帧画面,给每帧标注时间顺序信息,这样就能追踪物体在时间轴上的运动状态,就像看一部定格动画,通过多张静止图片还原出完整的运动轨迹。
在输出方面,这套系统不仅能回答文字问题,还能直接输出空间位置信息。它的"词汇表"里不只有普通的汉字或英文单词,还包含了用来描述位置的数字坐标。当你问它"那个苹果在哪",它不只会回答"在桌子左边",还能同时输出一个精确的矩形框告诉你苹果的具体像素位置,这种方式叫做"物理世界的接地气输出"——把理解直接转化成可用的空间信息,而不是停留在语言描述层面。
为了让模型在处理长视频或多摄像头输入时不会"记性太差",团队还引入了两项技术:DeepStack负责更高效地压缩视觉信息,Interleaved MRoPE则帮助模型正确理解不同时间点、不同摄像头拍到的画面之间的空间和时间关系。这两项技术就像给厨师安装了一个更大的工作台和一套更清晰的食谱索引系统。
**二、用什么数据"喂养"这个大脑**
一个好厨师的养成离不开大量实践经验。RynnBrain 1.1的训练数据同样经过精心设计,覆盖了六大类别,每一类都针对机器人需要掌握的特定能力。
第一类是通用多模态数据,包含了大量日常图像理解、视频理解和问答训练材料,比如LLaVA、ShareGPT4Video等知名开源数据集,目的是让模型保留扎实的基础视觉理解能力。团队还特别加入了自建的"RynnBrain-Thinking"数据,帮助模型适应Qwen3.5的思维风格,就像让一个法国厨师在进中餐厨房之前先熟悉一下中式刀工和火候习惯。
第三类是时空定位数据,这是整套训练体系的核心之一。模型需要学会用坐标框出目标区域、预测物体可以被操作的区域(称为"可供性"),以及预测运动轨迹。新引入的RoboRefer和MolmoAct数据集进一步强化了这部分能力。这部分训练的目标是让模型不仅知道"那是一把剪刀",还知道"剪刀的手柄在画面的左下角,坐标大约是(230, 450)"。
第四类是三维空间感知数据,这是1.1版本相比1.0的重要升级。团队使用了WildDet3D数据集,它通过多模型协作的方式,把来自COCO、LVIS等平面标注数据集的二维标注"抬升"到了三维空间,覆盖了超过1.2万个类别。此外,FoundationPose数据集提供了近185万张高精度合成图像,每张图都有精确的三维物体位置标注,来自真实的Google扫描物体库。这两类数据的搭配就像同时用经验丰富但稍有误差的老厨师和严格按配方操作的机器人来训练一个学徒——前者提供广度,后者保证精度。
第五类是抓取与接触点数据,这是1.1版本最具创新性的改进之一。过去RynnBrain 1.0用四个角点来描述机械手应该如何握住物体,但这种方式存在明显缺陷:同一个物体可以从很多角度合理地被抓取,强行要求模型预测某一个特定的矩形框,就像强迫厨师只能用一种特定的握刀方式——既不合理也不实用。RynnBrain 1.1改用更简洁的表示方式:只需要一个中心点坐标加上一个旋转角度,就能描述手爪应该落在哪里、以什么角度接触物体。这2.6百万条训练样本来自GraspAnything、Jacquard V2、GraspFactory、GraspNet-1B和GraspClutter6D五个抓取数据集,团队还专门开发了一套渲染和投影流程,从三维仿真数据中生成对应的二维训练图像,确保每张图都满足"物体清晰可见、抓取位置有意义"的基本要求。
第六类是规划数据,包含了机器人执行长流程任务时需要的分步骤规划能力,使用AgibotWorld、Open X-Embodiment等数据集。对于新引入的Galaxea-G0数据集,因为原始标注只有子任务信息而没有整体任务描述,团队使用Gemini 3.1 Pro模型自动为每条样本生成了对应的高层任务指令,把子任务序列拼合成完整的任务描述,填补了数据空白。
**三、让机器人学会"手感":接触点预测的突破**
假设你要教一个刚来的实习生如何端盘子。你不会跟他说"你的手指应该形成一个宽度15厘米、高度8厘米、偏转30度的矩形接触面"——你会说"用拇指顶住盘底,其余四指托住边缘"。RynnBrain 1.1对接触点的新表示方式,正是这种从繁琐规范向自然动作感知的转变。
之前那种用四个角点描述抓取的方式问题在于:机械手的大小因品牌而异,同一个物体在不同机器人上被抓起来的"框"大小完全不同;而且对于圆柱形的瓶子、薄片状的信用卡、不规则形状的钥匙,根本不存在一个"标准的抓取矩形"。用IoU(交并比,一种衡量两个框重合程度的标准)来评价抓取是否准确,就像用"两幅画的相框大小是否相同"来判断两幅画是否画的是同一个场景——完全南辕北辙。
新的表示方式把抓取简化为两个核心信息:手爪应该接触物体的中心点位置,以及手爪两指连线的角度。坐标被标准化到0到1000的范围内。这样做的好处是,不管你用什么品牌的机械手,只要知道"应该在这个点、这个角度接触物体",剩下的关于手爪开合幅度、接近方向等细节就交给下游的控制系统去解决,大脑只需要提供最核心的空间锚点和方向提示。
从实际效果来看,RynnBrain 1.1-9B能够展现出令人印象深刻的细节感知能力。当被要求"抓起那个杯子",模型会把接触点定在杯柄上,而不是杯身中央;当杯子倒扣时,模型会重新判断当前状态并给出不同的接触位置;面对一根细笔,模型能正确判断握持方向,让"角度"信息实际起到作用,而不是随机给出一个数字。这种能力背后是对物体几何形状、状态和操作意图的综合理解,而不是简单的中心点回归。
**四、从平面到立体:让AI真正理解三维世界**
RynnBrain 1.1-2B和9B版本在训练中加入了原生的三维感知能力。具体来说,给定一张普通照片和相机的内参数据(描述相机镜头特性的一组数字,类似于相机的"视觉处方"),模型需要直接预测目标物体的三维信息:中心点的三维坐标(cx, cy, cz,单位是真实的米)、物体的长宽高(也是真实米数),以及物体在空间中的朝向(用俯仰角、偏航角和翻滚角三个角度描述)。这九个数字构成了一个完整的三维描述,和激光雷达或深度相机测出来的结果在同一个"语言体系"里。
模型用了和处理文字相同的方式来输出这些数字——把连续的浮点数转化成离散的整数token,然后用预测下一个单词的方式一个一个预测出来。这种设计的好处是不需要为三维预测单独设计一套特殊的输出头,整个系统保持了统一的自回归框架,简洁而优雅。
从评测结果来看,2B版本在SUN RGB-D(一个室内三维检测标准数据集)上达到了34.28的AP@15分数,已经超过了Seed1.5-VL(33.5分)和Gemini 2.0 Pro(32.5分)这两个同类系统。9B版本进一步提升到41.12分,与Gemini Robotics-ER的48.3分已经相差不远,考虑到后者是专门为机器人优化的封闭商业系统,这个差距实属不易。在WildDet3D-Bench测试集上,9B版本取得了23.44的AP3D分数,超过了专门在该数据集上额外训练过的WildDet3D专用检测器(22.6分)。
**五、三个规模,同一套食谱:规模化带来的启示**
工厂里有2B、9B、122B-A10B三种规模的模型,就像同一款汽车有1.5T、2.0T和3.0T三种排量。团队使用完全相同的训练方案训练三个规模,目的是搞清楚:随着模型越来越大,哪些能力会自然提升,哪些能力需要专门的训练才能出现?
通过对比RynnBrain 1.1三个规模与对应规模的原始Qwen3.5基础模型,研究团队发现了三种截然不同的规律,每一种都揭示了一类不同性质的能力。
第二类是"推理密集型认知"——比如MMSI(多图像空间推理)和MindCube(需要在脑海中旋转和想象三维空间的任务)。这里出现了戏剧性的分歧:RynnBrain 1.1从2B到122B-A10B平均分数提升了38.6%,而原始Qwen3.5的对应分数却下降了39.2%。换句话说,更大的Qwen3.5在这类任务上反而做得更差。直觉上理解:当一个没有专门训练的大模型遇到"请判断这两张图里哪个方向更远"这类问题时,它越大、语言能力越强,就越倾向于用流畅的语言强行解释,而不是老老实实地看图计算。有了空间推理专项训练,大模型的强大容量才能用对地方。
第三类是"空间定位"——预测坐标、框出区域。两个系列的模型都随规模增大而提升,但原始Qwen3.5在最大规模时的分数,仍然低于RynnBrain 1.1在最小规模(2B)时的分数。这意味着对于需要输出具体坐标的任务,大量针对性的标注数据比增大模型规模更重要——专门做过坐标输出训练的小模型,比没做过这种训练的超大模型还要强。
这套分析为整个机器人AI领域提供了一份重要参考:并非所有机器人需要的能力都能通过堆砌参数自然获得,有些能力的关键在于训练数据的专业性,而不是模型的绝对规模。
**六、一套大脑,驱动不同身体:跨机器人行动系统**
认知只是第一步,行动才是最终目标。团队在RynnBrain 1.1的基础上开发了RynnBrain-VLA,负责将视觉理解转化为真实的机器人动作指令。这套系统面临的最大挑战是:不同机器人的"身体语言"完全不同。一台工业机械臂用关节角度来描述动作,一只仿人手用20个手指关节角度描述,一台人形机器人还有腰部、头部要控制——就像同一首乐谱,要让钢琴、小提琴和打击乐各自演奏,每种乐器的实际操作方式千差万别。
RynnBrain-VLA的解决方案是设计一个共享的"通用动作空间",总共81个维度,按照身体部位分成六组:手臂关节角度(14维,左右各7维)、手臂末端执行器位置(18维,左右各9维)、平行夹爪(2维)、灵巧手(40维,左右各20维)、躯干(4维)和头部(3维)。每种机器人只激活自己实际拥有的那些维度,其余维度被"遮盖"掉——这种遮盖称为"体态特定掩码"。
在实验中测试了三种完全不同的机器人平台。Unitree G1是优必选出品的人形机器人,它的RynnBrain-VLA激活了40维灵巧手中的14维(G1的三指手每只手7维),并额外预测一个64维的SONIC运动令牌,配合SONIC全身运动控制器把指令转化为G1全身各关节的实际角度,两部分合并成78维的动作表示。天机-悟机是天机机械臂配合悟机灵巧手的组合,激活14维手臂关节和40维灵巧手,总共54个有效维度。Astribot S1是一套双臂协作机器人,激活手臂关节(14维)、夹爪(2维)、头部(3维)和躯干(4维),灵巧手维度被屏蔽。
在推理速度方面,团队采用了一种叫做"实时分块"(RTC)的技术。模型每次预测32步动作构成的"动作块",但不等这32步全部执行完就重新预测下一块——每执行5步就触发一次新的预测,同时把当前动作块中还没执行的部分作为"参考",帮助新预测保持连贯性。这就像演奏者提前翻好下一页乐谱,在前几小节还没演奏完时就开始熟悉接下来的内容,保证表演不会出现停顿和卡顿。
整个系统分为三层:最上层是运行VLA模型、输出动作块的"模型层";中间是控制层,用30Hz的低频循环协调推理时机,用200Hz的高频循环把动作块插值到机器人实际需要的控制频率;最底层是"体态层",负责把通用格式的动作指令翻译成每款机器人特有的控制协议,并把机器人的当前状态反馈回模型层。这种三层分离的设计意味着接入一款新机器人只需要重新写体态层,上面两层完全不动,大幅降低了扩展成本。
**七、真机测试:理论变为现实**
所有理论和评测数据最终要在真实机器人上经受考验。团队设计了三项主要测试任务,每项任务都由多个子步骤构成,需要机器人完成一整套连贯的动作序列。
第一项"撒花瓣"在Astribot S1上进行,机器人需要找到装有花瓣的容器、拿起来摇动直到花瓣全部倒出、判断倒出是否完成,这要求机器人能实时观察任务进度并据此调整行为,共分4个子步骤。第二项"倒红酒"同样在Astribot S1上进行,机器人要精确对准酒瓶口和酒杯口,执行控制倒酒动作,这对精细的空间定位能力要求极高,共分5个子步骤。第三项"抓铲子"在天机-悟机系统上进行,需要灵巧手精细操作抓取厨具,共分3个子步骤。
对比实验中一共有五种系统参与:Qwen-Based-VLA(用原始Qwen模型按相同方式训练的基线)、GR00T N1.7(NVIDIA发布的通用人形机器人VLA)、π0.5(Physical Intelligence公司的开放世界VLA)、RynnBrain-VLA(单任务版,每个任务单独训练一个专属策略),以及RynnBrain-VLA Generalist(多任务联合版,所有任务和所有机器人用一个统一策略训练)。
结果上,RynnBrain-VLA单任务版的平均子任务完成率达到91.28%,最终任务成功率达到86.67%。相比之下,Qwen-Based-VLA的对应数字分别是68.33%和60.00%,GR00T N1.7是83.31%和73.33%,π0.5是72.44%和65.00%。在最具挑战性的"抓铲子"任务上,RynnBrain-VLA以95%的成功率对比Qwen-Based-VLA的50%,差距最为悬殊。
更出人意料的是联合训练版RynnBrain-VLA Generalist的表现:不仅没有因为"一心多用"而下降,反而在三项任务平均来看,子任务完成率从91.28%进一步提升到94.14%,最终成功率从86.67%提升到91.67%。这说明来自不同机器人的训练数据并非相互干扰,而是相互补充——Astribot的倒酒经验可以帮助天机-悟机更好地理解"靠近目标"的动作语义,反过来也是如此。不同机器人的操作经验在"到底该怎么和物体互动"这个层面上有共通之处,哪怕它们的手臂结构和控制方式截然不同。
此外,在Unitree G1人形机器人的"拉椅子"任务上,RynnBrain-VLA取得了90%的成功率,而对比系统GR00T N1.7(同样配合SONIC控制器)的成功率是75%。
**八、和顶尖竞争对手的全面比较**
在学术界通行的标准评测上,RynnBrain 1.1-122B-A10B全面超越了所有参与比较的系统。这些比较对象包括Gemini 3 Pro、GPT-5.4、Claude Sonnet 4.6等顶级商业AI,以及RoboBrain 2.5、Cosmos 3-Super、Pelican-VL-72B等开源或半开源的机器人专项模型。
在VSI-Bench(视频空间智能评测)上,122B版本得到75.0分,而Gemini 3 Pro是48.8分,GPT-5.4是49.2分,差距相当明显。在MMSI(多图像空间推理)上,122B版本取得52.0分,Gemini 3 Pro虽然达到49.2分,但Claude Sonnet 4.6只有33.0分,GPT-5.4是37.5分。在RefSpatial-Bench(语言指导的空间参照定位)上,122B版本取得79.1分,远高于Gemini 3 Pro的65.5分和GPT-5.4的26.7分。在MindCube(三维空间心理旋转推理)上,122B版本达到89.6分,而GPT-5.4只有10.4分,Claude Sonnet 4.6是21.0分——这类需要在脑海中想象三维空间的任务,对没有专门训练的大模型来说确实是软肋。
即便是规模较小的9B版本,在对比4B到9B规模的同类系统时,在15项测试中有8项排名第一,特别是MMSI从39.6提升到47.0,MindCube从56.6提升到86.9,进步幅度远超同规模竞争对手。
说到底,RynnBrain 1.1做了一件看起来简单却颇为困难的事:它试图把人类理所当然的能力——看东西、理解空间、判断怎么动手——系统性地教给机器,而且不是用拼凑的方式,而是用一套统一的框架同时处理视觉、语言、空间和动作。从评测数字和真机测试来看,这套框架确实展现出相当扎实的效果,特别是在那些"越大越聪明"的规律失效的推理型任务上,专门设计的训练数据起到了模型规模无法替代的作用。
未来的方向上,团队明确表示希望把RynnBrain发展成一个更完整的"具身智能认知核心",整合长期记忆、世界模型、任务规划和闭环交互能力,让机器人不只是被动执行指令,而是能够根据世界状态的变化主动规划、调整和学习。这条路还很长,但RynnBrain 1.1是沿途一个扎实的里程碑。对这项研究感兴趣的读者,可以通过arXiv编号2607.17977v1查找完整论文,相关代码和模型权重也已开放在Hugging Face和ModelScope平台上。
Q&A
Q2:RynnBrain-VLA怎么同时控制不同种类的机器人?
A:RynnBrain-VLA设计了一个81维的通用动作空间,把所有机器人的动作按照身体部位(手臂、手指、躯干、头部等)统一分组。每款机器人只激活自己实际拥有的维度,其余维度被遮盖屏蔽,损失函数也只计算激活维度。这样不同机器人的训练数据可以放在同一个批次里联合训练,共享操作物体时的通用知识,同时各自保留特定控制接口的专属信息。
Q3:为什么更大的通用模型在某些机器人任务上反而表现更差?
A:对于需要在脑海中旋转三维空间、同时综合多张图像判断相对位置这类"推理密集型"任务,没有专门训练过的大模型会倾向于用更流畅的语言来"强行解释",而不是老老实实地从视觉信息里算出答案。模型越大、语言能力越强,这种"用语言掩盖视觉推理"的倾向就越明显,反而让准确率下降。专门针对空间推理的训练数据能纠正这种偏差,让大模型的容量用到正确的地方。