具身智能之RynnBrain 1.1详解:如何把具身理解接到多本体动作

具身智能之RynnBrain 1.1详解:如何把具身理解接到多本体动作
写在前面【从零走向AGI】旨在深入了解通用人工智能AGI的发展路径从最基础的概念起逐步构建完整的知识体系。项目地址https://github.com/AI-mzq/From-Zero-to-AGI.git魔方AI空间猫先生从零走向AGI面试面经AIGC算法岗/开发岗面试面经交流社群涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源欢迎大家加入https://t.zsxq.com/YtJ09导读RynnBrain 1.1 试图解决的不是“让视觉语言模型多回答几道机器人题”而是把机器人执行前需要的空间信息变成统一的模型输出目标在何处、三维框如何摆放、接触位置在哪里以及这台机器人的身体有哪些可用自由度。论文将这些能力组织为具身基础模型 RynnBrain 1.1并在其上训练 RynnBrain-VLA。模型提供 2B、9B 和 122B-A10B 三个规模。2B、9B 支持原生 3D grounding最大 MoE 模型主要用于扩展具身认知、空间推理与定位能力。动作端则以 Flow Matching 生成动作块并用 81 维跨本体动作空间和本体掩码适配 Unitree G1、Astribot-S1、Tianji-Wuji 等不同形态的机器人。整篇论文的论证顺序很清楚先定义统一视觉语言骨干与空间 tokenSection 2再用多类具身数据完成预训练Section 3随后将骨干后训练为 VLA 策略Section 4最后依次评估具身认知、定位、扩展性、3D grounding、接触点和真机执行Section 5。图 1论文用这张总览图定义 RynnBrain 1.1 的能力边界三种规模的基础模型覆盖认知、定位、3D 与接触点RynnBrain-VLA 再延伸到跨本体动作。来源论文 Figure 1。猫先生认为RynnBrain 的关键不在于把“VLM VLA”并列在同一篇论文中而是把2D/3D grounding 与接触点明确设为二者之间的接口理解结果要能被身体和控制器继续使用。论文标题RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model论文地址https://arxiv.org/pdf/2607.17977项目主页https://alibaba-damo-academy.github.io/RynnBrain/代码与模型https://github.com/alibaba-damo-academy/RynnBrainHugging Facehttps://huggingface.co/collections/Alibaba-DAMO-Academy/rynnbrain-11ModelScopehttps://modelscope.cn/collections/DAMO_Academy/RynnBrain-11原文脉络Introduction 将具身智能的缺口落在“通用视觉语言理解无法直接提供物理可执行信息”上。Section 2 给出模型概览和统一空间表示Section 3 说明预训练任务、数据配方及接触点形式Section 4 才进入 RynnBrain-VLA 的动作生成、统一动作空间、跨本体部署与实时 chunkingSection 5 用分层评测检验每一个能力环节。下面按这一顺序阅读。1. Introduction具身模型缺少的是可执行的空间语义通用 VLM 可以识别物体、理解语言关系甚至描述操作步骤但对机器人而言“杯子在左边”远远不够。控制链路还需要目标的像素或三维位置、可接触部位、相机与本体状态以及最终落到关节或末端执行器的动作。将检测、抓取、规划和控制分别拼接常会遇到接口不统一、误差累积与换本体后需要重训的问题。RynnBrain 1.1 的定位因此是具身基础模型不只学习视觉问答还学习时间维度的观测、空间定位、三维几何、接触点和操作规划。论文没有声称用一个模型取代所有低层控制模块而是先把这些任务转化为共享的视觉语言表示为后续 VLA 提供连续的语义与几何条件。2. Overview用统一自回归架构承接时空与空间 token2.1 Model Architecture视觉、语言与多帧观测进入同一骨干认知骨干采用 decoder-only 视觉语言架构图像经视觉编码器和视觉—语言投影层进入语言模型文本指令、单帧或多帧观测在同一序列中建模。论文基于 Qwen3.5 系列构建 2B、9B、122B-A10B 三种规模并使用 Deep-Stack 与 Interleaved MRoPE 扩展长时序视觉上下文。图 2RynnBrain 1.1 的统一具身基础模型架构。它对应论文的 Overview同一个骨干既处理时空视觉理解也预测空间与接触相关 token。来源论文 Figure 2。2D 框、关键点和轨迹坐标被归一化、离散为 0 到 1000 的空间 token模型仍以预测下一个 token 的方式训练L − ∑ i log ⁡ P ( y i ∣ y i , V ; θ ) \mathcal{L}-\sum_i\log P(y_i\mid y_{i},\mathcal{V};\theta)L−i∑​logP(yi​∣yi​,V;θ)其中V \mathcal{V}V表示视觉观测y i y_iyi​可以是文本也可以是离散的空间输出。这种设计减少了为检测、指向、轨迹等任务分别增加头部的需求相应地坐标精度会同时受离散粒度与自回归解码误差限制。猫先生认为统一 token 的意义不是“所有任务看起来都一样”而是让语言、位置和几何共享上下文。对于多步操作这比把定位结果作为一次性外部接口交给策略更容易保留指令中的指代关系。3. Pretraining把具身能力写入预训练配方3.1 Training Recipe2D、3D 与接触点使用不同的物理表述预训练混合了通用多模态指令、具身认知、定位、3D、机器人感知和规划数据。2D 空间任务继续输出离散坐标对 3D grounding2B 与 9B 模型在给定图像、指令和相机内参后预测 9 个量三维框中心( c x , c y , c z ) (c_x,c_y,c_z)(cx​,cy​,cz​)、尺寸( w , l , h ) (w,l,h)(w,l,h)与朝向( p i t c h , y a w , r o l l ) (pitch,yaw,roll)(pitch,yaw,roll)。长度以米、角度以弧度表示再映射为 token。接触点的定义更具操作意味。论文不沿用通用抓取矩形而将动作接触抽象为二维中心p ( x , y ) p(x,y)p(x,y)和平面内手指朝向θ \thetaθ。夹爪宽度会随硬件改变矩形也不一定对应功能接触位置用( p , θ ) (p,\theta)(p,θ)至少能把“碰哪里、以什么方向接近”保留下来便于接到不同执行器。3.2 Pretraining Data大规模数据服务于不同层次的空间能力三维部分既使用人工核验的 WildDet3D Essential也包含自动筛选的合成样本接触点数据来自 Grasp-Anything、Jacquard V2、GraspFactory、GraspNet-1B 与 GraspClutter6D论文合计约 260 万条样本。数据构成表明模型先从大规模视觉世界学习对象、关系和几何再用贴近操作的数据约束什么是可行动的空间信息。这种统一并不意味着数据问题已经消失。不同来源的相机参数、标注协议和可抓取性定义仍有差别统一 token 格式解决的是输入输出接口不会自动消除数据分布的冲突。接触点结果在论文中也主要是定性展示因为尚缺统一的标准度量。4. Post-training for Vision-Language-Action Model让 RynnBrain 生成动作4.1 Model Architecture以 Flow Matching 预测连续动作块RynnBrain-VLA 将视觉语言骨干改造成单流 DiT。语言指令、多相机观测、机器人状态与带噪动作共同构成条件序列模型通过 Flow Matching 预测动作 chunk。动作被放在序列末端已编码的视觉语言前缀可以复用 KV cache减少闭环控制时重复计算。4.2 Unified Cross-Embodiment Action Space81 维不是统一身体而是共享字典图 3RynnBrain-VLA 使用 Flow Matching 生成动作块81 维动作字典通过本体掩码适配不同机器人。来源论文 Figure 3。动作向量划分为 14 维机械臂关节、18 维末端执行器、2 维二指夹爪、40 维灵巧手、4 维躯干和 3 维头部共 81 维。训练时每台机器人仅激活实际拥有的维度损失也只在这些维度上计算。Tianji-Wuji 使用机械臂关节与灵巧手共 54 维Astribot 同时使用夹爪、头部和躯干G1 的灵巧手动作还需额外的 SONIC 控制器解码。4.3–4.5 Cross-Embodiment Deployment、RTC 与 Fine-tuning将共享表示落到各自控制栈本体掩码使多机器人演示能够共同训练但不假装它们的动力学完全一致。论文还通过 cross-driver 部署将上层动作映射给不同执行端并采用 Real-Time ChunkingRTC维持实时性。G1 额外使用 64 维 SONIC token 的事实尤其说明81 维空间是上层策略的共同接口而不是能够替代每一种低层控制器的万能命令。猫先生认为这是一种相对克制的跨本体方案。它把能共享的视觉语义、任务意图和部分动作坐标共享起来把难以等价的驱动细节留在本体侧泛化是否成立仍要由真机迁移而不是维度对齐来证明。5. Evaluation从认知、定位到真机操作的分层证据5.1–5.3 Embodied Cognition、Localization 与 Scaling Analysis论文先评估具身认知、复杂推理和具身定位再观察参数扩展。由 2B 增至 122B-A10B 后三类任务的平均成绩分别从 65.9、51.1、71.8 上升至 72.5、70.8、77.5复杂空间关系推理的增幅尤为明显。对比对象为同系列基础 Qwen3.5因此这些结果最直接支持的是具身继续训练能够显著改变同源模型在空间与推理任务上的能力曲线而非证明对所有模型均绝对领先。图 4扩展性分析显示具身继续训练在三个能力维度上均有收益复杂推理的增幅最突出。来源论文 Figure 4。5.4–5.5 3D Grounding 与 Contact Point Prediction9B 模型在 SUN RGB-D 取得 41.12 AP15在真实互联网图像构成的 WildDet3D 上达到 23.44 AP3D并高于论文比较的专用 WildDet3D 方法22.6。这表明视觉语言骨干能够承担一部分三维定位但该能力只在 2B、9B 版本中提供不能将 122B-A10B 的认知扩展成绩直接视为最大模型的 3D 结果。接触点部分给出抓取和操作场景中的定性样例尚未形成统一的定量基准。它验证了该输出形式能表达接近方向与落点但还不能单凭可视化证明接触预测本身就是提升真机成功率的主要原因。5.6 Real-Robot Evaluation三类机器人上的联合训练收益真实机器人实验覆盖开门、端菜、煎牛排、摆盘和倒酒等任务每个任务进行 20 次随机化试验并记录过程得分与最终成功率。单独训练的 RynnBrain-VLA 平均过程得分为 91.28%成功率为 86.67%多本体联合训练的 Generalist 版本达到 94.14% 和 91.67%。论文表中 Qwen-based VLA 为 68.33%/60.00%GR00T N1.7 为 83.31%/73.33%π0.5 为 72.44%/65.00%。图 5真机评测覆盖移动操作、烹饪和服务任务图中同时展示了不同本体上的任务成功率。来源论文 Figure 8。多本体联合训练至少没有明显牺牲各自的任务表现并显示出正迁移迹象。证据的边界也应保留每个任务只有 20 次试验且 GR00T、π0.5 与 RynnBrain 的动作块长度不同端到端比较并非完全的单变量控制实验。评测顺序本身也值得留意前面的认知、定位和接触点并不是直接等同于控制成功率而是分别验证 VLA 所依赖的感知与空间接口。真机结果将这些能力汇合到端到端策略中却还没有逐项做完因果拆分例如去掉 3D grounding 或接触点后成功率下降多少仍需要更完整的消融来回答。6. Conclusion and Future Work从统一接口走向可复用的具身底座RynnBrain 1.1 将时空视觉、2D/3D grounding、接触点与动作生成串成一条模型路线。其价值不只是增加几项具身 benchmark而是把“在哪里、怎样接触、当前身体能怎样动”写成同一基础模型可以表达和传递的中间语言。猫先生认为后续最关键的检验有三项接触点是否能在受控实验中独立带来操作收益原生 3D grounding 能否扩展到最大模型以及统一动作空间在更多控制频率、末端工具与机器人本体上能否保持迁移。只有这些问题经受住更严格的真机验证具身基础模型才会更接近可复用的“认知—行动底座”。参考资料RynnBrain 团队论文 PDFRynnBrain 团队项目主页RynnBrain 团队开源代码与模型说明推荐阅读► 技术资讯 魔方 AI 新视界► 项目应用开源视界► 技术专栏 多模态大模型最新技术解读专栏 | AI 视频最新技术解读专栏 | 大模型基础入门系列专栏 | 视频内容理解技术专栏 | 从零走向 AGI 系列

最新新闻

日新闻

周新闻

月新闻