CNTXJ.NET | 通信界-中国通信门户 | 通信圈 | 通信家 | 下载吧 | 说吧 | 人物 | 前瞻 | 智慧(区块链 | AI)
 国际新闻 | 国内新闻 | 运营动态 | 市场动态 | 信息安全 | 通信电源 | 网络融合 | 通信测试 | 通信终端 | 通信政策
 专网通信 | 交换技术 | 视频通信 | 接入技术 | 无线通信 | 通信线缆 | 互联网络 | 数据通信 | 通信视界 | 通信前沿
 智能电网 | 虚拟现实 | 人工智能 | 自动化 | 光通信 | IT | 6G | 烽火 | FTTH | IPTV | NGN | 知本院 | 通信会展
您现在的位置: 通信界 >> AI >> 新闻正文
 
宇树开源了新大脑,机器人开始先预判再动手
[ 通信界 | 静姝 | www.cntxj.net | 2026/9/20 16:11:53 ]
 

宇树于9月14日发布G1+,集中升级了机器人的感知与运动能力。

颈部增加2个自由度,视觉系统升级为双目相机、广角单目相机和3D激光雷达;肩部与腰部电机的峰值扭矩提升一倍以上,发热量降低约70%。远场拾音系统升级为前4后2的六麦克风阵列,支持声源定位与降噪。头顶新增5个触摸点,背部增加DC 54.6V/5.7A外部供电接口,可支持持续供电运行。六项升级均集中在硬件,含税售价为9.5万元。

身体越来越像人。装在里面那颗脑子,这次一个字没提。

模型的事,四天前已经公布。9月10日,宇树发布新一代通用人形机器人基础模型UnifoLM-WLA-1.0,其中WLA是World-Language-Action,即世界-语言-动作。模型规模为6B;配套的UnifoLM-ER-1使用超过500万条具身推理样本,WLA模型使用约2500小时真机数据,一个模型覆盖64项任务,包括10项全身操作和54项桌面操作。9月11日,首批权重上线。

一具身体挂价签,一颗脑子挂许可证。

9 月 7 日晚上,一段 38 秒的视频。画面里没有遥控器,没有人举着 VR 头显。一台 G1 站在场地中间,人类拳手出拳,它双拳收到胸前格挡;一记鞭腿扫过来,它退后半步,稳住,回身还了一拳。视频上打了四个字:全程实拍,无加速。

图注:9 月 7 日演示画面,场地里没有遥控器,也没有 VR 头显。图片来源:宇树科技官方演示视频

宇树把这场演示称作全球首次由世界模型实时驱动的全自主人形机器人格斗,背后是另一套模型 UnifoLM-X2-1.0。

这三次发布集中在一周内:先用格斗演示实时决策能力,再开放新一代模型,随后发布升级后的机器人本体。

01.先打一场,三天后再开源

先把时间线摆出来。

2025 年 9 月,UnifoLM-WMA-0 开源,WMA 是 World-Model-Action,核心词是世界。它的任务是把机器人动完之后世界会怎么变预测出来,可以当仿真引擎造训练数据,也可以接上动作头增强决策。

2026 年 1 月,UnifoLM-VLA-0 开源,VLA 是 Vision-Language-Action,核心词换成动作。底座换到 Qwen2.5-VL,在 G1 上用一套策略跑通 12 类复杂操作任务。

2026 年 9 月,宇树发布UnifoLM-WLA-1.0。WLA是World-Language-Action,即世界-语言-动作,指向世界建模、语言理解与动作生成的统一。

把三个名称放在一起,可以看出宇树这一年的技术路线:先建模世界变化,再生成机器人动作,最后把世界变化预测、语言理解和动作生成纳入统一模型。

图注:9 月 10 日宇树发布的开源主视觉,背景是官方演示里的任务画面。图片来源:宇树科技官方项目页

宇树将9月发布的新模型命名为WLA-1.0。WLA是World-Language-Action,即世界-语言-动作,与前文所述统一世界建模、语言推理和动作生成的技术方向一致。

9 月 7 日那场格斗用的 X2-1.0,没有出现在这批开源清单里。

02.会认出杯子,不等于会伸手

要理解 WLA 想解决什么,得先知道 VLA 卡在哪。

过去两年机器人的视觉能力进展很快,能认出桌上是个杯子,能认出椅子和门。可认出和动手之间隔着一道沟。

识别杯子,与判断杯子距桌沿多远、机械臂应从哪个角度接近、动作是否会碰倒旁边的水瓶,是两种不同层次的能力。这种感知与动作之间的落地差距可称为grounding gap。视觉语言模型从互联网图文中学到的知识,仍需经过具身数据训练才能转化为可靠的物理动作。

宇树这次的答卷分两层。第一层是同步亮相的具身推理模型 UnifoLM-ER-1,4B 参数,底座是开源的 Qwen3-VL-4B,用了超过 500 万条具身推理样本,覆盖图像点预测、物体检测、多图推理、2D 轨迹预测、3D 物体检测、多图空间问答六类任务。

在16项多模态感知与理解基准中,UnifoLM-ER-1有7项领先表中参评的开源模型:RefSpatial-Bench、Where2Place、PixMo-Point、BLINK、EmbSpatial、RoboSpatial和VSR。

图注:官方演示视频里的成绩表,UnifoLM-ER-1-4B 排在第一行。按表格脚注,各家数据来自模型官方技术报告、公开论文,或者用模型官方 API 自测;BLINK 只取其中两个子任务的平均。图片来源:宇树科技 UnifoLM-WLA-1.0 官方演示视频

以其中两项为例:物体摆放预测Where2Place得分82.0,空间关系理解VSR得分88.1。两项基准都涉及机器人执行动作前的空间判断,例如目标位置能否放置物体、机械臂的运动是否会与周围物体发生干涉。

这些分数需要结合评测方式理解。表中数据来自各模型的技术报告、公开论文和API测试,BLINK也只统计两个子任务,因此并非在统一模型版本、推理设置和评测流程下完成的横向比较。

03.世界模型走了条省钱的路

第二层是这套模型里最有意思的地方。

VLA 之后,行业里冒出一条新路线,叫 WAM,World-Action Model,世界-动作模型。思路是让机器人先学会预测世界怎么变,再从变化里推出动作。这个方向更接近人的直觉:人要挪走一个杯子,脑子里会先过一遍杯子挪开后桌面变成什么样。

WAM通常需要生成完整的未来画面,逐帧预测后续变化。在一张512×512像素的图像中,大量背景区域与当前任务无关,完整视频生成仍会为这些区域分配计算量。

UnifoLM-WLA-1.0不生成完整的未来画面,而是只预测未来会发生变化的区域。

做法是,用光流从前后两帧里提取出真正发生变化的区域,再用 VQ-VAE 把这片连续变化压成固定长度的离散 token,然后训练模型:给它当前画面加任务描述,直接输出未来会变的区域。宇树管这个叫 Dynamic Region,动态区域。

图注:红色区块表示模型预测的未来动态区域,图中其余部分未被标记为动态区域。图片来源:宇树科技官方项目页

叠毛巾,真正会变的只有毛巾本身,加上它被挪走后露出来的那块桌面。房间里其他像素纹丝不动。

官方把这条路总结成 interaction-centric world modeling,以交互为中心的世界建模。说人话就是,与其画一张模糊的全景未来,不如把哪儿会变算准。前者好看,后者有用。

这种设计不追求还原完整未来画面,而是把预测目标集中到与交互相关的区域,从而减少对无关背景的建模。

04.把动作切成词,让全身说同一种语言

光会看不够,动作还得能被模型统一表达。

不同身体部位和末端执行器常采用不同的动作表示与控制模块。腿部行走、机械臂运动和手部抓取的控制目标并不相同,更换末端执行器还会改变动作空间的维度和语义,因此统一建模并不容易。

宇树的做法是把动作也切碎。

它把机器人的动作拆成三段:末端执行器的位姿、手部关节、下半身关节。三段各训一个残差向量量化模型,把连续轨迹编码成离散的动作 token。三组 token 按共享时间步对齐,一起送进视觉语言模型。

手部精细动作、末端轨迹和下肢运动分别被编码为离散token,并按共享时间步对齐后输入视觉语言模型。模型由此可以像预测语言token一样预测动作token。

同一模型联合生成末端位姿、手部关节和下肢关节的动作,实现全身协同控制。

图注:官方演示里的桌面任务,画面标注 2 倍速自主执行,右上和右下分别是头部与腕部相机的实时画面。图片来源:宇树科技 UnifoLM-WLA-1.0 官方演示视频

这些模块共同构成主干网络UnifoLM-ER-Flow。主干网络之上连接MMDiT动作专家,用于把多模态表征解码为连续动作指令。

主干网络负责多模态感知与理解,动作专家负责生成连续动作。这样的模块分工让语义建模与动作生成分别由更合适的网络结构承担,也为端侧部署留下了优化空间。

05.2500 小时真机数据,才是最贵的部分

公开的模型结构可以被研究者借鉴,但高质量真机数据的采集、清洗和标注更难复制。

UnifoLM-WLA-1.0 的训练数据约 2500 小时,官方点名了两类来源,宇树自有开源数据集,以及 BitRobot-HIW-500 这类公开资源。

HIW-500由BitRobot、Hugging Face与宇树联合发布,包含500多小时真实家庭场景中的全身遥操作数据。数据使用Unitree G1采集,覆盖29个机器人自由度;头部配备立体相机,腕部配备红外立体相机,并采用CC BY 4.0协议开放。

图注:G1 在真实家庭客厅里执行清洁任务,这类带家具、杂物和动线的场景正是全身遥操作数据要覆盖的对象。

真机数据为什么贵。仿真里跑得完美的策略,搬到真机上可能连东西都抓不住,材质、摩擦、光照的每一点差别都会让动作变形。采真机数据要有人遥操作一台机器人,一小时下来收不回一小时能用的高质量数据,中间还有设备损耗、失败样本、清洗标注。

真实物理交互数据仍然稀缺。可用于训练的合规真实交互数据与通用具身模型所需的数据规模之间仍存在数量级差距。

填这个缺口有两条路。

一条是宇树走的这条,用真机遥操作采集,数据准,和本体严格对齐,代价是慢,产能取决于手里有多少台机器人。

另一条是拿人类第一视角视频来学。9 月 9 日发布 PhysBrain 1.5 的深度机智走的是这条,用全景设备采集人的日常操作视频,再把人的动作转换到机器人上。数据便宜、量大,代价是要跨过人和机器人的形态差异。

真机遥操作数据与人类第一视角视频各有优势:前者与机器人本体严格对齐,但采集成本高;后者规模更大、成本更低,但需要解决人类动作向机器人动作迁移的问题。实际训练可以根据任务需要组合两类数据。

06.感知跑分之外,还要看真机任务成功率

最后说这套模型还没有证明的部分。

同一个UnifoLM-WLA-1.0模型覆盖64项任务,包括10项全身操作和54项桌面操作。

这件事的价值不在数量,难点在一个。同一套参数,上要管手指的精细动作,下要管全身的移动和平衡,任务之间还不能打架。过去每个任务训一套模型,边际成本压不下来。

边界也得看清。

64 项任务全在宇树自己的 G1 上测,换成别的品牌机器人行不行,还没有数据。前面那 7 项第一,测的也偏向空间理解,属于眼睛的考试,跟真机操作成功率是两回事。

感知与空间推理基准衡量的是模型理解环境的能力,不能替代真机任务成功率。分布外任务和新本体上的性能通常会下降,跨任务、跨场景和跨本体泛化仍是具身模型需要解决的问题。

截至9月14日,可下载内容包括具身推理模型、主干网络权重和挑战赛数据集、全身遥操作数据集;后训练代码、UnifoLM-WLA-Base权重仍列在后续开放计划中。

回到那场擂台

格斗是最难的场景,也是最取巧的场景。

格斗场景对实时反应、物理判断和动态交互提出了很高要求,系统需要在数百毫秒内完成感知、预测、决策和控制,并在受到冲击后迅速恢复平衡。但该演示的边界也很明确:对手动作和场地条件相对受控,不能单独证明机器人在开放环境中的泛化能力。

这段演示说明系统能够在特定场地和对抗条件下完成实时闭环动作,但还不足以说明其长期稳定性和开放环境泛化能力。

从可行走向可用,还需要回答几个具体问题:轻量世界模型能否处理长尾情况,动作token化能否跨越本体差异,约2500小时真机数据能否支撑更广泛的任务泛化。研究者可以在许可证允许的范围内下载已开放的权重和数据进行验证。

宇树创始人王兴兴在世界机器人大会上给过一把尺子:机器人在 80% 的陌生场景里,仅凭一句语音或文字指令完成 80% 的任务,具身智能才算迎来自己的ChatGPT 时刻。他给的时间是快则两三年,慢则五到十年。

图注:王兴兴在 2026 世界机器人大会主论坛发表演讲《从展品到产品:人形机器人产业的下一个十年》。

接下来更值得关注的是开放环境中的任务成功率、跨本体泛化能力,以及长时间运行的稳定性。

 

1作者:静姝 来源:机器人大讲堂 编辑:顾北

 

声明:①凡本网注明“来源:通信界”的内容,版权均属于通信界,未经允许禁止转载、摘编,违者必究。经授权可转载,须保持转载文章、图像、音视频的完整性,并完整标注作者信息并注明“来源:通信界”。②凡本网注明“来源:XXX(非通信界)”的内容,均转载自其它媒体,转载目的在于传递更多行业信息,仅代表作者本人观点,与本网无关。本网对文中陈述、观点判断保持中立,不对所包含内容的准确性、可靠性或完整性提供任何明示或暗示的保证。请读者仅作参考,并请自行承担全部责任。③如因内容涉及版权和其它问题,请自发布之日起30日内与本网联系,我们将在第一时间删除内容。 
热点动态
普通新闻 宇树开源了新大脑,机器人开始先预判再动手
普通新闻 7项评测领先开源模型,宇树科技开源具身基座模型让人形机器人“理
普通新闻 火山引擎×AMD 助力砹脉营销(A.M.A)以 Seedance 重塑汽车营销新
普通新闻 全栈国产轻量级智能体大模型Xing4.0-29B正式发布
普通新闻 首个全栈国产轻量级智能体大模型Xing4.0-29B正式发布
普通新闻 探秘3D数据中心:像搭积木一样建算力机房
普通新闻 电子信息制造业“十五五”:筑牢智能时代“硬件底座” 夯实强国建
普通新闻 消息称苹果今年将开始在印度制造iPhone 16 Pro机型
普通新闻 OpenAI决定持续披露AI“越界”事件,但第一步就碰上了难题
普通新闻 重磅:电子信息制造业发展“十五五”规划(全文)
普通新闻 2026 VDC 生态服务分会场:从标准共建到能力开放 vivo持续深化生
普通新闻 筑牢安全新屏障 2026年国家网络安全宣传周电信日活动在济南举行
普通新闻 Spectrum仪器PXIe板式AWG卡助力原子钟升级
普通新闻 天玑9600 Pro发布,重做架构,体验颠覆,这次Pro得很彻底!
普通新闻 中国联通CDN产品焕新发布
普通新闻 华为与中国联通持续深化战略合作,共筑价值增长新引擎
普通新闻 TeleAgent用户破百万:中国电信加速AI智能体在办公场景规模化落地
普通新闻 TCL实业IFA 2026揽获多项海内外权威大奖,多品类创新实力获全球认
普通新闻 粤港澳大湾区6G产业发展大会暨2026·人工智能+未来产业创新大会“
普通新闻 TCL实业IFA 2026“灵感栖居”展区亮相:屏显到家庭全场景,“AI 
通信视界
中国信息通信研究院首席专家史德年:6G融合创
普通动态 中国信息通信研究院首席专家史德年:6G融
普通动态 滁州铁通强化“四个载体” 为发展蓄势赋
普通动态 从“技术可用”到“商业可赚” AI智能体加
普通动态 两部委联合开展人形机器人与具身智能实景
普通动态 探访5G工厂|戈壁深处 5G专网给矿山装上
普通动态 2026年APEC数字和人工智能部长会议将在成
普通动态 安徽铁塔抓实抓细防汛通信保障工作
普通动态 李乐成出席联合国首届人工智能治理全球对
普通动态 唐山电信“安全魔法课堂”为小学生送反诈
普通动态 华尔街如何操盘完成SpaceX史上最大规模IP
通信前瞻
中国联通携手北邮打造“大思政课”校企联合实
普通动态 国产算力驶入十万卡时代
普通动态 人工智能逼出“真演技”
普通动态 合肥铁塔护航轨道交通7号线通信全覆盖
普通动态 亚洲规模最大ACGN展会!BilibiliWorld三天
普通动态 福建电信助力小水电站迈入“云网智控”新
普通动态 中国联通携手北邮打造“大思政课”校企联
普通动态 工业和信息化部就防汛救灾应急通信保障工
普通动态 我国算力网络技术标准研制取得突破
普通动态 英特尔Panther Lake笔记本不插电挑战游戏
普通动态 轻薄续航和性能都在线!在丽江和第三代酷
普通动态 一台轻薄本走进纳西村:英特尔如何重新定
普通动态 MWC探馆丨AI换脸诈骗怎么防?体验中移金科
普通动态 英国手机卡运营商选购核心:CMLink共享流
普通动态 存储芯片,最大赢家
普通动态 活力中国调研行丨“人造太阳”能发电吗?
推荐阅读
Copyright @ Cntxj.Net All Right Reserved 通信界 版权所有
未经书面许可,禁止转载、摘编、复制、镜像