涨停潮来了!人工智能,关键转折!

 涨停潮来了!人工智能,关键转折!

来源: 中国商报


7月21日,A股人工智能板块上涨,多股涨停。

消息面上,随着AI技术快速发展,人们已不再满足于大模型生成文字、图片和视频的能力。能理解、能交互、能干活的AI,正在成为产业新的追求。

在2026世界人工智能大会上,物理AI、世界模型等概念被频繁提起。如何让AI理解真实世界的运行规律,在复杂环境中自主判断并执行任务,成为当前具身智能产业发展的核心命题。

核心命题转向理解与交互

物理AI通常指能让机器人(核心股)、自动驾驶车辆、智能空间和其他(核心股)自主系统在真实物理世界中感知、理解、推理并执行复杂动作的AI。世界模型则是理解现实世界动态(包括物理和空间属性)的AI工具,可利用文本、图像、视频、声音和运动等输入数据来预测接下来会发生什么。

“具身智能领域世界模型的定义是能够高频联合预测动作与世界状态的人工智能模型。”它石智航创始人兼CEO陈亦伦认为,当前行业流行的VLA(视觉—语言—动作)模型仅能输出机器人(核心股)的下一步动作,而世界模型不仅要输出动作,还要预测动作引发的世界状态变化,以及判断变化结果是否符合预期,完整覆盖强化学习“状态—动作—奖励”三要素。

昆仑万维董事长兼CEO方汉认为2026年是“世界模型元年”。在他看来,这标志着AI从内容生成走向对物理世界的理解与交互的关键转折。

方汉表示,过去两年,AI行业的核心命题是“生成”——生成文字、图像、视频、音乐。从2026年开始,AI的核心命题转向“理解”与“交互”——让AI真正理解物理世界的运行规律,并能与真实环境进行闭环互动。世界模型正是实现这一跨越的关键技术底座。

“具身智能正从实验室(核心股)走向真实环境,这一趋势要求机器人(核心股)在行动前先进行环境推演——预判动作后果、评估环境变化、及时调整应对策略。”方汉表示。在他看来,这种能力的突破,将使竞争焦点从单一任务转向陌生环境下的通用模型能力。

“谁能训练出在复杂场景中依然‘看得懂、做得对’的模型,谁就能拿到物理智能时代的入场券,这也是中国智能制造(核心股)和机器人(核心股)产业亟须的底层能力。”方汉说。

物理场景也对模型能力提出了更高的要求。

“数字世界模型失误仅影响图文生成,而在物理场景下,智能体预判偏差将产生不可逆的真实损失。”大晓机器人(核心股)董事长王晓刚直击具身智能行业痛点。

机器人(核心股)更智能需要多少数据

机器人(核心股)要在日常生活中灵活自如地完成任务,究竟需要多大规模的数据?

智元合伙人、高级副总裁、具身业务部总裁,觅蜂科技董事长兼CEO姚卯青认为,如果机器人(核心股)能够在物理世界中“开箱即用”,完成日常任务,并跟随开放式自然语言指令行动,那么具身数据规模仍与语言模型预训练语料存在万倍以上差距。

“物理世界噪声更大、信息冗余更高,要实现对通用物理规律、开放式指令理解与任务规划能力的隐式掌握,需要亿小时级别的数据,才能让常见任务的基础成功率达到70%—80%。”姚卯青说。

“工业级自动驾驶系统训练需要约100万小时视频数据,而具身操作需要刻画更复杂的接触式物理规律,至少需要1000万小时合格数据。”陈亦伦表示。

除了数据规模之外,世界模型的训练方向和核心目标也是值得关注的。

陈亦伦认为,世界模型训练的核心目标应当是动作预测而非状态预测。他以大语言模型的发展路径作了类比:大模型通过模仿互联网海量人类文本最终实现能力超越,具身智能也将走“大规模模仿人类、最终超越人类”的路径。

“人类在物理世界行动时,并不会刻意预测下一时刻的世界状态,而是基于视觉感知直觉输出动作,因此‘状态用于感知,动作才是模型需要预测的核心’,世界模型的突破关键在于积累海量‘状态—动作’配对数据。”陈亦伦说。

亮源新创创始人兼CEO、ChatGPT核心贡献者姜旭认为,世界模型最核心需要完成两项任务:一是预测世界的下一个状态;二是更重要的一项,即预测下一个动作。

“如果必须在两者之间做取舍,预测动作比预测状态更加重要。因为我们训练世界模型的最终目的,不是为了生成视频,而是为了控制机器人(核心股)。”姜旭说,“希望通过架构创新和数据创新,更好地统一状态理解和动作预测两项能力。”

具身智能企业展开探索

围绕数据、模型与真实作业能力,具身智能企业已展开系统性探索。

专注于触觉物理智能研发的千觉机器人(核心股)携完整“硬件—数据—模型”技术生态参展。千觉展出了核心技术底座VTLA视觉—触觉—语言—动作多模态模型,其依托实时触觉反馈实现无预设轨迹自适应作业。例如,在柔性物料长序列加工场景中,当纸板受外力移位、形变干扰时,机器人可通过触觉感知受力变化,自主调整施力力度与动作轨迹,连贯完成展平、折边、压实整套工序。

大晓机器人(核心股)发布了Kairos 3.1,作为融合生成智能、物理智能与认知智能的行动一体化世界模型,Kairos 3.1构建“理解—推演—执行—反思”全链路自进化智能闭环,标志着具身世界模型实现了从单一能力突破向产业落地的完整闭环。

例如,在洗衣等真实家庭场景中,机器人(核心股)可精准识别部件空间关系,依托时空记忆与思维链拆解十余个操作步骤,自主规划从取衣、放衣到启动、整理的全链路方案;同时,机器人还具备任务状态追溯能力,实时核验每一步执行结果,在出现异常时可精准定位失败节点并重启对应步骤,实现自主闭环作业。

智元则构建了“预训练—后训练—持续学习”的三阶段训练架构,沿着VLA与WAM两条路线持续演进,并推动二者走向统一的世界推理动作大模型(WRAM,World Reasoning Action Model),以此推出自研GO-2基座模型、Act2Goal世界模型、GE-Sim 2.0,搭配SOP、Genie Evolver百台级分布式真机强化学习体系,从算法、仿真、真机训练层面打通规模化迭代闭环。

姚卯青认为,物理智能要实现规模化,必须突破三道墙:一是数据墙,真实交互数据极其稀缺且获取成本高;二是表征墙,跨任务、跨场景、跨本体的统一物理表征尚未形成;三是闭环墙,真实试错代价昂贵、反馈缓慢,难以规模化。

“物理AI从‘能演示’走向‘能干活’,关键不在于单点模型能力大小,而在于能否形成可泛化、可优化、可进化的通用具身智能系统。”姚卯青表示。

版权声明:
作者:dingding
链接:https://www.techfm.club/p/237273.html
来源:TechFM
文章版权归作者所有,未经允许请勿转载。

THE END
分享
二维码
< <上一篇
下一篇>>