免费获取学习方案
ARTICLE DETAIL

资讯详情

深耕编程基础知识与建站技术分享的一线实战洞察。

视启未来刘昊:世界模型与具身智能的融合之路

视启未来刘昊:世界模型与具身智能的融合之路 演讲嘉宾刘昊视启未来联合创始人世界模型与具身智能负责人所属大会2026 奇点智能技术大会 · 北京一、引言从看到做的 AI 进化在人工智能的发展历程中“理解世界与改变世界一直是两个相对独立的研究方向。计算机视觉让机器能够看见”自然语言处理让机器能够理解而具身智能Embodied AI则让机器能够行动。视启未来Visionary Future作为一家专注于世界模型与具身智能的创业公司正在推动这两个方向的深度融合。2026 年 11 月视启未来联合创始人刘昊将出席奇点智能技术大会分享他在世界模型与具身智能领域的最新研究成果和工程实践。二、世界模型让 AI 理解物理世界2.1 什么是世界模型世界模型World Model是指 AI 系统对物理世界的内部表征和预测能力。一个完善的世界模型能够感知当前状态通过视觉、触觉、本体感觉等传感器获取环境信息预测未来状态基于当前动作预测环境的下一步变化模拟反事实想象如果采取不同行动结果会怎样# 世界模型核心接口示意classWorldModel:def__init__(self,perception_net,dynamics_net,reward_net):self.perceptionperception_net# 感知编码器self.dynamicsdynamics_net# 动力学预测器self.rewardreward_net# 奖励预测器defencode(self,observation):将原始观测编码为隐状态returnself.perception(observation)defpredict(self,state,action):预测下一状态和奖励next_stateself.dynamics(state,action)rewardself.reward(state,action)returnnext_state,rewarddefimagine(self,initial_state,action_sequence):想象一条动作序列的未来轨迹trajectory[initial_state]foractioninaction_sequence:next_state,_self.predict(trajectory[-1],action)trajectory.append(next_state)returntrajectory2.2 世界模型的三代演进代际代表工作核心特点局限第一代Ha Schmidhuber (2018)变分自编码器 RNN视觉简单、泛化差第二代DreamerV2/V3 (2020-2023)离散隐变量 RSSM复杂场景建模不足第三代Sora/GAIA-1 (2024)扩散模型 Transformer计算成本高、可控性差第四代视启未来方案 (2025)神经辐射场 物理约束正在探索中2.3 视觉感知的世界模型刘昊团队的核心创新在于将视觉感知深度融入世界模型。传统世界模型通常使用低维状态表示如位置、速度而视启未来的方案直接从高维视觉输入RGB-D 图像、点云中学习世界模型。关键技术挑战高维状态空间视觉数据的维度远高于传统状态向量需要高效的压缩表征部分可观测性单视角图像无法完整描述三维场景需要多视角融合动态物体场景中可能存在多个运动物体需要实例级跟踪# 视觉世界模型基于 NeRF 的场景表征classNeuralWorldModel:def__init__(self):self.nerfNeRFNetwork()# 神经辐射场self.dynamicsTransformerDynamics()# 动力学预测defrender(self,camera_pose,time_step):从任意视角渲染场景scene_reprself.nerf.encode_scene(time_step)returnself.nerf.volume_render(scene_repr,camera_pose)defstep(self,action):执行动作并更新世界状态self.dynamics.predict_next_state(action)returnself.get_current_observation()三、具身智能从仿真到现实3.1 具身智能的三层架构视启未来的具身智能系统采用三层架构设计┌─────────────────────────────────────────┐ │ 决策层大语言模型 任务规划器 │ │ 输入自然语言指令 │ │ 输出子任务序列 目标状态描述 │ ├─────────────────────────────────────────┤ │ 技能层视觉运动策略网络 │ │ 输入视觉观测 目标状态 │ │ 输出末端执行器轨迹 / 关节角度序列 │ ├─────────────────────────────────────────┤ │ 控制层低层控制器 安全监控 │ │ 输入期望轨迹 实时传感器反馈 │ │ 输出电机力矩指令 │ └─────────────────────────────────────────┘3.2 Sim-to-Real 迁移的工程实践从仿真环境训练到真实机器人部署是具身智能面临的最大工程挑战之一。刘昊团队在实践中总结出以下关键经验1. 域随机化Domain Randomization在仿真中引入大量随机扰动使策略对真实环境的变化具有鲁棒性# 域随机化配置示例randomization_config{visual:{lighting:{intensity:(0.5,1.5),color_temp:(3000,7000)},texture:{randomize:True,pool_size:1000},camera:{position_noise:0.02,fov_range:(50,70)}},dynamics:{friction:{range:(0.3,1.2)},mass:{scale_range:(0.8,1.2)},joint_damping:{range:(0.01,0.1)}},action:{latency:{range_ms:(0,100)},noise:{std:0.05}}}2. 系统辨识与参数适配在部署前对真实机器人进行系统辨识获取准确的动力学参数并据此微调仿真环境辨识参数方法精度要求关节摩擦恒速运动测试±5%质量分布摆动实验±3%刚度矩阵力控接触实验±10%执行器延迟阶跃响应测试±10ms3. 渐进式部署策略不直接将在仿真中训练的策略部署到真实机器人而是采用渐进式策略仿真验证在多种仿真环境中验证策略鲁棒性硬件在环将真实传感器接入仿真循环验证感知模块受限真实环境在简化真实场景固定物体、已知光照中测试完整真实环境逐步增加场景复杂度最终部署3.3 世界模型驱动的机器人学习视启未来的核心创新是用世界模型替代传统强化学习中的环境交互。传统 RL 需要机器人在真实环境中进行大量试错成本高、风险大。而世界模型允许机器人在想象中学习# 世界模型驱动的强化学习classWorldModelRL:def__init__(self,world_model,policy_network):self.world_modelworld_model self.policypolicy_networkdeftrain_in_imagination(self,initial_states,num_episodes):在世界模型中训练策略forepisodeinrange(num_episodes):staterandom.choice(initial_states)trajectory[]forstepinrange(self.max_steps):actionself.policy.sample(state)next_state,rewardself.world_model.predict(state,action)trajectory.append((state,action,reward,next_state))statenext_state# 基于想象轨迹更新策略self.policy.update(trajectory)defdeploy_to_real(self,real_robot):将训练好的策略部署到真实机器人# 仅需少量真实环境微调real_trajectoriesreal_robot.collect(100)self.policy.finetune(real_trajectories)四、技术挑战与解决方案4.1 视觉泛化真实世界的视觉多样性远超仿真环境。视启未来采用以下策略提升视觉泛化能力多模态融合结合 RGB、深度、触觉等多模态信息自监督预训练在大规模无标注视频数据上预训练视觉编码器持续学习部署后持续收集数据在线更新视觉模型4.2 长程任务规划复杂任务如整理房间需要多步规划和错误恢复能力。解决方案包括分层强化学习高层策略负责任务分解低层策略负责具体执行大语言模型规划利用 LLM 的常识推理能力生成任务计划重规划机制当执行失败时基于当前状态重新生成计划4.3 安全与可靠性机器人与物理世界交互必须保证安全安全层级机制响应时间硬件急停物理按钮 / 力矩限制 1ms控制层安全碰撞检测 / 速度限制 10ms策略层安全危险动作过滤 50ms任务层安全人工监督 / 任务边界 1s五、应用场景与商业化路径5.1 工业质检世界模型可以预测产品的正常外观通过对比实际观测与预测结果的差异检测缺陷。相比传统视觉检测世界模型能够处理更复杂的缺陷类型和光照变化。5.2 家庭服务机器人具身智能的终极场景之一是家庭服务机器人。世界模型让机器人能够理解家庭环境的三维结构预测物体运动规划安全高效的行动路径。5.3 自动驾驶世界模型在自动驾驶中的应用包括场景理解从多视角图像构建三维场景表征轨迹预测预测其他交通参与者的未来行为决策规划基于世界模型进行反事实推理选择最优驾驶策略六、总结与展望刘昊在视启未来的工作展示了世界模型与具身智能融合的巨大潜力。从仿真到现实从感知到行动这一技术路线正在推动 AI 从数字世界走向物理世界。2026 年 11 月奇点智能技术大会聆听刘昊分享世界模型与具身智能的最新突破。大会信息2026 奇点智能技术大会 C 及系统软件技术大会时间2026 年 11 月 20-21 日地点中国·北京万达文华酒店参会报名https://boolan.com/enroll/c1051/event/1162?channelseo立即报名探索世界模型与具身智能的融合未来
返回列表