机器人撬开啤酒瓶盖、泡沫溢出、酒液流入杯中的画面,看起来像真实拍摄,但这些画面并非直接录制自现实,而是由模型在读取机器人动作后生成的序列。Current Robotics 最新发布的 CurrentWorld-0,继其人形全身精细操作模型 Curr-0 之后,推出了一个以真实交互数据为基础的交互式世界仿真器——它不依赖手工编写的物理公式,而是从大量真实世界交互中学习物理行为。
与以往的研究方向相似的系统已有出现,但 CurrentWorld-0 的特点在于同时把三项能力融入同一个模拟器:跨本体(不同形态机器人的共用世界)、多视角(一致的多摄像头观察)以及力-触觉(视觉之外的力觉、触觉预测)。它能建模的不仅是固定的双臂夹爪,还包括移动底盘、配备灵巧手的双足人形等多种机器人形态;处理的对象也远不止刚体,柔性物体和流体在接触与被操作时都能保持物理一致性。
这样一个世界模型的价值很直接:为机器人评测和训练提供一个可大规模扩展的试验场。在现实中,机器人数量、场地限制、人工复位等因素极大限制了并行测试的规模,而传统物理引擎在描述复杂接触、柔性体或液体行为时编写难度大。CurrentWorld-0 的思路是直接“学”下真实世界如何随着动作演化:在机器人做出某个动作后,模型预测接下来世界会如何发展,从而允许大量策略在模型内被并行运行、失败与比较,再把重要问题带回真机验证。
用于评测的世界模型有一个关键要求:动作要“算数”。如果模型在面对真实动作偏差时自动修正并生成更熟悉的成功轨迹,那么评测就失去了意义。Previous work 中提出的动作可控性(action controllability)正是要保证:机器人执行了什么,环境就必须反映真实后果,失败也要真实发生。在此基础上,CurrentWorld-0 进一步解决了三类一致性问题。
其一,跨本体一致性:不同机器人有不同的自由度、运动学和控制参数,模型为每类机器人保留各自的动作子空间(Action Subspace),但它们作用于世界时遵循相同的物理规律,使得不同机体能以各自方式操作同一个世界并共享对世界的理解。其二,多视角一致性:头部、腕部或第三视角相机看到的是同一交互的不同切面,模型需保证当一个视角中物体或接触发生变化时,其他视角的观测也沿同一物理事件一致演化。其三,力-触觉一致性:在发生接触时,视觉、力觉和触觉信号必须共同描述同一物理过程,不能只生成视觉上合理的画面而忽略接触力学的一致性。
在能力展示上,CurrentWorld-0 可以逼真地模拟诸如叠袜子、整理枕头、抹面包、削黄瓜、倒啤酒等任务,无论是柔性物体的形变、复杂接触还是液体流动,都能保持物理连贯性。这种模型不仅追求外观上的真实感,更强调在动作变化时不同视角、不同物体与触觉信息沿同一事件连贯演化的能力。
总结而言,CurrentWorld-0 把从现实交互中学到的规律封装成一个可扩展的、对动作高度敏感的世界仿真器,为大规模机器人评测、策略筛选与安全前置测试提供了新的可能。通过在模型世界中先行试错,研发者可以在把最关键的问题带回真实硬件之前,节省大量时间与成本,并提升对跨机体、多视点与触觉一致性的验证能力。
发表评论