@erebus关于世界模型的二三思考 中发帖

世界模型的理解
强化学习 POMDP 闭环:智能体→动作→状态→观测→智能体
当前三种“世界模型”的定义是以上闭环过程的三种投影

第一种“世界模型”可看作渲染器,以像素形式输出供人眼使用的观察数据,重视视觉的真实度。其典型代表包括谷歌的 Genie3 或 World Labs 的 RTFM;此类模型能根据用户输入实时生成图像帧,但不能理解三维结构,只是人类视觉层面的“世界”展示
第二种“世界模型”可看作模拟器,其输出的一种包含几何结构和物理定律的世界状态表示,而人类和程序都能在此基础上进行计算或交互。模拟器目前的主要应用场景是作为训练场,实现与世界的模拟交互,测试现实中危险、昂贵或无法运行的场景(智能驾驶或机器人控制)
第三种“世界模型”可看作规划器,在给定一个观察和目标后,规划者会输出下一步该做什么的动作。规划器也被称为 World Action Models,其典型应用是机器人在...