ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

从世界模拟器到数据引擎:Boundless-World-Model为VLA模型生成3类训练数据的实践方法

从世界模拟器到数据引擎:Boundless-World-Model为VLA模型生成3类训练数据的实践方法 【免费下载链接】boundless-world-modelHigh-fidelity world models for general embodied intelligence, such as data engines and world simulators.项目地址https://gitcode.com/gh_mirrors/bo/boundless-world-model点击查看免费下载Boundless-World-ModelBWM是一个开源的、物理一致的动作条件视频世界模型基于 Wan2.2-TI2V-5B 构建作为机器人操作场景下的低成本高保真世界模拟器与数据引擎。它接收「首帧画面 机器人动作序列」自回归地生成后续操作视频从而为 VLAVision-Language-Action模型批量产出视频、动作、提示词3 类训练数据。本文带你完整走一遍这套数据生成流程。1. 为什么 VLA 模型需要世界模型生成数据VLA 模型的训练样本天然是「视频 动作 文本」三元组模型看着画面、理解任务指令、输出控制动作。但真实机器人采集数据成本高、场景单一很快成为训练瓶颈。BWM 的思路是把世界模型变成数据引擎给定某一时刻的首帧图像和一段机器人动作序列世界模型自回归推出未来几十帧画面原始动作序列与任务描述文本天然保留下来无需人工标注。于是「视频、动作、提示词」三元组被完整地合成出来直接可用于 VLA 训练。2. 先看效果它在竞赛中的成绩在 CVPR 2026 WorldArena Challenge 中BWM 团队的表现印证了这套数据生成质量BLMTrack 1世界模型质量与 Track 2 Data Engine数据引擎开源模型均排名第 1BWM-fastTrack 1 总榜排名第 2。从榜单可以看到BWM 在 Visual Quality、3D Accuracy、Controlability 等维度都位居前列——这正是数据引擎最需要的能力生成数据不仅要「好看」还要「可控、物理合理」。3. BWM 生成的 3 类训练数据数据类别内容在训练中的作用 视频动作条件下自回归 rollout 的操作视频视觉观测输入 动作14 维末端执行器动作序列Parquet 文件动作标签/条件 提示词任务描述文本prompt语言指令输入仓库的 demo/ 目录就是一个现成的数据样例demo/demo.jsonl元数据清单每行一条样本包含video视频路径、actionParquet 动作路径、prompt任务描述三个字段正是三元组的索引demo/adjust_bottle/data/chunk-000/14 维动作序列的 Parquet 文件demo/stat.json动作归一化统计min/max/p01/p99/mean/std训练 VLA 时对动作做百分位裁剪归一化必需。4. 实践步骤从克隆到生成第一条数据 ️4.1 环境搭建git clone https://gitcode.com/gh_mirrors/bo/boundless-world-model cd boundless-world-model conda create -n BWM python3.10.20 conda activate BWM pip install torch2.8.0 torchvision0.23.0 torchaudio2.8.0 --index-url https://download.pytorch.org/whl/cu128 pip install diffsynth2.0.11 pip install -r requirements.txt4.2 准备模型权重需要下载两个模型均从公开模型平台获取Wan2.2-TI2V-5B基础模型 → 放到models/Wan2.2-TI2V-5BBWM 微调权重step-12000.safetensors→ 放到ckpt/BLM。4.3 配置本地路径并一键推理cp scripts/local.example.sh scripts/local.sh编辑 scripts/local.sh填入MODEL_PATHSWan2.2-TI2V-5B 路径与CKPT_PATHBWM 权重路径然后运行bash scripts/infer_example.sh推理脚本 scripts/infer.py 会从 demo/demo.jsonl 读取样本首帧 动作序列自回归生成完整操作视频输出到outputs/infer/episode0.mp4等文件。推理参数可在 configs/infer/infer.yaml 中查看720p672×896分辨率、57 帧窗口、9 帧历史、adaln动作注入模式。5. 数据是如何被生成的自回归 Rollout生成过程的核心逻辑在 scripts/infer.py 的自回归循环中以首帧为起点真实数据集只提供第一帧画面分块外推每次以「历史帧 未来动作」为条件生成 57 帧窗口中新增的若干帧再把新帧接回历史循环直到覆盖整条轨迹动作条件注入动作序列先经 wan_video_action/models/wan_video_action_encoder.py 中的WanVideoActionEncoder一个轻量 MLP编码成嵌入再注入 Wan DiT 的时间嵌入中以「非侵入式」的方式实现全局动作控制——不改动底层 DiT 结构。这套设计的巧妙之处首帧是真实观测动作是真实执行记录生成的视频因此同时具备「真实起点 真实控制 高保真外观」比纯想象式生成的数据更可靠。技术细节可延伸阅读 docs/wan_video_action_notes.md 与 docs/wan_video_action_encoder_notes.md。6. 从模拟器到数据引擎的 3 个实用技巧 批量产出scripts/infer_example.sh中的MAX_SAMPLES控制单次生成的样本数调大即可批量跑满整个数据集每条 rollout 视频配上原有 Parquet 动作与 prompt 即是一条完整训练样本提升多样性OOD 泛化项目验证过用 AI 生成全新初始场景图更换物体外观/摆放配合同一套动作序列仍能生成连贯视频。这意味着数据引擎可以低成本「一动作多场景」地扩增训练分布动作归一化务必使用 demo/stat.json 这类统计文件对 14 维动作做 p01/p99 裁剪归一化这是 VLA 模型动作分支稳定训练的关键一步。 训练代码用生成数据微调世界模型本身仓库标记为「Coming soon」当前版本已完整开放推理与数据生成能力足以支撑数据引擎用途。7. 关键文件速查文件/目录说明scripts/infer_example.sh一键推理入口scripts/infer.py自回归数据生成主逻辑configs/infer/infer.yaml推理参数配置demo/demo.jsonl三元组样本元数据demo/stat.json动作归一化统计wan_video_action/models/wan_video_action_encoder.py动作编码器源码wan_video_action/pipelines/wan_video_action.py世界模型推理管线docs/内部技术笔记小结Boundless-World-Model 用「世界模拟器 → 数据引擎」的方式把昂贵的机器人数据采集成本转化为一次 GPU 推理的成本为 VLA 模型持续供给视频、动作、提示词三类高保真训练数据。只需约 10 行环境命令你就能跑通第一条合成样本。赞分享【免费下载链接】boundless-world-modelHigh-fidelity world models for general embodied intelligence, such as data engines and world simulators.项目地址https://gitcode.com/gh_mirrors/bo/boundless-world-model点击查看免费下载相关推荐Bogus数据模型设计从实体类到关联数据生成Bogus数据模型设计从实体类到关联数据生成 在软件开发中测试数据的生成往往耗费大量时间。手动编写测试数据不仅效率低下还难以覆盖各种边界情况。Bogus作开发工具测试PEFT模型卡片自动生成训练元数据的最佳实践PEFT模型卡片自动生成训练元数据的最佳实践 痛点与解决方案 你是否在训练PEFT模型时遇到过元数据丢失、配置不完整的问题本文将介绍如何利用PEFT框架自动人工智能大模型微调LoRA揭秘Cosmos-AnomalyGen-Glass-2B工作原理2.9M参数如何驱动AI缺陷生成揭秘Cosmos AnomalyGen Glass 2B工作原理2.9M参数如何驱动AI缺陷生成 在工业视觉检测领域NVIDIA的Cosmos Anomal创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进