WALL-OSS 是一个用于具身智能的开源基础模型,由 XSquare Robot 团队于 2025 年提出。LeRobot 实现改编自他们的开源 WallX 仓库。
X Square Robot 的 WALL-OSS 现已集成到 Hugging Face 的 LeRobot 生态系统中。这是 LeRobot 与 X Square Robot 团队之间一个令人兴奋的合作项目。你现在可以直接通过 LeRobot 对 WALL-OSS 进行后训练、评估和部署。我们的目标是让开源机器人社区更容易定制和部署 WALL-OSS 基础模型。欢迎阅读和探索 WALL-OSS 的论文和代码。
WALL-OSS 团队正在构建具身基础模型,以捕获并压缩世界上最有价值的数据:连续、高保真的物理交互流。通过在模型的决策与身体的真实体验之间建立直接反馈回路,使真正具备泛化能力的智能得以涌现——它不仅理解世界如何运作,还知道如何在其间有效行动。
技术上,WALL-OSS 引入了一种紧密耦合的多模态架构(tightly-coupled MoE 结构),同时集成了离散和连续 action 建模 policy。通过两阶段训练流水线(Inspiration → Integration),模型逐步统一了语义 inference 和高频 action 生成。其核心创新包括:
按照我们的安装指南安装 LeRobot。
运行以下命令安装 WallX 依赖:
pip install -e ".[wallx]"要在 LeRobot 中使用 WallX,请将 policy 类型指定为:
policy.type=wall_x训练 WallX 时,你可以使用标准的 LeRobot 训练脚本并配上适当的配置:
lerobot-train \
--dataset.repo_id=your_dataset \
--policy.type=wall_x \
--output_dir=./outputs/wallx_training \
--job_name=wallx_training \
--policy.repo_id=your_repo_id \
--policy.pretrained_name_or_path=x-square-robot/wall-oss-flow \
--policy.prediction_mode=diffusion \
--policy.attn_implementation=eager \
--steps=3000 \
--policy.device=cuda \
--batch_size=32| 参数 | 描述 |
|---|---|
--dataset.repo_id | 你的训练 dataset 的 Hugging Face Hub 仓库 ID(例如 lerobot/aloha_sim_insertion_human) |
--policy.type | 指定使用 WallX policy 架构 |
--output_dir | 保存训练 checkpoint 和日志的本地目录 |
--job_name | 本次训练运行的名称标识符(用于日志记录/追踪) |
--policy.repo_id | 训练好的模型将被推送到的 Hugging Face Hub 仓库 ID |
--policy.pretrained_path | 用于初始化的预训练 WallX 权重路径(官方 WALL-OSS checkpoint) |
--policy.prediction_mode | action prediction policy:diffusion 或 fast - diffusion 使用迭代去噪生成 action,fast 则使用下一个 token 预测 |
--policy.attn_implementation | 注意力实现后端 - eager 使用标准 PyTorch 注意力(替代方案包括 flash_attention_2 或 sdpa) |
--steps | 要运行的总训练步数 |
--policy.device | 用于训练的设备(cuda 表示 GPU,cpu 表示 CPU) |
--batch_size | 每个训练批次的样本数量 |
该模型遵循 Apache 2.0 许可证,与原始 WallX 仓库一致。
在 GitHub 上更新