WALL-OSS

WALL-OSS 是一个用于具身智能的开源基础模型,由 XSquare Robot 团队于 2025 年提出。LeRobot 实现改编自他们的开源 WallX 仓库。

X Square Robot 的 WALL-OSS 现已集成到 Hugging Face 的 LeRobot 生态系统中。这是 LeRobot 与 X Square Robot 团队之间一个令人兴奋的合作项目。你现在可以直接通过 LeRobot 对 WALL-OSS 进行后训练、评估和部署。我们的目标是让开源机器人社区更容易定制和部署 WALL-OSS 基础模型。欢迎阅读和探索 WALL-OSS 的论文代码

模型概述

WALL-OSS 团队正在构建具身基础模型,以捕获并压缩世界上最有价值的数据:连续、高保真的物理交互流。通过在模型的决策与身体的真实体验之间建立直接反馈回路,使真正具备泛化能力的智能得以涌现——它不仅理解世界如何运作,还知道如何在其间有效行动。

An overview of WALL-OSS

技术上,WALL-OSS 引入了一种紧密耦合的多模态架构(tightly-coupled MoE 结构),同时集成了离散和连续 action 建模 policy。通过两阶段训练流水线(Inspiration → Integration),模型逐步统一了语义 inference 和高频 action 生成。其核心创新包括:

  • 具身感知增强的多模态预训练:在统一的视觉-语言-action 数据上进行大规模训练,以强化空间、因果和操作理解。
  • 统一跨层级思维链(Uni-CoT):一个单一可微框架,统一了高层指令 inference、子任务分解和细粒度 action 合成,形成了从“理解”到“执行”的连续链条。
  • 专家混合(MoE)action 头:根据任务阶段动态激活专家,并在离散或连续空间中建模 action,以保持稳定的 VLM 先验。
  • 两阶段训练范式
    • 启发(Inspiration)阶段:注入离散 action 先验,以强化空间理解和语义-action 对齐。
    • 整合(Integration)阶段:使用 flow matching 实现高频连续控制。

安装要求

  1. 按照我们的安装指南安装 LeRobot。

  2. 运行以下命令安装 WallX 依赖:

    pip install -e ".[wallx]"

使用方法

要在 LeRobot 中使用 WallX,请将 policy 类型指定为:

policy.type=wall_x

训练

训练 WallX 时,你可以使用标准的 LeRobot 训练脚本并配上适当的配置:

lerobot-train \
    --dataset.repo_id=your_dataset \
    --policy.type=wall_x \
    --output_dir=./outputs/wallx_training \
    --job_name=wallx_training \
    --policy.repo_id=your_repo_id \
    --policy.pretrained_name_or_path=x-square-robot/wall-oss-flow \
    --policy.prediction_mode=diffusion \
    --policy.attn_implementation=eager \
    --steps=3000 \
    --policy.device=cuda \
    --batch_size=32

训练参数

参数描述
--dataset.repo_id你的训练 dataset 的 Hugging Face Hub 仓库 ID(例如 lerobot/aloha_sim_insertion_human
--policy.type指定使用 WallX policy 架构
--output_dir保存训练 checkpoint 和日志的本地目录
--job_name本次训练运行的名称标识符(用于日志记录/追踪)
--policy.repo_id训练好的模型将被推送到的 Hugging Face Hub 仓库 ID
--policy.pretrained_path用于初始化的预训练 WallX 权重路径(官方 WALL-OSS checkpoint)
--policy.prediction_modeaction prediction policy:diffusionfast - diffusion 使用迭代去噪生成 action,fast 则使用下一个 token 预测
--policy.attn_implementation注意力实现后端 - eager 使用标准 PyTorch 注意力(替代方案包括 flash_attention_2sdpa
--steps要运行的总训练步数
--policy.device用于训练的设备(cuda 表示 GPU,cpu 表示 CPU)
--batch_size每个训练批次的样本数量

许可证

该模型遵循 Apache 2.0 许可证,与原始 WallX 仓库一致。

在 GitHub 上更新