StarVLA-Qwen3-VL-8B-PI_v3-PickOrange (QwenPI_v3, freeze-VLM)

针对 LeIsaac SO-101 PickOrange 任务训练的 StarVLA QwenPI_v3 策略:Qwen3-VL-8B 视觉语言骨干(冻结)+ PI_v3 LayerwiseFM cross-DiT 动作头(逐 VLM 层注入,仅训此头)。同骨干换 PI_v3 头,strict 20-round 63.3% 反超 GR00T 头的 53.3% (+10 点),登 leaderboard rank 3。 A StarVLA QwenPI_v3 policy (Qwen3-VL-8B VLM backbone, frozen + PI_v3 LayerwiseFM cross-DiT action head, per-VLM-layer injection) for LeIsaac SO-101 PickOrange. Swapping GR00T head → PI_v3 head on the same backbone lifts strict 20-round from 53.3% → 63.3%.

▶️ 演示视频 / Demo(若上方未渲染,直接打开):https://huggingface.co/wsagi/StarVLA-Qwen3-VL-8B-PI_v3-PickOrange/resolve/main/starvla-8b-pi_v3-pickorange.mp4

🔗 项目仓库 / Project repos

TL;DR

  • 任务 / TaskGrab orange and place into plate — SO-101 单臂依次夹起 3 颗橙子放盘子。
  • 数据集 / DatasetLightwheelAI/leisaac-pick-orange — 60 episode 遥操示范(36293 frames)。
  • 架构 / Architecture:StarVLA QwenPI_v3 = Qwen3-VL-8B(冻结,freeze_modules: qwen_vl_interface)+ PI_v3 LayerwiseFM action head(cross-DiT,逐 VLM 层 cross-attention 注入,action_horizon=16, 6-DOF)。双相机 @ 448×448
  • 训练 / Training:冻 VLM 只训 PI_v3 head / batch=2 / cosine lr / bf16 / 云端 RTX 4090-48G。step-78000 = 4.3 epoch(数据集 36293 frames = 1 ep)是 strict 20-round 实测峰。
  • 评测 / Evalstrict 20-round,leaderboard 同口径;本机 24G 用 8bit (int8) VLM eval):E(🍊)/ep=63.3% (38/60),P(3)=40% (8/20),P(≥2)=55%。
  • 🚀 PI_v3 head > GR00T head 实锤:同 Qwen3-VL-8B 骨干,仅把 GR00T flow-matching head 换成 PI_v3 LayerwiseFM head,63.3% vs 53.3% (+10 点),P(3) 35%→40%,登 leaderboard rank 3(仅次于 GR00T-N1.7 68.3% / hi-space N1.7 66.7%,反超 N1.5 58.3% 与同骨干 GR00T head 版)。

关键发现 / Key findings

  • **PI_v3 head 比 GR00T head 强(8B 档)**:LayerwiseFM 把动作信息逐 VLM 层 cross-attention 注入,比 GR00T 只在末层接 flow-matching DiT 更充分利用冻结 VLM 的多层特征。同骨干同数据,+10 点 E(🍊)/ep。
  • PI_v3 head 收敛更晚、高位平台更宽:3-round sweep 峰区在 step-66k~90k(3.6-5.0 ep);GR00T head 峰在 ~3.3 ep。
  • ⚠️ 又一次 20-round 必要性铁证:3-round 快筛里 step-66k 虚高 77.8% (7/9) 看着是峰,strict 20-round 真值仅 50.0%;真峰是 step-78k(3-round 仅 66.7%,20-round 63.3%)。3-round 会把噪声排成假峰,定案必须 strict 20-round。

评测结果 / Evaluation

Strict 20-round(60 oranges total,leaderboard 同条件,8bit eval):

指标 / Metric 值 / Value
E(🍊)/ep 63.3% (38/60)
P(3)(单 ep 放满 3 颗) 40% (8/20)
P(≥2) 55% (11/20)
P(1) 40% (8/20)
P(0) 5% (1/20)
训练量 step-78000 = 4.3 epoch

20-ep raw oranges:[1,2,3,2,1,1,1,1,1,2,3,3,3,3,1,1,3,3,3,0]

完整横评榜单见父项目 README leaderboard:63.3% 排 rank 3,介于 hi-space N1.7 (66.7%) 与 N1.5 LightwheelAI (58.3%) 之间,反超同骨干 StarVLA-Qwen3-VL-8B (GR00T head, 53.3%)

文件 / Files

文件 说明
checkpoints/steps_78000_pytorch_model.pt 权重(~18.9 GB,冻结 Qwen3-VL-8B + 训练的 PI_v3 LayerwiseFM head)
config.yaml 训练/推理重建配置(base_vlm 指向 Qwen/Qwen3-VL-8B-Instruct,framework.name: QwenPI_v3
dataset_statistics.json 动作反归一化统计
modality.json 6-DOF state/action + 双相机 modality 映射
config_so101_qwen3vl8b_pi_v3.yaml 训练入口配方
starvla-8b-pi_v3-pickorange.mp4 SO-101 in Isaac Sim 演示

推理 / Inference

# serve(starvla_eval 环境,8bit VLM)
STARVLA_VLM_8BIT=1 python LeIsaac/scripts/evaluation/serve_starvla.py \
    --ckpt checkpoints/steps_78000_pytorch_model.pt \
    --base /path/to/Qwen3-VL-8B-Instruct --port 8013 --img_size 448

# Isaac Sim 客户端 eval(与 leaderboard 同参)
python LeIsaac/scripts/evaluation/policy_inference.py \
    --task=LeIsaac-SO101-PickOrange-v0 --policy_type=starvla \
    --eval_rounds=20 --episode_length_s=120 --max_round_wall_s=180 \
    --step_hz=30 --policy_action_horizon=16 --policy_port=8013 --enable_cameras

serve + client 见 serve_starvla.pyStarVLAServicePolicyClient

限制 / Limitations

  • 8bit eval:leaderboard 数为 int8 VLM(≈bf16);全精度 bf16 需 >24G 显存或多卡。
  • 峰靠采样:20-round 单 ep 级 CI ≈ ±10%;step-66k/78k 是 sweep 采到的高点。
  • :部分轮次撞 180s 墙钟;策略认真抓放但不够果断高效。

引用 / Citations

License

MIT,与 StarVLA 一致(base VLM Qwen3-VL-8B 受其各自许可约束)。

Downloads last month
-
Video Preview
loading

Model tree for wsagi/StarVLA-Qwen3-VL-8B-PI_v3-PickOrange

Finetuned
(514)
this model

Dataset used to train wsagi/StarVLA-Qwen3-VL-8B-PI_v3-PickOrange

Collection including wsagi/StarVLA-Qwen3-VL-8B-PI_v3-PickOrange

Paper for wsagi/StarVLA-Qwen3-VL-8B-PI_v3-PickOrange