StarVLA-Qwen3-VL-8B-PI_v3-PickOrange (QwenPI_v3, freeze-VLM)
针对 LeIsaac SO-101 PickOrange 任务训练的 StarVLA QwenPI_v3 策略:Qwen3-VL-8B 视觉语言骨干(冻结)+ PI_v3 LayerwiseFM cross-DiT 动作头(逐 VLM 层注入,仅训此头)。同骨干换 PI_v3 头,strict 20-round 63.3% 反超 GR00T 头的 53.3% (+10 点),登 leaderboard rank 3。 A StarVLA QwenPI_v3 policy (Qwen3-VL-8B VLM backbone, frozen + PI_v3 LayerwiseFM cross-DiT action head, per-VLM-layer injection) for LeIsaac SO-101 PickOrange. Swapping GR00T head → PI_v3 head on the same backbone lifts strict 20-round from 53.3% → 63.3%.
▶️ 演示视频 / Demo(若上方未渲染,直接打开):https://huggingface.co/wsagi/StarVLA-Qwen3-VL-8B-PI_v3-PickOrange/resolve/main/starvla-8b-pi_v3-pickorange.mp4
🔗 项目仓库 / Project repos:
- vitorcen/isaaclab-experience — Isaac Lab + LeIsaac 多策略横评(parent project)
- vitorcen/LeIsaac-Training — LeIsaac fork(训练脚本 + 设计文档 / training scripts + design docs)
TL;DR
- 任务 / Task:
Grab orange and place into plate— SO-101 单臂依次夹起 3 颗橙子放盘子。 - 数据集 / Dataset:
LightwheelAI/leisaac-pick-orange— 60 episode 遥操示范(36293 frames)。 - 架构 / Architecture:StarVLA QwenPI_v3 = Qwen3-VL-8B(冻结,
freeze_modules: qwen_vl_interface)+ PI_v3 LayerwiseFM action head(cross-DiT,逐 VLM 层 cross-attention 注入,action_horizon=16, 6-DOF)。双相机 @ 448×448。 - 训练 / Training:冻 VLM 只训 PI_v3 head / batch=2 / cosine lr / bf16 / 云端 RTX 4090-48G。step-78000 = 4.3 epoch(数据集 36293 frames = 1 ep)是 strict 20-round 实测峰。
- 评测 / Eval(strict 20-round,leaderboard 同口径;本机 24G 用 8bit (int8) VLM eval):E(🍊)/ep=63.3% (38/60),P(3)=40% (8/20),P(≥2)=55%。
- 🚀 PI_v3 head > GR00T head 实锤:同 Qwen3-VL-8B 骨干,仅把 GR00T flow-matching head 换成 PI_v3 LayerwiseFM head,63.3% vs 53.3% (+10 点),P(3) 35%→40%,登 leaderboard rank 3(仅次于 GR00T-N1.7 68.3% / hi-space N1.7 66.7%,反超 N1.5 58.3% 与同骨干 GR00T head 版)。
关键发现 / Key findings
- **PI_v3 head 比 GR00T head 强(8B 档)**:LayerwiseFM 把动作信息逐 VLM 层 cross-attention 注入,比 GR00T 只在末层接 flow-matching DiT 更充分利用冻结 VLM 的多层特征。同骨干同数据,+10 点 E(🍊)/ep。
- PI_v3 head 收敛更晚、高位平台更宽:3-round sweep 峰区在 step-66k~90k(3.6-5.0 ep);GR00T head 峰在 ~3.3 ep。
- ⚠️ 又一次 20-round 必要性铁证:3-round 快筛里 step-66k 虚高 77.8% (7/9) 看着是峰,strict 20-round 真值仅 50.0%;真峰是 step-78k(3-round 仅 66.7%,20-round 63.3%)。3-round 会把噪声排成假峰,定案必须 strict 20-round。
评测结果 / Evaluation
Strict 20-round(60 oranges total,leaderboard 同条件,8bit eval):
| 指标 / Metric | 值 / Value |
|---|---|
| E(🍊)/ep | 63.3% (38/60) |
| P(3)(单 ep 放满 3 颗) | 40% (8/20) |
| P(≥2) | 55% (11/20) |
| P(1) | 40% (8/20) |
| P(0) | 5% (1/20) |
| 训练量 | step-78000 = 4.3 epoch |
20-ep raw oranges:[1,2,3,2,1,1,1,1,1,2,3,3,3,3,1,1,3,3,3,0]。
完整横评榜单见父项目 README leaderboard:63.3% 排 rank 3,介于 hi-space N1.7 (66.7%) 与 N1.5 LightwheelAI (58.3%) 之间,反超同骨干 StarVLA-Qwen3-VL-8B (GR00T head, 53.3%)。
文件 / Files
| 文件 | 说明 |
|---|---|
checkpoints/steps_78000_pytorch_model.pt |
权重(~18.9 GB,冻结 Qwen3-VL-8B + 训练的 PI_v3 LayerwiseFM head) |
config.yaml |
训练/推理重建配置(base_vlm 指向 Qwen/Qwen3-VL-8B-Instruct,framework.name: QwenPI_v3) |
dataset_statistics.json |
动作反归一化统计 |
modality.json |
6-DOF state/action + 双相机 modality 映射 |
config_so101_qwen3vl8b_pi_v3.yaml |
训练入口配方 |
starvla-8b-pi_v3-pickorange.mp4 |
SO-101 in Isaac Sim 演示 |
推理 / Inference
# serve(starvla_eval 环境,8bit VLM)
STARVLA_VLM_8BIT=1 python LeIsaac/scripts/evaluation/serve_starvla.py \
--ckpt checkpoints/steps_78000_pytorch_model.pt \
--base /path/to/Qwen3-VL-8B-Instruct --port 8013 --img_size 448
# Isaac Sim 客户端 eval(与 leaderboard 同参)
python LeIsaac/scripts/evaluation/policy_inference.py \
--task=LeIsaac-SO101-PickOrange-v0 --policy_type=starvla \
--eval_rounds=20 --episode_length_s=120 --max_round_wall_s=180 \
--step_hz=30 --policy_action_horizon=16 --policy_port=8013 --enable_cameras
serve + client 见 serve_starvla.py 与 StarVLAServicePolicyClient。
限制 / Limitations
- 8bit eval:leaderboard 数为 int8 VLM(≈bf16);全精度 bf16 需 >24G 显存或多卡。
- 峰靠采样:20-round 单 ep 级 CI ≈ ±10%;step-66k/78k 是 sweep 采到的高点。
- 慢:部分轮次撞 180s 墙钟;策略认真抓放但不够果断高效。
引用 / Citations
- StarVLA: StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing, HKUST, 2026 · github.com/starVLA/starVLA.
- PI_v3 / LayerwiseFM action head: StarVLA model_zoo(per-VLM-layer cross-DiT flow-matching)。
- Qwen3-VL: Qwen/Qwen3-VL-8B-Instruct.
- LeIsaac SO-101 PickOrange: LightwheelAI/leisaac.
License
MIT,与 StarVLA 一致(base VLM Qwen3-VL-8B 受其各自许可约束)。
- Downloads last month
- -
Model tree for wsagi/StarVLA-Qwen3-VL-8B-PI_v3-PickOrange
Base model
Qwen/Qwen3-VL-8B-Instruct