# 港科大和社区开源了 StarVLA，一个框架把主流视觉-语言-动作模型串了起来

> 原标题：VLA的PyTorch时刻已至！港科大联手社区开源StarVLA：一个框架揭秘所有主流VLA

- 来源：机器之心 · 公众号
- 发布时间：2026-05-09T02:59:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/16707
- 原文：https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651032137&idx=3&sn=1190f732a6b4a0a8db217b922cce733f

## 摘要

StarVLA 把 VLA（视觉-语言-动作模型）里常用的主干网络、动作输出头、训练策略和评测接口都做成了可插拔的模块，不用再为不同论文各搭一套代码。仓库在 GitHub 上已经拿到 2.2k 星，支持的基准包括 LIBERO、SimplerEnv、RoboTwin 2.0、RoboCasa-GR1 和 BEHAVIOR-1K。正文没披露具体训练成本和...

## 推荐理由

我会先打个折：StarVLA 目前是框架级发布，不是新模型，所以权重不会给到模型首发那么高。但它的价值很实在——把多种 VLA 架构塞进同一套接口，训练和评估不用再东拼西凑，2.2k star 说明社区已经用脚投票了。正文没披露框架内各方法的横向对比数据，这点先别太激动，但统一工具这件事本身对机器人方向的工程效率提升是实打实的。

## 锐评

StarVLA 做的事很直接：把视觉-语言-动作模型（VLA，就是让机器人看懂、听懂并执行动作的模型）里常用的主干网络、动作输出头、训练策略和评测接口都做成可插拔的积木块。以前不同论文各写一套代码，复现和对比很痛苦，现在一个框架就能跑通 LIBERO、SimplerEnv 等五个主流基准。仓库已经拿到 2.2k 星，说明社区确实有这个需求。

不过正文没披露训练成本和具体性能对比数据，这点先别太激动。框架好不好用，关键看模块切换时会不会有隐性的适配坑，以及文档和示例够不够全。另外，支持的基准虽然多，但都是模拟环境，真机部署的验证还缺一块。如果后续能补上真机实验和不同硬件平台的兼容性报告，这个框架对机器人社区的价值会更扎实。
