StellaVLA:基于上下文结构化演示的泛化视觉-语言-动作模型
原标题:StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models
推荐理由
提出测试时单演示适配VLA模型,有效缓解分布外性能崩溃,为机器人泛化提供新思路。
ROBOAIRADAR BRIEF
结构化情报
01
发生了什么
视觉-语言-动作(VLA)模型能遵循指令操作物体,但在场景、视角或物体与训练分布不同时性能急剧下降。StellaVLA提出在测试时通过单个检索演示进行适配,核心是超越单纯模仿,实现跨分布泛化,避免每次新情况都需重新采集数据和微调。
02
为什么重要
提出测试时单演示适配VLA模型,有效缓解分布外性能崩溃,为机器人泛化提供新思路。
信息说明
RoboAIRadar 对公开信源进行聚合、中文整理和价值判断,不替代原始报道。 涉及产品参数、交易金额或公司声明时,请以原文为准。
查看原始报道