摘要由 AI 生成
Hugging Face Papers 于 2026 年 9 月 8 日发布 EmbodiedSkills 框架。该框架旨在提供统一的解决方案,用于编排(orchestrating)、训练(training)和部署(deploying)具身技能视觉语言模型(VLA)代理。
关键实体KEY ENTITIES
EmbodiedSkillsLIBEROQwen3-VLRoboTwin 2.0π₀.₅
事件框架EVENT FRAME
产品发布
Hugging Face
EmbodiedSkills
发布统一框架整合VLA智能体
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
关键词热度
- EmbodiedSkills1
- Qwen3-VL1
- π₀.₅1
- RoboTwin 2.01
- LIBERO1
全部报道(1)SOURCES
↗
EmbodiedSkills 是一个统一框架,用于编排、训练和部署视觉语言动作(VLA)智能体。该框架通过共享的可执行技能接口和包含观察、规划、预检、执行、验证及恢复六个阶段的循环,管理任务在多动作块间的推进。规划器将指令分解为语义子任务,VLA 基于当前子任务执行动作;系统在执行前检查就绪状态,执行后利用新观测进行进度验证,并根据完成情况调整后续动作或触发重规划。该框架同时连接训练与执行:与子任务对齐的演示用于训练底层动作策略,结构化交互轨迹提供高层技能选择监督。论文实例化展示了 Qwen3-VL 和 π₀.₅,在 50 个 RoboTwin 2.0 任务和四个 LIBERO 套件中,任务适配的低层策略平均成功率分别达到 86.20% 和 97.40%。