【导读】VLA模型已经会做任务,但真实机器人还是慢!PolicyTrim是一种优化VLA机器人执行效率的方法,无需重新训练。它通过扩展可靠动作序列并减少冗余步骤,帮助机器人更直接完成任务,提升整体速度。
Vision-Language-Action(VLA)模型把视觉观测、语言指令和机器人动作统一到一个策略模型中,使机器人能够根据自然语言完成复杂操作任务。
从OpenVLA、OpenVLA-OFT到π0.5、GR00T,这类模型正在成为具身智能的重要技术路线。
但当VLA模型真正部署到机器人上时,一个关键瓶颈会立刻显现:机器人完成任务的总时间,不只取决于每次推理有多快,也取决于策略到底需要执行多少次推理、多少个真实物理动作。

在同一任务的多次rollout中,VLA模型的执行步数存在显著波动,说明更短、更直接的成功路径是可达的,但当前策略往往只能偶然找到。
动作chunk尾部不可靠:模型一次预测多个动作,但越靠后的动作越容易累积误差,系统不得不频繁重新规划,强行拉长执行长度会降低成功率并增加物理步数。
物理动作冗余严重:即便任务最终成功,轨迹里也可能包含大量纠错、回退和重复动作。
因此,VLA部署效率不仅要看每一步的推理延时,更要看策略效率(policy efficiency):一次预测中有多少动作能放心执行?完成任务到底需要多少真实物理步骤?
已有方法大多从计算侧入手,例如视觉token剪枝、量化、KV-cache复用、蒸馏或推理引擎优化。这些方法可以降低单次推理延迟,但如果策略仍然需要大量冗余物理步骤,真实任务耗时仍然很长。
直接固定执行更长action chunk也并不可靠。
论文中的实验显示,随着强行将动作执行长度变长,成功率可能下降,物理步数反而增加。这说明低质量的尾部预测会把误差带入物理世界,机器人随后需要更多纠错动作。
关键问题:能否在不牺牲任务成功率的前提下,通过后训练,让已有VLA策略自动学会「少走弯路」,用更少物理步骤完成任务?
来自四川大学雷印杰教授领导的团队提出了PolicyTrim——一个面向「策略效率」的两阶段强化学习后训练框架。它不改变VLA架构,也不重新收集专家数据,而是在已有预训练策略之上继续优化机器人真实执行行为。

项目主页:https://inceptionwang.github.io/PolicyTrim/
论文链接:https://arxiv.org/abs/2606.22540
代码链接:https://github.com/INCEPTIONwang/PolicyTrim
模型链接:https://huggingface.co/INCEPTIONwang/PolicyTrim
新方法实现了:
- 3×动作chunk利用率,更长horizon可靠执行;
- 51.4%物理步数减少,压缩冗余修正动作;
- 5.83×端到端最高加速,LIBERO Object/π0.5;
从「算得更快」到「做得更快」
PolicyTrim的核心目标不是替代计算侧加速,而是补上另一个被忽视的维度:减少完成任务所需的前向推理次数次数。它把策略效率拆成两个可优化目标:先扩展可靠动作chunk,再压缩冗余物理步骤。

1. 可靠动作chunk扩展(Reliable Action Chunk Extension)
当前很多VLA策略以action chunk形式输出动作序列,但部署时往往只敢执行前几步。PolicyTrim第一阶段使用dynamic execution horizon exploration:同一组rollout分配不同接受比率,让模型在短、中、长窗口上并行探索可靠边界。
成功完成任务且执行窗口更长的轨迹获得更高reward,鼓励模型把原本不可靠的chunk尾部动作变得更可用。
horizon reward只在组内出现成功轨迹时激活,避免模型在失败情况下盲目追求更长的chunk长度。
2. 冗余感知的步数压缩(Redundancy-Aware Step Reduction)
当可靠horizon被扩展之后,第二阶段进一步减少总物理步数。PolicyTrim引入step-saving reward:成功轨迹用越少步骤完成任务,奖励越高。
step-saving reward 直接把「更短、更直接的成功轨迹」写进优化目标。
group-anchored regularization 抑制不可复现的投机捷径,避免模型只追求短路径却损害成功率。
两阶段顺序优化可以避免「拉长chunk」和「缩短步数」两个目标互相干扰,最终减少完成任务所需的前向推理次数次数。
实验结果
论文在LIBERO、ManiSkill、Meta-World以及真实机器人任务上验证了PolicyTrim,并覆盖π0.5、OpenVLA-OFT、GR00T等不同VLA架构。总体结果显示,PolicyTrim在保持任务成功率稳定的同时,显著提升执行效率。
在LIBERO中,π0.5达到最高5.83倍端到端加速,同时成功率保持98%以上。
跨基准结果显示,PolicyTrim在ManiSkill上最高达到2.36倍加速,在Meta-World上达到2.52倍加速。
跨架构结果显示,重新预训练后的OpenVLA-OFT采用完整两阶段流程可达到2.97倍加速;OpenVLA仅使用第二阶段也能达到1.41倍加速。

定性对比:少走弯路,轨迹更直接
在随机采样的LIBERO任务中,Baseline往往出现冗余纠错动作和目标附近的hesitation/jittering;PolicyTrim的轨迹更平滑、更直接,能够用更少物理步骤完成同一任务,通常能将物理步数压缩至原来的一半左右。

真实机器人部署:模拟中的效率收益可以迁移到物理世界
论文进一步在配有两台Intel RealSense D435i相机的Agilex Piper机械臂上验证真实机器人任务,包括FlipMug、HangMug、TapeBox三类任务。实验覆盖固定目标位置的标准设置,以及抓取过程中随机扰动目标的动态设置。
PolicyTrim在标准设置和动态扰动设置下都维持或提升成功率,同时显著缩短真实执行时间。在标准真实机器人设置下,平均达到1.86倍端到端加速。


从实验结果看,PolicyTrim并不是只优化benchmark指标:在物理机器人上,任务完成时间也能缩短到baseline的一半左右,并且在动态干扰场景中保持鲁棒性。
为什么PolicyTrim有效?
• 面向策略本身提效:它减少冗余动作和不必要的重规划,而不只是降低单次推理延迟。
• 无需从头训练:作为后训练框架,可以基于已有VLA模型继续优化,降低数据收集和训练成本。
• 兼顾速度和成功率:可靠horizon扩展避免盲目拉长chunk,稳定性约束避免短路径投机。
• 可与计算侧加速叠加:PolicyTrim优化前向推理次数次数,VLA-Cache等方法优化每次推理耗时,两条路径正交且可以产生复合加速。
PolicyTrim的核心观点是:对VLA机器人而言,部署效率不只来自更快的模型推理,也来自更高效的策略行为。让机器人「少走弯路」,同样可以带来显著加速。
参考资料:https://arxiv.org/abs/2606.22540

