Arxiv Report 2026 08 11 - Owen-Liuyuxuan/everyday_my_arxiv GitHub Wiki

Arxiv Computer Vision Papers - 2026-08-11

Executive Summary

执行摘要

本日报告涵盖2026年8月10日发表在arXiv上的10篇计算机视觉与机器人相关论文。整体来看,具身智能与机器人策略学习成为绝对主线(6篇),同时涉及多模态生成、扩散模型架构分析、自动驾驶动力学建模及分布式训练系统等方向。

主要趋势:机器人学习领域正从“感知-控制”分离范式,向统一的世界模型与价值模型方向演进。多篇论文强调利用时间距离、联合嵌入预测或世界令牌等方式,在训练阶段引入环境动态建模,以提升策略的泛化性与样本效率。与此同时,模型评估与部署的标准化、生态化问题开始受到重视。

重点亮点论文

  • XPolicyLab(第1篇):提出统一的机器人策略评估与部署开放生态,有望成为领域基准工具,工程价值显著。
  • RynnValue(第2篇):将时间距离引入机器人价值基础模型,为大规模价值学习提供了新尺度信号。
  • World Tokens(第4篇):提出训练期世界建模的令牌化方法,增强具身策略对环境结构的表达能力。
  • AdaLN-Zero分析(第6篇):对扩散Transformer中关键归一化模块进行理论剖析,可能影响未来生成模型架构设计。

新兴方向

  • 世界模型与策略学习的深度融合(第4、8篇),尤其是基于联合嵌入预测(JEPA)的视觉-语言-动作模型。
  • 集中训练与评论员分解用于真实世界在线强化学习(第3篇),缓解部署中奖励设计与样本瓶颈。
  • 多模态数据集的统一构建(第5篇)与分布式指令微调中的隐私保护路由(第10篇)也属前沿交叉方向。

建议精读:若关注机器人策略基础能力,优先阅读第2、4、8篇;若关注系统与工程落地,读第1、3篇;若关注生成模型机制,读第6篇;第7篇适用于自动驾驶与车辆动力学融合研究者。

总体而言,本日论文显示**“让机器人从世界中学习”而非“仅从标签中学习”**已成为核心研究共识,跨模态世界模型与可扩展训练基础设施是当前最值得关注的技术杠杆。


Table of Contents

  1. XPolicyLab: A Unified Standard and Open Ecosystem for Robot Policy Evaluation and Deployment
  2. RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance
  3. Efficient Real-World Online Reinforcement Learning for Robot Manipulation via Centralized Training and Critic Decomposition
  4. World Tokens: Enhancing Embodied Policies with Training-Time World Modeling
  5. Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework
  6. Unveiling the Secret of AdaLN-Zero in Diffusion Transformer
  7. Beyond the Plane: Coupling Planar Vehicle Dynamics with Three-Dimensional Road Geometry
  8. JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling
  9. Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots
  10. DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning

Papers

Authors: XPolicyLab Community, Tianxing Chen, Yue Chen, Tian Nian, Zijian Cai, Guangyu Chen, Wenwei Lin, Qiwei Liang, Peicheng Xiang, Kailun Su, Zixuan Li, Junyuan Tang, Yan Qin, Qiangyu Chen, Shaolong Zhu, Xiang Li, Jiahao Zhang, Weijie Wan, Baijun Chen, Honghao Su, Kehe Ye, Shujia Liu, Kaixuan Wang, Haotian Liang, Yunze Liu, Mingleyang Li, Yuran Wang, Boyu Chen, Hongzhe Bi, Shuhe Huang, Hengkai Tan, Jisong Cai, Yao Mu, Jun Guo, Xiaofeng Wang, Zheng Zhu, Weijie Ke, Hengtao Li, Yuhang Tang, Xiaofan Li, Ganlin Yang, Zhangzheng Tu, Shuai Yang, Wenxuan Song, Pengxiang Ding, Kaidong Zhang, Yu Sun, Junliang Guo, Tong Zhang, Yixing Chen, Rongxu Cui, Zongzheng Zhang, Haoxiang Ma, Junhao Cai, Haoyu Zhang, Senqiao Yang, Jinhui Ye, Pengguang Chen, Shu Liu, Xiu Su, Wenhan Fang, Wenhao Li, Yichao Cao, Chengyao Wang, Qiang Chen, Ping Luo, Wenbo Ding

Published: 2026-08-10

Categories: cs.RO

Abstract:

Robot policy evaluation and deployment remain fragmented by model-specific software dependencies, data representations, and runtime interfaces, so that connecting N policies to M evaluation environments requires O(NM) separate integrations. We present XPolicyLab, a unified standard and open ecosystem that reduces this cost to O(N+M). XPolicyLab specifies common observation, action, and trajectory schemas together with a minimal adapter interface for observation updates, action prediction, batched execution, and episode reset, while a dependency-isolated client/server architecture separates policy inference from environment execution, so that each side retains its native software stack and may run locally or remotely. The ecosystem integrates 42 robot policies and standardizes their installation, debugging, serving, and evaluation workflows. Across these adapters, model-specific code varies by an order of magnitude while the environment-facing loop stays within a few lines of a fixed reference, confirming that the contract confines heterogeneity to the policy side. In a controlled study, conforming to the standard reduces the integration effort of a representative policy from over five hours to two hours, and packaged agent skills reduce it further to thirty minutes. The same adapters serve RoboTwin, RoboDojo simulation, and standardized real-robot evaluation through one interface. XPolicyLab is released as shared infrastructure for reproducible policy comparison and standardized deployment across simulation and physical platforms. Project website: https://xpolicylab.github.io/.

Analysis:

1. 摘要翻译

机器人策略评估与部署因模型特定的软件依赖、数据表示和运行接口而高度碎片化,导致连接N个策略到M个环境需要 $O(NM)$ 次独立集成。我们提出了 XPolicyLab,这是一个统一的标准与开放生态系统,将集成成本降低至 $O(N+M)$。XPolicyLab 定义了通用的观测、动作及轨迹模式,并提供了最小化适配器接口,涵盖观测更新、动作预测、批处理执行和片段重置。其基于依赖隔离的客户端/服务器架构将策略推理与环境执行解耦,使双方保持各自的原生软件栈并可远程部署。该生态集成了42种机器人策略,并标准化了安装、调试、服务与评估流程。实验证明,该标准将典型策略的集成工作量从超过5小时缩短至2小时,若使用包装好的代理技能(Agent Skills)则进一步缩短至30分钟。XPolicyLab 为模拟和物理平台上的可重现策略比较提供了共享基础设施。

2. 方法动机分析

  • 驱动力:解决机器人策略在不同基准测试、仿真器和物理平台间部署时存在的巨大工程摩擦。
  • 现有痛点:当前机器人研究领域缺乏统一的中间件接口。不同策略模型依赖各自的深度学习栈、观测/动作定义及保存格式,导致每次跨平台移植都需要重复编写大量的“胶水代码”。
  • 研究假设:通过引入一个跨平台的标准化“契约(Contract)”和解耦的服务架构,可以将策略的内部复杂性(模型结构、训练方式)与外部运行环境(仿真器、机器人驱动)彻底分离。

3. 方法设计详解

  • 核心逻辑:将策略与环境的交互抽象为“依赖隔离的客户端/服务器”模式。
    • 适配器契约(Adapter Contract):定义了核心操作:update_obs(同步观测)、get_action(预测动作)、reset(清理状态)。适配器负责将外部的统一模式映射为策略内部逻辑。
    • Serving架构:策略服务端(Policy Server)运行在自身独立环境中,通过 WebSocket 和 MessagePack 通信层与环境客户端(Environment Client)连接。
  • 模型结构:分为环境后端、通信层、策略服务端和跨领域工作流工具。这种设计允许策略端采用任意框架(如 PyTorch、JAX 等),而无需在环境侧安装任何冲突的依赖。
  • 关键公式:论文给出策略推理表达式:$a_{t:t+H-1} = g_{out}(\pi_{\theta}(g_{in}(o_t), s_t))$。
    • g_ing_out 分别为输入观测和输出动作的映射器,确保了即便不同策略对观测顺序或动作空间定义不同,其外部接口始终是一致的。

4. 方法对比分析

  • 本质区别:与传统“嵌入式适配”不同,XPolicyLab 采用“过程级隔离(Process-level isolation)”。它不强制改变策略的架构或训练目标,而是通过中间映射层实现零耦合。
  • 创新贡献
    1. 提出了机器人领域的标准化契约。
    2. 利用“Agent Skills”(AI智能体技能)将集成过程自动化,实现了通过 coding agent 自动进行脚手架搭建与审计。
  • 适用场景:适用于需要将同一机器人模型快速部署到 RoboTwin、RoboDojo 等多个仿真或现实环境中进行公平基准测试的研究场景。

5. 实验分析

  • 验证方法:通过 6 名工程师在三种条件下(从头写、手动适配、AI智能体辅助)连接 π0.5 策略进行对比测试。
  • 关键结果:从头集成的总时间从 >5小时 降至 2小时,结合智能体技能后降至 ~30分钟,且手写代码量接近于 0。
  • 优势:极大地降低了模型对比的系统噪声,使得排行榜上的成绩差异仅源于算法性能而非部署差异。
  • 局限:依然无法消除物理世界中的实验方差以及有限的真实机器人运行时间这一客观瓶颈。

6. 实用指南

  • 开源情况:已开源,详情见项目主页 xpolicylab.github.io
  • 实现细节:适配时需重点定义 g_in(如图像预处理、物理参数映射)和 g_out(动作维度调整)。使用其提供的 .agents/skills/ 路径下的智能体技能可极大简化工作。
  • 迁移建议:对于新的机器人策略,只需编写一个适配器脚本,将该模型的推理 API 映射到 XPolicyLab 的标准接口,即可接入该生态下的所有基准测试。

7. 总结

  • 核心思想:建立通用的策略-环境通信契约,实现零依赖的标准化部署。
  • 速记版pipeline
    1. 部署独立的策略服务器(加载原生模型)。
    2. 编写适配器,将标准观测映射给模型并解析模型动作。
    3. 使用智能体自动化审计代码,确保接口逻辑合规。
    4. 通过 WebSocket 将模型连接至仿真或真实机器人环境。

Key Findings:

  • We present XPolicyLab, a unified standard and open ecosystem that reduces this cost to O(N+M).

Links:


Authors: Dongchi Huang, Hongyin Zhang, Bohan Hou, Siteng Huang, Zhian Su, Hang Guo, Tong Lu, Zhaofeng Xu, Jiahao Tang, Jianfei Yang, Donglin Wang, Peixi Peng, Mingxiu Chen, Deli Zhao, Xin Li

Published: 2026-08-10

Categories: cs.RO, cs.CV, cs.LG

Abstract:

General-purpose reward models are increasingly the bottleneck for scaling robot learning, yet the recipe for learning value-related capabilities from large-scale heterogeneous corpora remains underexplored. Existing approaches tie supervision to task-internal anchors such as preferences or normalized progress, none of which transfer cleanly across embodiments and data sources. We introduce RynnValue, an open-source value foundation model for robotic manipulation that replaces these anchors with temporal distance, the directed cost-to-go from an observation to the language-specified goal. Because temporal-distance labels can be derived directly from timestamps, RynnValue scales to over 7,000 hours and roughly 3M instruction-conditioned clips without preference or progress annotations. To make temporal-value learning reliable at scale, we combine random temporal sampling, temporal-order shuffling, and value-isolation attention, suppressing shortcuts that would leave predictions insensitive to failures and regressions. Trained without preference labels, RynnValue attains an average Kendall's tau_a of 0.675 on RBM-EVAL-OOD, surpassing the fully preference-supervised state of the art (0.655) and more than doubling a progress-only counterpart (0.292), while generalizing zero-shot to unseen tasks, embodiments, and viewpoints. Converted into dense rewards via potential-based shaping, it raises real-world policy success from 52.5% to 72.5% online and from 63.8% to 82.5% offline. These results establish temporal distance as a scalable supervision target and practical reward interface for generalist robot policies.

Analysis:

1. 摘要翻译

通用奖励模型已成为扩展机器人学习的瓶颈,但从大规模异构语料库中学习价值相关能力的路径仍未得到充分探索。现有的方法通常依赖于偏好(preferences)或归一化进度(normalized progress)等任务内部锚点,这些锚点难以跨越不同的机器人实施(embodiments)和数据源进行迁移。我们引入了 RynnValue,这是一个用于机器人操作的开源价值基础模型,它用“时间距离(temporal distance)”——即从当前观测到语言指定目标的直接剩余时间成本——取代了这些锚点。由于时间距离标签可以直接从时间戳中导出,RynnValue 无需偏好或进度注释,即可扩展到超过 7,000 小时的机器人数据和约 300 万个指令条件片段。为了实现大规模可靠的价值学习,我们结合了随机时间采样、时间顺序打乱和价值隔离注意力机制,有效抑制了预测对失效和回归不敏感的捷径。在无需偏好标签的情况下,RynnValue 在 RBM-EVAL-OOD 上的平均 Kendall’s $\tau_a$ 达到 0.675,超越了完全依赖偏好监督的现有技术,并使纯进度监督的基线性能翻倍。该模型实现了对未见任务、实施和视角的零样本泛化。通过势能函数转换,它将在线和离线真实世界机器人策略的成功率分别从 52.5% 和 63.8% 提升至 72.5% 和 82.5%。

2. 方法动机分析

  • 驱动力:解决机器人学习中缺乏通用、可扩展的奖励评估接口这一核心痛点。
  • 痛点
    • 手工设计的奖励难以泛化;
    • 现有的“归一化进度”锚点只是轨迹内的相对坐标,而非真正的代价(cost-to-go),导致难以跨任务、跨实施统一价值度量。
  • 研究假设:时间距离(即hitting-time cost-to-go)是一个更通用、更可扩展的监督目标,能够将异构的机器人数据统一在同一个价值评估接口下。

3. 方法设计详解

  • 核心流程
    1. 数据准备:将多源机器人轨迹通过语义分段和截断重打标签(cutoff relabeling),定义明确的完成点,进而计算时间距离标签。
    2. 输入构建:输入包括指令、机器人元数据和多帧观察序列。
    3. 价值查询与预测:通过“分组时间查询(Grouped Temporal Queries)”机制,对每一帧插入绝对值查询()和相对值查询(<relative_value>)。
    4. 模型处理:使用多模态 LLM 进行编码,通过两个专门的分布头预测绝对时间距离和相对时间位移。
  • 关键机制
    • 价值隔离注意力(Value-Isolation Attention):强制每个时间查询组只能访问自己的视觉-语言上下文,切断跨时间查询的快捷方式,防止通过外推其他查询来预测当前值。
    • 随机时间采样与顺序打乱:打破模型对固定采样频率和固定时序的依赖,迫使模型真正从视觉内容学习价值。
    • 双重头预测:绝对头提供全局锚定(剩余时间),相对头提供局部监督(前后帧位移),两者协同增强了对回归和失效的敏感度。

4. 方法对比分析

  • 本质区别:从“基于比较/进度的偏好排序”转向“基于时间戳的绝对代价回归”。
  • 创新点:利用时间戳这一廉价且普遍的标签作为核心价值信号,消除了对昂贵人类偏好标注的依赖,实现了真正的大规模、跨任务统一。
  • 适用场景:适用于需要复杂长程操作、多样化硬件平台和机器人任务的通用价值评估。

5. 实验分析(精简版)

  • 验证方法:在 RBM-EVAL-OOD 轨迹排序任务和真实世界机器人策略微调(Offline/Online RL)中验证。
  • 关键结论:在不使用任何偏好标注的前提下,性能超越了所有现有的偏好监督方法。
  • 主要优势:极强的鲁棒性和零样本泛化能力;有效缓解了长程任务中的“奖励停滞”和“对失败回归不敏感”的问题。
  • 主要局限:对长程 streaming 推理的支持仍需完善;当前假设接近最小时间目标,未显式考虑能耗或安全性等成本。

6. 实用指南

  • 开源情况:已开源,GitHub 地址:https://github.com/alibaba-damo-academy/RynnValue
  • 实现细节
    • 时间编码:使用 symlog-spaced bins 将时间离散化处理,提高回归精度。
    • 奖励塑形:通过势能转换公式 $\Phi_t = -v_t$ 将剩余时间转换为奖励势能,使得“越高越好”。
  • 迁移可能:该方法极易迁移到任何能够通过时间戳定义完成点的机器人任务中,仅需对齐观测数据即可。

7. 总结

  • 核心思想:利用物理时间戳将通用机器人价值学习转化为目标导向的剩余时间预测。
  • 速记版pipeline
    1. 计算每帧距离完成的绝对剩余时间;
    2. 计算帧间时间差作为相对监督;
    3. 利用价值隔离注意力强制模型理解单帧内容;
    4. 将时间价值映射为潜在势能用于策略优化。

Key Findings:

  • We introduce RynnValue, an open-source value foundation model for robotic manipulation that replaces these anchors with temporal distance, the directed cost-to-go from an observation to the language-specified goal.

Links:


Authors: Changhao Li, Yifang Zhang, Heng Zhang, Davide Torielli, Damiano Gasperini, Arturo Laurenzi, Luca Muratore, Arash Ajoudani, Nikos Tsagarakis

Published: 2026-08-10

Categories: cs.RO

Abstract:

Real-world online reinforcement learning (RL) provides a promising approach for training robotic manipulation policies directly in the physical world, avoiding the sim-to-real gap and enabling continuous policy refinement through human-in-the-loop interaction. Recent methods have demonstrated sample-efficient learning through human intervention but remain limited to small randomization ranges and encounter challenges with the non-stationarity induced by concurrently training multiple agents. To address these limitations, we introduce a unified framework that combines centralized training with decentralized execution (CTDE) and a Hybrid Reward Architecture (HRA). This enables multiple actors to share a centralized multi-head critic. The critic is decomposed into task and grasp heads, corresponding to the sparse task reward and a potential-based grasping reward, respectively. We accordingly reformulate the critic and actor objectives to exploit the decomposed Q-values while explicitly accounting for the categorical action distribution of the discrete gripper policy. Experimental results demonstrate that the proposed framework substantially improves both sample efficiency and policy performance. We validate our approach on two robotic arms and a simulated humanoid robot across tennis ball and banana pick-and-place, pot reset, and simulated block relocation tasks under dimension-wise domain randomization, approximately 5-25x larger than those considered in prior work. Compared with a state-of-the-art baseline, our method improves the success rate from 60% to 80% on tennis ball pick-and-place, from 60% to 90% on banana pick-and-place, and from 25% to 95% on simulated block relocation, while also successfully accomplishing a task where the baseline consistently fails. Videos and more details are available at our project website: https://hil-harc.github.io/.

Analysis:

以下是对该论文的方法分析与总结:

1. 摘要翻译

实时在线强化学习(RL)为在物理世界直接训练机器人操作策略提供了一条有前景的路径,它避免了仿真到现实的差距,并通过人机交互实现策略的持续精进。然而,现有方法在样本效率上虽然有所提升,但仍局限于较小的随机化范围,且在多智能体并发训练时面临非平稳性带来的挑战。为解决这些问题,我们引入了一个统一框架,结合了集中式训练与去中心化执行(CTDE)以及混合奖励架构(HRA)。该架构使多个智能体能共享一个集中式多头Critic。具体而言,我们将连续的笛卡尔手臂姿态控制与离散的抓取器控制解耦为两个Actor策略,并在一个集中式Critic下进行优化。Critic被分解为对应稀疏任务奖励的“任务头”和基于势能的“抓取奖励头”。我们据此重构了Critic和Actor目标函数,以利用分解后的Q值,并明确考虑了离散抓取器策略的类别动作分布。实验结果表明,该框架显著提高了样本效率和策略性能。

2. 方法动机分析

  • 驱动力:在广域操作空间和大规模域随机化(domain randomization)环境下,实现高效、鲁棒的机器人操控训练。
  • 痛点:现有方法(如HIL-SERL)将连续动作与离散抓取器控制强行合并,导致:1.决策边界不可微;2.独立训练导致的非平稳性(Non-stationarity)及Credit Assignment困难;3.单头Critic难以处理高维噪声观察导致的训练不稳定。
  • 研究假设:通过CTDE和Reward Decomposition解耦动作模态,能有效解决多智能体训练中的非平稳性,并降低学习难度。

3. 方法设计详解

  • 流程总结
    1. 架构解耦:将策略分为连续的“手臂控制Actor”和离散的“抓取Actor”。
    2. 集中式多头Critic:两个Actor在执行时独立,但在训练时共享一个集中式Critic。Critic被划分为“任务头”和“抓取头”,分别评估环境任务奖励和基于姿态的抓取奖励(PBRS)。
    3. 异步学习:基于RLPD框架,利用在线交互数据和离线演示(Demo Buffer)进行异步更新,利用策略缓冲区(Policy Buffer)存储包含人工干预的经验。
  • 模型结构:共享特征提取骨干(ResNet+MLP),通过多头输出Q值,结合各Reward Component的TD目标进行优化。
  • 算法逻辑:利用公式 $Q_{HRA} = \sum Q_k$ 将长程价值估计问题拆解为多个子目标,利用离散SAC策略优化抓取动作,避免了动作空间硬离散化带来的精度损失。

4. 方法对比分析

  • 本质区别:从传统的“单一联合策略”转变为“共享集中Critic的异构策略”架构。
  • 创新贡献:引入了HRA以稳定在真实环境下的梯度训练;通过CTDE解决了混合动作空间的非平稳性问题。
  • 适用场景:复杂操作任务,尤其是涉及“动作模态不一致”(连续移动+离散抓取)及需应对高随机化环境的场景。

5. 实验分析

  • 验证方法:在两款机械臂及模拟人形机器人上,测试 टेनिस球抓取、香蕉抓取、重置任务及方块搬运。
  • 关键结果:在训练时间仅160分钟的情况下,P&P任务成功率提升显著(如P&P Banana从60%提升至90%),且在极大随机化范围下保持鲁棒性。
  • 优势:样本效率高,所需人工干预少,对环境噪声不敏感。
  • 局限:依然依赖高质量的Teleoperation演示来启动训练。

6. 实用指南

  • 开源情况:项目主页 https://hil-harc.github.io/
  • 实现细节:关键在于设置 $\lambda_g$ 平衡抓取奖励权重;使用RMSNorm提升计算效率。
  • 迁移建议:对于任何包含“末端执行器开关动作”的机械臂任务,该架构均可直接替换原有DQN/SAC抓取控制器,从而获得更平稳的训练表现。

7. 总结

  • 核心思想:通过分治策略(动作解耦+奖励分解)实现高效混合动作学习。
  • 速记版pipeline
    1. 分解动作:连续移动走Actor-A,离散抓取走Actor-B。
    2. 集中训练:共享Critic评估全局,拆分Critic精细评分。
    3. 引入引导:利用人工干预和势能奖励加速收敛。
    4. 异步更新:云端高效计算,边缘独立执行。

Key Findings:

  • To address these limitations, we introduce a unified framework that combines centralized training with decentralized execution (CTDE) and a Hybrid Reward Architecture (HRA).
  • We validate our approach on two robotic arms and a simulated humanoid robot across tennis ball and banana pick-and-place, pot reset, and simulated block relocation tasks under dimension-wise domain randomization, approximately 5-25x larger than those considered in prior work.
  • Compared with a state-of-the-art baseline, our method improves the success rate from 60% to 80% on tennis ball pick-and-place, from 60% to 90% on banana pick-and-place, and from 25% to 95% on simulated block relocation, while also successfully accomplishing a task where the baseline consistently fails.

Links:


Authors: Qu Tang, Benhui Zhuang, Bo Yuan, Xue Yu, Longteng Guo, Junlan Feng

Published: 2026-08-10

Categories: cs.CV

Abstract:

Vision-language-action (VLA) models are a widely adopted paradigm for embodied policies. They excel at efficient closed-loop control but do not explicitly model how physical scenes evolve as a task unfolds. Recently emerging world-action models (WAMs) leverage pretrained video world models to capture spatiotemporal evolution, yet retaining future generation or a large video backbone in the control loop substantially increases inference cost. We introduce World Tokens, an embodied policy architecture built around a World Adapter that bridges visual-language understanding, world-dynamics modeling, and action generation. It uses world modeling during training to enhance the action policy while preserving efficient deployment. Specifically, the World Adapter transforms VLM features into a fixed set of world tokens, which condition a jointly fine-tuned future-video denoiser and simultaneously serve as the action expert's sole visual-language context. This shared conditioning allows gradients from future-video denoising to directly shape the representation used for action prediction, while exclusive routing prevents the policy from bypassing that representation. At deployment, the world-model branch is removed, leaving only the VLM, World Adapter, and action expert, with no online video-model inference. With a 2B backbone and no embodied action pretraining, World Tokens is highly competitive on LIBERO, attains the best reported averages on SIMPLER, substantially improves real-world R1 Pro success over a matched action-only baseline, and generates each action chunk at VLA-level latency.

Analysis:

以下是对论文《World Tokens: Enhancing Embodied Policies with Training-Time World Modeling》的深度分析:

1. 摘要翻译

视觉-语言-动作(VLA)模型是实现具身智能策略的主流范式。它们擅长高效的闭环控制,但缺乏对物理场景演化过程的显式建模。近期兴起的世界-动作模型(WAMs)利用预训练视频世界模型来捕捉时空演化,但将未来生成或庞大的视频主干保留在控制回路中,会显著增加推理成本。我们引入了“世界令牌”(World Tokens),这是一种围绕“世界适配器”(World Adapter)构建的具身策略架构,旨在连接视觉-语言理解、世界动力学建模与动作生成。该方法在训练时利用世界建模来增强动作策略,同时在部署时保留了极高的执行效率。具体而言,世界适配器将VLM特征转换为固定的世界令牌,这些令牌既作为联合微调的未来视频去噪器的条件,也作为动作专家唯一的视听上下文。这种共享条件机制使得来自未来视频去噪的梯度能够直接塑造动作预测所用的表征,而排他性路由防止了策略绕过该表征。在部署时,视频模型分支被移除,仅保留VLM、适配器和动作专家,无需在线视频模型推理。

2. 方法动机分析

  • 驱动力:解决VLA模型“只看当前外观,缺乏对未来物理变化(如接触、遮挡)预测能力”的痛点,同时规避在线世界模型带来的高计算开销。
  • 痛点:以往的预训练VLM缺乏时间动态监督;而现有的世界-动作模型(WAMs)往往需要在推理侧保留沉重的生成式主干,导致高延迟。
  • 核心假设:如果将未来预测的监督信息通过一个固定规模的“世界令牌”接口强制注入,那么策略模型即使在推理时丢弃视频分支,其保留的表征依然具备“动力学感知”能力。

3. 方法设计详解

  • pipeline与技术细节
    1. 输入与编码:VLM输出变长的Patch和语言Token序列。
    2. World Adapter (Perceiver架构):通过256个学习到的查询(Queries)对VLM序列进行交叉注意力重采样,将其压缩为固定大小的256个“世界令牌”。
    3. 双分支训练
      • 视频分支(训练时):使用World Tokens作为条件,去噪生成未来视频帧。视频的第一帧采用Canny边缘图(Edge Anchor)而非原图,迫使模型更依赖语义而非低层色彩特征。
      • 动作分支:Action Expert(DiT架构)仅以World Tokens为输入,预测动作块。
    4. 梯度约束:通过共享World Tokens作为两个分支的条件,视频去噪的梯度能够回传并微调World Adapter,从而将动态特征“压缩”进这些令牌中。
    5. 部署侧优化:推理时仅需运行VLM + World Adapter + Action Expert,完全丢弃视频分支,无额外推理延迟。

4. 方法对比分析

  • 本质区别:它不是在推理时使用世界模型,而是在训练时将“世界建模”作为一种辅助任务(Auxiliary Task),通过特定的接口(World Tokens)将动态信息蒸馏进策略网络。
  • 创新点
    • 接口强制约束:通过切断动作专家直接接触原始VLM特征的路径,强制所有信息必须经由World Tokens,避免了预测与控制表征分离(Drift)。
    • 空间结构锚定:采用边缘图而非RGB图像作为首帧条件,防止世界模型走捷径,提高了令牌对动态语义的编码质量。

5. 实验分析

  • 验证方法:在LIBERO、SIMPLER模拟器及R1 Pro物理机器人上进行大规模基准测试。
  • 关键结果:在不进行动作预训练的情况下,2B参数模型在LIBERO上达到98.2%的成功率,在R1 Pro物理实验中将成功率从59.4%提升至76.0%。
  • 优势:极低的推理延迟(~61ms),在保持高性能的同时,推理速度远快于传统WAM架构。
  • 局限:依然存在训练时高昂的计算成本;Canny边缘提取器仍属于人工设计的辅助模块。

6. 实用指南

  • 开源情况:论文涉及方法逻辑清晰,可参考其使用Perceiver重采样器配合Flow-matching动作专家的范式。
  • 实现细节:关键在于确保Action Expert完全无法绕过World Tokens读取原始特征。训练时,视频去噪任务必须与动作预测同时进行,以确保表征的协同演化。
  • 迁移可能:该架构非常适合需要“预测性理解”的复杂任务,如长程操作或动态环境下的机器人控制。

7. 总结

  • 核心思想:通过训练时联合建模动态演化,将未来感知蒸馏至固定令牌中。
  • 速记版pipeline
    1. 视觉特征输入适配器得到固定令牌。
    2. 令牌同时输入预测器(训练)与动作器(永久)。
    3. 预测器强制令牌包含动态演化信息。
    4. 部署时删除预测器,轻量化运行。

Key Findings:

  • We introduce World Tokens, an embodied policy architecture built around a World Adapter that bridges visual-language understanding, world-dynamics modeling, and action generation.

Links:


Authors: Dongxu Ge, Shansong Liu, Cheng Gong, Xiao-Lei Zhang, Chi Zhang, Xuelong Li

Published: 2026-08-10

Categories: cs.CV

Abstract:

As an important subfield of cross-modal generation, synthesizing static visual content in the form of images from audio, namely audio-to-image (A2I) generation, has attracted increasing research attention in recent years. Nevertheless, despite the remarkable visual quality of modern text-to-image (T2I) models, the performance of A2I remains fundamentally limited by traditional datasets, which often lack both high-fidelity images and precise cross-modal alignment. As a result, existing methods still struggle to achieve high-quality audio-to-image generation through finetuning strong T2I models, thereby constraining practical applications in this area. Motivated by this gap, we introduce A2I-Set, a unified, high-quality tri-modal dataset consisting of 323K paired audio, images, and detailed text captions, specifically designed for audio-visual research, including audio-conditioned image generation. Besides, we developed a new mixed-source test set for the A2I task through human supervision. We further propose an A2I model, AudioCanvas, fine-tuned on our A2I-Set. Experiments show that AudioCanvas achieves more visually expressive as well as cross-modal alignment results that generally outperforming existing approaches. Our dataset and source code are available at https://github.com/gdx012/A2I-Generation.

Analysis:

作为计算机视觉与机器学习领域的专家,我对这篇论文《Towards Expressive and Faithful Audio-to-Image Generation》的分析如下:

1. 核心贡献摘要

该论文旨在解决现有音频转图像(A2I)生成技术在图像质量与跨模态对齐能力上的局限性。主要贡献是构建了一个包含323K条高质量、三模态(音频-图像-文本)配对数据的大规模数据集 A2I-Set,并提出了基于此数据集训练的生成框架 AudioCanvas,显著提升了音频生成视觉内容的表达力与准确性。

2. 关键创新与方法论

  • 数据集建设(数据驱动的创新): 传统 A2I 研究受限于数据集规模小、质量差。A2I-Set 通过引入文本描述作为桥梁,构建了“音频-文本-图像”三元组,为模型提供了更丰富的语义先验,这实际上是将音频信号转化为高维语义空间下的生成指令。
  • AudioCanvas 框架: 该模型通过在高质量三模态数据集上对强大的 T2I(文本转图像)预训练模型进行精调,充分利用了扩散模型在大规模数据下的通用生成能力,同时优化了从音频特征到视觉条件潜空间的映射,实现了更好的跨模态对齐。
  • 评估体系的完善: 作者通过人工监督构建了一个“混合来源测试集”,解决了以往 A2I 生成缺乏标准评测基准的问题,从而使模型评价更具可靠性和客观性。

3. 对领域的潜在影响

  • 打破跨模态鸿沟: 该研究明确了“音频到图像”生成的主要瓶颈不在于扩散模型本身,而在于缺乏针对该任务的配对数据。这一发现可能促使该领域从单纯的模型改进转向数据工程与多模态对齐的研究。
  • 推动多模态统一表示: 论文证明了在统一框架下融合音频、文本和图像模态不仅可行,而且能通过文本模态的介入(Intermediary)增强音频对图像细节的控制力,为后续的多模态生成模型架构设计提供了范式。

4. 潜在的应用场景

  • 多媒体创作与影视后期: 自动将环境音或电影原声转化为视觉概念图或分镜设计图,辅助创意人员快速实现灵感可视化。
  • 辅助残障人士: 为视障人士提供将音频信息实时转化为图像感知的功能,增强其对周围环境的理解。
  • 数字艺术创作: 基于音乐生成与之风格匹配的抽象艺术画作,即“音频驱动的生成艺术”。
  • 游戏开发: 基于游戏内的环境音效快速生成游戏贴图或背景,实现场景的动态生成。

5. 潜在局限性(基于摘要的推理)

  • 音频信号的抽象性差异: 音频具有高度的时间动态性,而图像是静态的,如何确保模型捕捉到音频中的“关键情感”或“主体信息”而非噪音,依然是一个严峻的挑战。
  • 模型泛化能力: 虽然在 A2I-Set 上表现优异,但针对未见过的音频领域(如极其抽象的音乐或复杂的工业杂音),该模型可能在语义转换上存在“偏离”或“幻觉”。
  • 计算效率: 作为基于 T2I 大模型精调的方案,推理成本可能相对较高,在实时性要求极高的边缘设备上部署可能存在困难。

专家点评: 这篇论文的趣味性在于它不仅是一个工程上的改进,它揭示了文本模态在跨模态翻译中的“催化剂”作用。在 CV 领域,通过引入文本作为“语义锚点”来调解音频与图像之间的巨大模态差异,是目前跨模态生成研究的一个重要趋势。该研究的发布将为 Audio-to-Visual 领域提供一个坚实的基准平台。

Key Findings:

  • Motivated by this gap, we introduce A2I-Set, a unified, high-quality tri-modal dataset consisting of 323K paired audio, images, and detailed text captions, specifically designed for audio-visual research, including audio-conditioned image generation.
  • Besides, we developed a new mixed-source test set for the A2I task through human supervision.

Links:


Authors: Jie Zhu, Mingyu Ding, Boqiang Duan, Leye Wang, Jingdong Wang

Published: 2026-08-10

Categories: cs.CV

Abstract:

Diffusion transformer (DiT), a rapidly emerging architecture for image generation, has gained much attention. However, despite ongoing efforts to improve its performance, the understanding of DiT remains superficial. In this work, we delve into and investigate a critical conditioning mechanism within DiT, adaLN-Zero, which achieves superior performance compared to adaLN. Our work studies three potential elements driving this performance, including an SE-like structure, zero-initialization, and a "gradual" update order, among which zero-initialization is proved to be the most influential. Building on this understanding, we propose an analysis-guided initialization strategy, termed adaLN-Gaussian, which serves both as an empirical validation of our analysis and as a practical initialization method that consistently improves optimization efficiency. On the other hand, inspired by the SE-like structure, we introduce an improved conditioning mechanism called SE-adaLN-Zero. Extensive experiments following DiT on four datasets, especially on ImageNet1K demonstrate the effectiveness and generalization of adaLN-Gaussian and SE-adaLN-Zero. Beyond class-to-image generation, we also evaluate the generalization of the two improved methods on text-to-image generation.

Analysis:

1. 摘要翻译

扩散变换器(DiT)作为一种新兴的图像生成架构备受关注。然而,DiT的性能提升机制仍不明确。本文深入研究了DiT中关键的条件调节机制——adaLN-Zero,并发现了驱动其高性能的三个关键要素:类SE结构、零初始化值和权重的“渐进式”更新顺序。研究表明,良好的零初始化位置是其中最关键的因素,它使条件调节权重能更早地趋向于训练好的高斯分布形态。基于此,本文提出了adaLN-Gaussian,即通过高斯分布初始化条件权重来提升训练效率,并进一步提出了改进的调节机制SE-adaLN-Zero。在四个数据集上的实验验证了上述方法的有效性与泛化能力。

2. 方法动机分析

  • 驱动力:作者旨在揭示DiT中adaLN-Zero机制优于传统adaLN的深层原因,而非仅仅将其视为一个“黑盒”策略。
  • 现有方法痛点:现有研究虽知晓零初始化能提升DiT性能,但缺乏对初始化如何改变权重分布及影响优化路径的理论解释。
  • 研究假设:随着训练进行,条件调节权重自然地趋向于高斯分布,直接利用这一分布进行初始化可以替代繁琐的零初始化,并可能加速收敛。

3. 方法设计详解

  • 核心逻辑:通过对权重分布变化的观察,将“从零开始缓慢积累”的初始化逻辑,替换为“更接近最终形态”的高斯初始化。
  • adaLN-Gaussian
    • 原理:将原先固定为0的条件调制权重(如$W_\alpha, W_\gamma, W_\beta$),改用符合特定标准差(std)的高斯分布初始化。
    • 实现:只需一行PyTorch代码替换(使用nn.init.normal_替代nn.init.constant_),并根据实验网格搜索确定最优std。
  • SE-adaLN-Zero
    • 逻辑:将adaLN-Zero中的调制模块与Squeeze-and-Excitation(SE)结构结合,通过引入压缩比(ratio)来降低参数量。
    • 结构:在调制路径中加入下采样和上采样线性层,模拟SE的通道注意力机制,在减少约14%-24%参数的情况下保持甚至提升了FID指标。

4. 方法对比分析

  • 本质区别:从“依赖初始化训练来学习分布(演化视角)”转变为“利用先验分布进行预配置(设计视角)”。
  • 创新贡献:首次揭示了初始化位置与扩散模型权重分布形态演进的耦合关系,提供了一种即插即用的效率提升方案。
  • 适用场景:适用于所有基于Transformer结构的扩散模型,尤其在长周期训练任务中表现优异。

5. 实验分析

  • 验证方法:在ImageNet1K上进行对比实验,涵盖不同模型规模(DiT-B/L/XL)和不同训练时长。
  • 关键结果:在相同训练步数下,adaLN-Gaussian在FID指标上优于adaLN-Zero,验证了收敛速度的提升。
  • 优势:显著提升训练效率,且不改变原架构,兼容性强。
  • 局限:最终性能提升在长周期训练后趋于平缓,说明初始化更多是加速器而非模型能力上限的突破。

6. 实用指南

  • 开源说明:参考原论文提到的Fast-DiT GitHub仓库,可轻松嵌入。
  • 实现建议:对于新任务,无需死磕零初始化。建议针对$W_\alpha, W_\gamma, W_\beta$分别进行小规模网格搜索确定std(如$8e^{-4}$至$1.2e^{-3}$)。
  • 迁移性:该方法逻辑不仅限于DiT,对于任何包含条件调制(Modulation)的Transformer层均具有普适性。

7. 总结

  • 核心思想:利用权重分布演化的先验,以高斯初始化替代零初始化提升训练效率。
  • 速记版Pipeline
    1. 观察调节层权重的训练分布趋势;
    2. 计算目标分布的统计特性(均值与标准差);
    3. 将原零初始化权重替换为目标高斯初始化;
    4. 结合SE结构实现轻量化调制。

Key Findings:

  • Building on this understanding, we propose an analysis-guided initialization strategy, termed adaLN-Gaussian, which serves both as an empirical validation of our analysis and as a practical initialization method that consistently improves optimization efficiency.
  • On the other hand, inspired by the SE-like structure, we introduce an improved conditioning mechanism called SE-adaLN-Zero.

Links:


Authors: Simon Sagmeister, Phillip Pitschi, Nico Haja, Markus Lienkamp

Published: 2026-08-10

Categories: cs.RO

Abstract:

Simulation is crucial for developing and testing autonomous driving systems. In particular, the development of localization and control algorithms relies on an accurate vehicle dynamics simulation. However, most vehicle dynamics models are two-dimensional while real-world roads are three-dimensional. For example, effects from the three-dimensional road geometry on the Las Vegas Motor Speedway can increase the normal forces on the tires by more than 66% compared to the nominal load at standstill. As a result, even highly detailed planar vehicle dynamics models struggle to accurately reproduce the real vehicle's behavior. While solutions for three-dimensional vehicle dynamics exist, they are rarely adopted, computationally expensive, and complex. To address this issue, we present a novel method to couple planar vehicle dynamics models with real-world three-dimensional road geometry. We transform the planar vehicle state from the vehicle model's two-dimensional plane to its corresponding representation in three-dimensional space. Additionally, we calculate road-geometry-induced forces and moments and apply them to the planar vehicle model. We validate our approach using high-speed data recorded with a full-scale race car on the banked Las Vegas Motor Speedway. Furthermore, on synthetic tracks, we show that our method yields accurate results even in edge cases. Together, our results demonstrate that the gap between planar simulation and real-world three-dimensional roads can be closed without abandoning simpler planar models. To simplify adoption of our method, we provide the implementation as open-source software on github.com/TUMFTM/3d-road-geometry-coupling.

Analysis:

1. 摘要翻译

仿真对于开发和测试自动驾驶系统至关重要,准确的车辆动力学模拟是定位和控制算法研发的基础。然而,现有车辆动力学模型多为二维(planar),而真实道路却是三维的。例如,在拉斯维加斯赛道上,三维几何效应可导致轮胎法向力较静止状态增加超过66%。传统的二维模型难以准确复现车辆的真实行为,而现有的三维车辆动力学建模方法往往计算复杂且不便于使用。本文提出了一种将黑盒二维车辆动力学模型与真实三维道路几何结构耦合的新颖方法。通过将车辆状态从二维平面投影到三维空间,并计算路面几何诱导的力和力矩反馈给模型,我们实现了在保留二维模型简洁性的同时,捕捉三维路面特性的效果。通过拉斯维加斯赛道的真实高速赛车数据和合成赛道验证,该方法不仅准确性高,且计算高效,已开源。


2. 方法动机分析

  • 驱动力:在自动驾驶算法(尤其是赛车等高动态场景)开发中,需要兼顾动力学建模的“透明度”(简单易懂)与对复杂地形(坡度、侧倾、曲率)的适应性。
  • 现有方法痛点:全三维多体动力学模型虽精确,但计算开销大、确定性差、参数繁琐且模型“黑盒化”,严重阻碍了运动控制算法的调试与可解释性。
  • 研究假设:通过在二维平面模型外部添加一个“三维环境适配层”,将路面诱导的几何力和力矩视为外部扰动输入,即可在不修改原模型的前提下,闭合二维与三维动力学之间的精度差距。

3. 方法设计详解

本方法的核心是模块化耦合,分为三个主要处理步骤:

  1. 几何变换 (Geometry Transformation)
    • 将车辆在三维空间的姿态投影至二维“道路平面”。
    • 采用圆弧插值算法构建参考线,解决了Euler积分在大规模路面上产生的累积误差,确保了车辆在非平坦路面上位置计算的准确性。
  2. 测量变换 (Measurement Transformation)
    • 考虑到二维模型的输出(如纵向速度、偏航率)缺乏三维物理效应,作者通过公式推导,将这些物理量映射回三维空间,增加由于地形坡度和侧倾带来的修正项(如由路面曲率和航向变化引入的额外角速度分量)。
  3. 负载计算 (Vehicle Load Calculation)
    • 这是方法的关键:将三维路面对车辆产生的额外力(重力加速度分量、动态载荷变化)和力矩(陀螺效应等)计算出来,直接作为“扰动源”注入到原本的二维模型中。

4. 方法对比分析

  • 本质区别:不重写动力学方程,而是通过“环境修正”的方式对现有二维模型进行“外挂式”升级。
  • 创新点:提出了一个能够将三维路面约束转化为二维平面扰动的通用接口,使得任何能接收外部力的二维模型都能“适配”三维赛道。
  • 适用场景:适用于对实时性要求极高、需要大量闭环仿真训练的自动驾驶控制与规划任务。

5. 实验分析(精简版)

  • 验证方法:使用四个极端合成赛道(验证几何逻辑)和真实拉斯维加斯赛车数据(验证物理真实性)。
  • 关键结果:在拉斯维加斯赛道上,该方法较基础的二维模型将法向加速误差降低了约95%,侧向加速度误差降低了约78%。
  • 优势与局限:优势是计算高效(平均单步计算仅9.5μs),且模型完全透明;局限在于它是基于刚体质心动力学,忽略了复杂的悬架运动学和车轮细节。

6. 实用指南

  • 开源情况:代码已发布至 GitHub
  • 迁移建议:该框架高度解耦。只需确保现有的仿真模型支持 外部力和力矩 输入,即可通过计算所需的变换矩阵将其接入该模块。
  • 实现注意:处理小曲率路段时需使用文中的小角度近似公式(Eq. 9-10),以避免数值奇异性。

7. 总结

  • 核心思想:利用外部扰动建模实现二维动力学模型的三维空间适配。
  • 速记版Pipeline
    1. 计算路面曲率并将车辆位姿投影到二维平面;
    2. 将二维车身的位姿和运动状态转换至三维参考系;
    3. 根据三维地形实时计算外部力和力矩;
    4. 将这些“三维补偿”量反馈给二维模型作为驱动输入。

Key Findings:

  • To address this issue, we present a novel method to couple planar vehicle dynamics models with real-world three-dimensional road geometry.
  • We validate our approach using high-speed data recorded with a full-scale race car on the banked Las Vegas Motor Speedway.
  • Furthermore, on synthetic tracks, we show that our method yields accurate results even in edge cases.
  • To simplify adoption of our method, we provide the implementation as open-source software on github.com/TUMFTM/3d-road-geometry-coupling.

Links:


Authors: Yihan Lin, Jiawei He, Shifeng Bao, Chen Zhao, Yang Li, Xiaobo Wang, Yan Wang, Cheng Chi, Jing Zhang

Published: 2026-08-10

Categories: cs.RO

Abstract:

Robust robot control benefits from explicitly modeling state transitions, but video-generation world action models (WAMs) introduce substantial deployment cost. Existing latent WAMs avoid explicit future generation, but often compress predictive representations or separate predictive modeling from the representations used for action generation. We introduce JEPA-WAM, a latent WAM built in a pretrained V-JEPA space, which couples latent transition prediction with continuous action generation through a shared predictor. JEPA-WAM predicts a spatially structured joint current-future target that captures task-shared visual temporal structure between current and future observations, while preserving dense patch-level correspondence. Through the shared predictor, transition supervision directly shapes the backbone, from which dedicated representations are extracted for action prediction. The same design can also be instantiated in pretrained VLA policies while preserving their original perception and action pathways. On LIBERO-Plus, JEPA-WAM achieves 79.2%, the best result without large-scale robot-policy pretraining, while its pretrained $π_{0.5}$ instantiation reaches 86.3%, achieving the best overall performance. Experiments on RoboTwin 2.0 and real-world bimanual manipulation further demonstrate strong generalization under visual and spatial shifts.

Analysis:

以下是对JEPA-WAM论文的深度分析:

1. 摘要翻译

稳健的机器人控制依赖于对状态转换的显式建模,但基于视频生成的世界模型(WAM)引入了极高的部署成本。现有的潜在世界模型虽然避免了显式的未来帧生成,但往往通过压缩预测表示或将预测建模与动作生成解耦来折中。我们提出了JEPA-WAM,这是一个建立在预训练V-JEPA空间中的潜在世界模型,它通过一个共享的预测器将潜在转换预测与连续动作生成耦合起来。JEPA-WAM预测一个空间结构化的联合“当前-未来”目标,在保留密集的补丁级(patch-level)对应关系的同时,捕获任务共享的视觉时间结构。通过共享预测器,转换监督直接作用于主干网络,从而提取出用于动作预测的专用表示。该方案同样适用于预训练的VLA策略,且无需改变其原始感知与动作路径。在LIBERO-Plus基准上,JEPA-WAM在不进行大规模机器人策略预训练的情况下达到了79.2%的成功率,而其预训练的$\pi_{0.5}$实例达到了86.3%,实现了整体最优表现。在RoboTwin 2.0及真实世界双臂操作中的实验进一步验证了其在视觉与空间偏移下的强泛化能力。

2. 方法动机分析

  • 驱动力:作者试图解决机器人学习中“如何在不进行昂贵的逐帧视频预测前提下,引入强有力的时序监督”这一核心问题。
  • 痛点
    1. 显式生成成本高:传统视频生成式WAM推理极其缓慢。
    2. 表示压缩失效:将未来状态压缩为少量隐变量或子目标会导致细粒度空间信息的丢失。
    3. 监督解耦:现有的潜在WAM多将“预测模块”和“策略模块”分开训练,导致转换监督对策略的影响仅是间接的。
  • 研究假设:通过预测一个空间结构化的联合“当前-未来”目标,并利用共享预测器进行端到端优化,能让策略网络学到不仅是未来状态,更是状态间的演化逻辑。

3. 方法设计详解

  • 联合目标构造:不预测单一的未来帧,而是将当前帧$O_t$与未来帧$O_{t+\delta}$堆叠,通过冻结的V-JEPA编码器生成$Y_{t,t+\delta}$。这使得目标明确包含了时序演化信息(即“从哪儿变到哪儿”)。
  • 共享预测器设计:模型核心是Qwen2.5-0.5B,输入包括视觉令牌、任务指令和动作占位符。
    • 转换预测分支:预测器输出的视觉位置隐状态$Q_t^{wm}$通过一个轻量级MLP映射回V-JEPA空间,与$Y_{t,t+\delta}$计算余弦损失。
    • 动作生成分支:同时利用$C_t$(视觉上下文表示)作为条件,通过DiT(Diffusion Transformer)架构进行动作生成。
  • 关键公式:$\mathcal{L} = \mathcal{L}{act} + \lambda{wm}\mathcal{L}{wm}$,通过共享的$\mathcal{L}{wm}$( patch-wise 转换损失)直接塑造特征提取主干,强制模型在生成动作的同时优化时序理解。

4. 方法对比分析

  • 本质区别:不采用解耦的预测头,而是将预测目标与动作生成目标锚定在同一Transformer隐空间,并强制要求预测目标具备“密集空间结构”。
  • 创新贡献:提出了一种基于V-JEPA的“联合当前-未来”监督范式,实现了转换监督对策略的直接引导,且具备极强的“即插即用”特性,无需重新训练即可迁移至其他预训练VLA。

5. 实验分析

  • 结论:在LIBERO-Plus等OOD任务上性能远超基线。消融实验证明,“联合目标”优于“单一未来目标”;“patch级监督”优于“全局池化”。
  • 局限:对语言指令高度敏感,当指令下的动作逻辑完全背离常见时序模式时,通用转换监督的效果会减弱。

6. 实用指南

  • 实现要点:必须保持V-JEPA编码器冻结,仅微调Qwen的LoRA适配器。$\delta$的选择非常重要(实验中设为31或50),这决定了捕捉时序信息的跨度。
  • 迁移迁移:只需在预训练VLA的输入中添加少量“未来令牌”,将这些令牌的输出作为辅助预测任务的输入即可。

7. 总结

  • 核心思想:通过共享预测器将转换预测与动作生成耦合,利用联合时序目标进行全网监督。
  • 速记版pipeline
    1. 编码当前与未来帧为联合目标。
    2. 利用视觉语言模型共享预测转换。
    3. 同时计算动作生成损失与转换预测损失。
    4. 部署时仅执行动作生成分支。

Key Findings:

  • We introduce JEPA-WAM, a latent WAM built in a pretrained V-JEPA space, which couples latent transition prediction with continuous action generation through a shared predictor.

Links:


Authors: Shravan Venkatraman, Omkar Thawakar, Ritesh Thawkar, Abdelrahman Shaker, Rao Muhammad Anwer

Published: 2026-08-10

Categories: cs.CV

Abstract:

Self-improvement for multimodal large language models (MLLMs) is typically driven by reward-based methods that provide only coarse scalar feedback. Distillation offers a richer alternative through dense token-level supervision, but in the visual domain it usually depends on privileged context constructed using external annotations and tools, or stronger models. We introduce \textbf{CVPD} (Contrastive Counterfactual Visual Process Distillation), which, to the best of our knowledge, is the first fully self-contained framework for dense, on-policy, token-level visual self-distillation for MLLMs. CVPD identifies visual blind spots where zooming into a region changes and sharpens the model's answer distribution, while removing the same region leaves the full-image behavior largely unchanged. Such regions reveal perceptual information that the model can encode but fails to consistently utilize under full-image conditioning. We propose a three-gate Counterfactual Criterion that identifies these regions directly from the model's own responses and converts them into dense contrastive supervision for self-distillation. On Qwen3-VL-8B-Instruct, CVPD outperforms six self-evolving baselines across twelve benchmarks, including methods that rely on external GPT-4o supervision, without a single regression. It achieves gains of $+3.60$ on OCRBench, $+3.38$ on MMStar Fine-Grained Perception, and $+3.08$ on MMStar Logical Reasoning, while maintaining or improving performance on broader multimodal benchmarks.

Analysis:

这是一篇关于多模态大模型(MLLM)自我改进的深度技术分析。

1. 摘要翻译

多模态大模型(MLLM)的自我提升通常依赖奖励模型,但这仅能提供粗粒度的标量反馈。知识蒸馏虽能提供细粒度的词元级监督,但通常依赖于利用外部标注、工具或更强模型构建的特权上下文。本文引入了CVPD(对比式反事实视觉过程蒸馏),据我们所知,这是首个用于MLLM的完全自包含、在线、词元级视觉自我蒸馏框架。CVPD识别出视觉“盲点”,即通过缩放聚焦特定区域能显著锐化模型回答分布的区域,同时移除这些区域对整体图像表现几乎无影响。我们提出了一个三门反事实判据,直接从模型自身的响应中识别这些盲点,并将其转化为用于自我蒸馏的对比监督。在Qwen3-VL-8B-Instruct上,CVPD在12项基准测试中优于6个自进化基线,无需任何回归,并在多个细粒度感知任务上取得了显著增益。

2. 方法动机分析

  • 驱动力:解决MLLM在自我进化中面临的“监督信号粗糙”与“依赖外部特权上下文(如OCR工具、检测器)”之间的矛盾。
  • 痛点:现有方法要么仅得到标量奖励(学习效率低),要么为了获得细粒度监督,必须引入外部预训练分割模型或GPT-4进行辅助,破坏了“自包含”的原则。
  • 研究假设:模型本身已经具备了识别细节的潜能,只是在全图输入下被掩盖(或未能充分利用)。如果能通过反事实干预(聚焦 vs. 遮蔽)定位这种能力偏差,即可利用模型自身的输出构建高质量监督。

3. 方法设计详解

CVPD的核心是反事实盲点识别对比式自我蒸馏

  • Phase 1:盲点发现(Counterfactual Blind-Spot Discovery)
    • Candidate Generation:通过自 grounding(询问模型寻找感兴趣区域)、3x3网格、2x2网格生成候选框 $R$
    • 三门判据
      1. 潜能发散 (G1):Crop后的预测分布需远离全图预测,证明该区域含关键信息。
      2. 默认不变 (G2):Ghosting(遮蔽区域)后的分布需接近全图,证明模型在全图模式下确实忽略了该区。
      3. 认知锐化 (G3):Crop后的熵降低,证明该区域能使模型判断更笃定。
  • Phase 2:对比式蒸馏(Contrastive Self-Distillation)
    • 在线蒸馏:构建四个分支(全图学生、Crop教师、Ghost教师、参考模型)。
    • 损失函数
      • 潜能迁移:拉近学生与Crop教师的分布。
      • 对比排序:引入Ghost教师作为“负样本”压力,利用Margin Loss推动学生远离模型自身的非注意默认行为。
      • KL Anchor:通过KL散度约束防止偏离基础推理能力。

4. 方法对比分析

  • 本质区别:与Vision-OPD等依赖外部工具不同,CVPD的特权上下文完全由模型自身对图像的“Crop”和“Ghost”干预生成,实现了真正的自闭环。
  • 创新贡献:引入了反事实逻辑作为过滤指标,成功从嘈杂的区域候选中提取出具有高价值的对比监督信号,且无需任何人工标签。
  • 适用场景:对细粒度视觉理解(如OCR、图表解读、小目标辨识)任务效果极佳。

5. 实验分析(精简版)

  • 关键结论:在OCRBench和MMStar任务上,CVPD实现了3+点的显著增益,且在通用感知基准上无性能回归。
  • 优势:真正的无外部监督、对细粒度细节极度敏感。
  • 局限:对盲点的依赖使得处理某些场景下可能出现“无盲点可发现”的情况,且对模型推理能力上限有一定依赖。

6. 实用指南

  • 开源:项目代码已开源(见GitHub)。
  • 关键超参数:$\tau_{crop}, \tau_{ghost}$(建议设为0.05)、$K=100$(Top-K logit近似)、$\lambda_{rank}=0.5$。
  • 迁移建议:该方法逻辑通用,可迁移至任何拥有高质量Vision-Encoder的MLLM,通过将“Ghost/Crop”视为一种数据增强或训练预处理步骤,大幅提升模型感知力。

7. 总结

  • 核心思想:利用模型反事实干预生成监督,实现无需外部标签的视觉细节蒸馏。
  • 速记版pipeline
    1. 生成候选区,通过反事实判据过滤出“盲点”。
    2. 构造Crop(正向监督)与Ghost(负向压力)教师。
    3. 结合KL约束进行对比式在线知识蒸馏。

Key Findings:

  • We introduce \textbf{CVPD} (Contrastive Counterfactual Visual Process Distillation), which, to the best of our knowledge, is the first fully self-contained framework for dense, on-policy, token-level visual self-distillation for MLLMs. CVPD identifies visual blind spots where zooming into a region changes and sharpens the model's answer distribution, while removing the same region leaves the full-image behavior largely unchanged.
  • We propose a three-gate Counterfactual Criterion that identifies these regions directly from the model's own responses and converts them into dense contrastive supervision for self-distillation.
  • On Qwen3-VL-8B-Instruct, CVPD outperforms six self-evolving baselines across twelve benchmarks, including methods that rely on external GPT-4o supervision, without a single regression.

Links:


Authors: Mainak Singha, Niccolò Biondi, Elisa Ricci, Subhankar Roy

Published: 2026-08-10

Categories: cs.CV

Abstract:

Multimodal Large Language Models (MLLMs) have shown strong multimodal instruction-following ability, but adapting them to diverse visual-language domains typically assumes centralized data access and costly joint training. This is restrictive when data is distributed across private, domain-specific, or permission-limited clients. To this end, we propose DistMoE, a mixture-of-experts (MoE) approach for distributed visual instruction tuning. In each layer of the language decoder it augments the public feedforward network (FFN) with a client-specific private FFN expert, with the goal to acquire domain-specific knowledge. However, independent expert training causes the private FFNs to learn representation of different scale and magnitudes, making merging the experts difficult. To reduce client-specific drift, we introduce a public-anchored expert composition stage that updates only routers and lightweight private projection adapters on a mix of local client data and public data, via an isotropic regularization loss, therefore making it cross-client rehearsal-free composition. During inference, DistMoE performs modular routing over public and private experts, enabling token-wise domain composition without explicit domain labels. Experiments across diverse visual-language benchmarks show that DistMoE enables flexible expert reuse, effective domain adaptation, and competitive performance while preserving modular control over client-specific knowledge. Codes are available at https://github.com/mainaksingha01/DistMoE.

Analysis:

1. 摘要翻译

多模态大语言模型(MLLMs)在指令遵循方面表现出色,但将其适配到不同的视觉语言领域通常假设具有集中式数据访问权限且需要昂贵的联合训练。这在数据分布于私有、领域特定或权限受限的客户端时具有局限性。为此,我们提出了DISTMOE,一种用于分布式视觉指令微调的混合专家(MoE)方法。在语言解码器的每一层,它通过一个客户端特定的私有FFN专家来增强公共FFN,旨在获取领域特定知识。然而,独立训练专家会导致私有FFN学习到的表示在尺度和幅度上存在差异,使得专家合并变得困难。为了减少客户端特定的漂移,我们引入了公共锚定专家组合阶段,该阶段仅在本地客户端数据和公共数据的混合上更新路由器和轻量级私有投影适配器,通过各向同性正则化损失实现跨客户端的无排练组合。在推理时,DISTMOE在公共和私有专家上执行模块化路由,实现无需显式领域标签的Token级领域组合。跨多模态基准测试的实验表明,DISTMOE实现了灵活的专家重用、有效的领域适配和具有竞争力的性能,同时保持了对客户端特定知识的模块化控制。

2. 方法动机分析

  • 驱动力:解决分布式环境下,如何在不共享私有数据集(即无排练/Rehearsal-free)的情况下,将各客户端独立训练的专家高效、兼容地融合成一个统一的多模态模型。
  • 现有方法痛点
    • 中心化限制:MoE-LLaVA等方法需要中心化数据访问。
    • 路由失效:现有独立专家训练方法(如FlexOlmo)在合并时,因缺乏协调,导致不同专家表示的尺度和分布不一致,使路由器在推理时无法有效决策。
    • 专家漂移:仅使用公共模型作为锚点,专家在后续私有训练中仍会产生严重偏移。
  • 研究假设:通过在训练中引入针对残差的各向同性正则化,并校准路由器权重,可以使不同来源的专家表示在数学上具有可比性,从而无需再次看到私有数据即可实现完美合并。

3. 方法设计详解

  • 核心流程
    • Stage-I (知识获取):为每个客户端构建“双专家”MoE(公共FFN + 私有FFN),仅更新私有FFN和对应路由器,使私有专家学习领域知识。
    • Stage-II (专家组合校准):这是创新的核心。
      • 引入线性适配器 $T_m(\cdot)$ 调整私有专家输出。
      • 定义客户端残差 $\Delta_m(x) = h_{em} - h_{pub}$,并强制该残差服从各向同性高斯分布($L_{iso}$),确保各客户端输出的残差在空间中具有一致的量级。
      • 在混合数据(私有+部分公共)上微调路由器参数,使其学会如何“按需调用”不同专家。
  • 创新点:利用公共模型作为锚点(Anchor),将训练任务转化为“残差学习”,并通过正则化强制不同空间的表示向公共基准对齐。

4. 方法对比分析

  • 本质区别:与FlexOlmo相比,DISTMOE不依赖私有数据的“Rehearsal”来微调路由器,而是通过残差正则化和公共数据校准,彻底解耦了专家训练与路由器部署。
  • 创新贡献:提出了一种基于各向同性高斯残差分布的对齐损失,不仅解决了不同域专家表示的“语义/数值不可比”问题,还保证了模块化插入的鲁棒性。

5. 实验分析(精简版)

  • 关键结论:在多个多模态任务(POPE, MME, VQAv2等)中,DISTMOE在不访问其他客户端数据的情况下,性能接近中心化联合训练的上限,且显著优于仅通过简单权重合并的方法。
  • 主要优势:极佳的隐私保护性(无数据外传)、即插即用(无需重训即可组合或剔除专家)、计算效率高。

6. 实用指南

  • 开源情况:代码已开源(github.com/mainaksingha01/DistMoE)。
  • 实现细节:建议在Stage-II中加入约19k样本的公共子集用于校准;适配器 $T_m$ 必须使用线性层,避免引入不必要的非线性以防破坏原专家知识。
  • 迁移可能:非常适合联邦学习场景,特别是模型在不同垂直领域(如医疗、法律、编程)分布式训练后的集成。

7. 总结

  • 核心思想:通过残差各向同性正则化,实现异构领域专家的无缝协作。
  • 速记版Pipeline
    1. 各客户端独立训练私有专家;
    2. 引入轻量级线性投影适配器;
    3. 引入各向同性正则化约束残差分布;
    4. 联合校准路由器权重实现即插即用。

Key Findings:

  • To this end, we propose DistMoE, a mixture-of-experts (MoE) approach for distributed visual instruction tuning.
  • To reduce client-specific drift, we introduce a public-anchored expert composition stage that updates only routers and lightweight private projection adapters on a mix of local client data and public data, via an isotropic regularization loss, therefore making it cross-client rehearsal-free composition.

Links:


⚠️ **GitHub.com Fallback** ⚠️