Arxiv Report 2026 08 25 - Owen-Liuyuxuan/everyday_my_arxiv GitHub Wiki
Arxiv Computer Vision Papers - 2026-08-25
Executive Summary
ArXiv 计算机视觉日报执行摘要(2026-08-24)
一、总体概览
本期 10 篇论文集中体现了计算机视觉从“单纯感知”向具备推理、行动、可控生成和领域适应能力的视觉智能系统演进的趋势,主要方向包括:
-
视觉-语言-动作(VLA)模型的可靠决策与高效推理
Act with Intent、Think Only When Needed 和 Pointing-VLA 分别从行为意图蒸馏、选择性推理和结构化空间指令接口入手,试图解决 VLA 模型在机器人操作中的效率、可解释性与空间定位问题。 -
视觉语言模型的计算效率优化
E2S-Pruner 关注视觉 token 剪枝,通过渐进式证据融合减少输入视觉 token,代表了在保持性能的同时降低 VLM 推理成本的重要方向。 -
扩散模型与生成式视觉系统的可控性和跨域能力
Mover360、BenthicFlow、MIVIFI 以及 Training-Free Pseudo-Fusion 分别涉及 360°图像编辑、水下环境生成、透视/鱼眼域转换,以及无需训练的组合图像检索,显示扩散模型正从图像生成扩展到复杂场景建模和下游任务增强。 -
面向低资源和专业领域的视觉基础模型
EG-ARSA 面向低资源道路安全审计,Toward a Foundation Plug-and-Play Prior for CT Reconstruction 则将多模态扩散先验引入医学 CT 重建,体现了基础模型向交通安全、医学成像等高价值垂直领域迁移的趋势。
二、值得重点关注的论文
1. Think Only When Needed
该工作从“选择性慢路径干预”角度优化 VLA 操作系统,核心价值可能在于:并非让模型始终进行昂贵的深度推理,而是在不确定或高风险情形下才启用额外推理机制。这一思路兼顾了实时性、推理成本与操作安全性,对实际机器人部署尤其重要。
2. Act with Intent
将行为意图作为蒸馏目标,说明 VLA 训练正在从“直接预测动作”转向建模动作背后的高层目的。若方法能够有效提升长程任务规划、动作一致性和跨任务泛化,将对下一代机器人策略学习具有较强影响。
3. Pointing-VLA
提出带类型信息的空间 grounding 接口,可能为视觉语言模型与机器人控制器之间提供更明确的中间表示。相比仅依赖自然语言或隐式视觉特征,typed spatial grounding 有望提升指令解析、目标选择和精细操作的可靠性。
4. E2S-Pruner
视觉 token 剪枝是降低 VLM 成本的直接技术路径。该论文强调“渐进式两阶段证据融合”,其创新点可能在于在剪枝过程中同时利用局部视觉证据与全局语义证据,从而减少信息损失。对于长图像、视频和高分辨率视觉输入,该方向具有较高实用价值。
5. Toward a Foundation Plug-and-Play Prior for CT Reconstruction
将多模态扩散模型作为可插拔先验用于 CT 重建,代表了生成式基础模型与逆问题求解的结合。若能够在不同扫描协议、噪声水平或数据分布下保持稳定,该工作可能对医学图像重建和专业视觉基础模型的发展产生较大影响。
6. Mover360
360°全景图中的对象移动涉及视域连续性、几何一致性和全景畸变等多重挑战。可控对象操作若能保持跨视角结构一致性,将对沉浸式内容编辑、虚拟现实和全景数据合成具有重要意义。
三、 emerging 研究方向与技术趋势
1. 从动作预测转向“意图—空间接口—动作”分层建模
本期多篇 VLA 论文共同表明,机器人模型正在引入更结构化的决策链:
行为意图 → 空间 grounding → 具体动作
这种分层设计有助于提升可解释性、纠错能力和跨任务泛化能力,也可能成为替代端到端动作回归的重要路线。
2. 自适应计算成为 VLM/VLA 部署重点
E2S-Pruner 和 Think Only When Needed 分别从视觉输入压缩和推理路径选择两端降低计算量。未来系统可能同时具备:
- 输入 token 动态裁剪;
- 按场景难度分配推理预算;
- 高风险操作触发额外验证;
- 快速路径与慢速路径协同。
3. 扩散模型从图像生成走向“可控视觉工具”
本期涉及对象操控、环境生成、图像检索和医学重建,说明扩散模型的角色正在从生成器转变为通用视觉先验、编辑器和检索增强模块。尤其值得关注的是无需重新训练的扩散模型适配方法,其部署成本更低。
4. 领域适应与数据稀缺问题持续受到重视
道路安全、海底环境、鱼眼相机和 CT 重建都具有明显的领域特异性。相关工作反映出研究重点正从单一大规模互联网数据集,转向:
- 低资源领域的专家知识注入;
- 多模态先验的迁移;
- 合成数据和可扩展环境生成;
- 跨相机模型和跨视角域适应。
5. 训练自由或低训练成本方法增多
Training-Free Pseudo-Fusion 代表了利用已有扩散模型和多模态大模型完成新任务的趋势。这类方法能够降低数据标注、模型训练和领域适配成本,但其稳定性、可控性和推理开销仍需重点评估。
四、建议优先阅读全文的论文
第一优先级:VLA 推理与机器人操作
-
Think Only When Needed
适合关注机器人实时控制、推理效率和安全决策的研究人员。 -
Act with Intent
适合研究行为建模、长程任务规划和 VLA 训练范式的读者。 -
Pointing-VLA
适合关注空间 grounding、机器人指令接口和精细操作的研究人员。
这三篇可以结合阅读,形成对当前 VLA 模型中“意图建模—空间指令—自适应推理”路线的整体认识。
第二优先级:基础模型效率与专业领域应用
-
E2S-Pruner
如果研究重点包括 VLM 推理加速、长上下文视觉输入或边缘部署,应优先阅读。 -
Toward a Foundation Plug-and-Play Prior for CT Reconstruction
适合医学影像、逆问题、扩散先验和领域基础模型方向的研究人员。 -
EG-ARSA
适合关注低资源视觉应用、专家知识注入、道路安全和负责任 AI 的读者。
第三优先级:生成式视觉与跨域建模
-
Mover360
适合全景图像编辑、空间一致性和沉浸式视觉内容研究。 -
MIVIFI
适合相机域迁移、鱼眼视觉、多视角生成和自动驾驶感知研究。 -
BenthicFlow
适合水下视觉、合成数据、流匹配和可扩展环境生成研究。 -
Training-Free Pseudo-Fusion
适合组合图像检索、扩散模型应用以及无需训练的多模态方法研究。
五、简要结论
本期最突出的主线是:视觉模型正在变得更具行动性、更结构化,同时更加关注推理效率和领域适应性。VLA 方向的研究重点已不再只是提升动作预测精度,而是开始显式建模意图、空间指令和推理预算;生成式模型则逐步承担场景编辑、环境模拟、跨域转换和专业图像重建等任务。
若只能选择少量论文阅读,建议优先选择:
Think Only When Needed、Act with Intent、Pointing-VLA、E2S-Pruner,以及 CT 扩散先验论文。
它们最能代表当前视觉智能研究中关于可靠性、结构化决策、计算效率和专业领域迁移的核心发展方向。
注:以上摘要主要依据论文题目和作者信息概括研究重点;在未提供论文摘要或正文的情况下,对具体方法、实验结果和性能提升不作确定性判断。
Table of Contents
- EG-ARSA: An Expert-Grounded Open Model for Visual Road Safety Auditing in Low-Resource Settings
- Act with Intent: Distilling Behavior Intent for Vision-Language-Action Models
- E2S-Pruner: Progressive Two-Stage Evidence Fusion for Visual Token Pruning in Vision-Language Models
- Mover360: Controllable Object Manipulation in 360° Panoramic Images
- Think Only When Needed: Prompt-Authority Control for Selective Slow-Path Intervention in Vision-Language-Action Manipulation
- Toward a Foundation Plug-and-Play Prior for Computed Tomography Reconstruction via a Multimodal Diffusion Model
- BenthicFlow: Generating Extensible Underwater Environments via Flow Matching
- MIVIFI: Bridging Perspective and Fisheye Domains for Training Multi-View Fisheye Image Generation Models
- Pointing-VLA: Typed Spatial Grounding Interfaces for Vision-Language-Action Manipulation
- Training-Free Pseudo-Fusion for Composed Image Retrieval with Diffusion Models and Multimodal Large Language Models
Papers
EG-ARSA: An Expert-Grounded Open Model for Visual Road Safety Auditing in Low-Resource Settings
Authors: Md Thamed Bin Zaman Chowdhury, Moazzem Hossain
Published: 2026-08-24
Categories: cs.CV, cs.AI
Abstract:
Road traffic injuries remain a major challenge in low- and middle-income countries, where proactive road safety auditing is limited by incomplete crash records, shortages of qualified auditors, and the high cost of large-scale field inspections. To address this problem, we propose Expert-Grounded Distillation (EGD), a novel artificial intelligence framework that transfers institutional road safety expertise into a compact vision-language model for scalable visual road safety auditing. The key innovation is a quantified expert-grounding stage in which the teacher vision-language model is calibrated against authoritative field audits. Large-scale annotation is permitted only after the teacher reaches substantial agreement with expert risk assessments (Cohen's kappa = 0.74). The calibrated teacher then generates structured supervision that is distilled into an 8-billion-parameter student vision-language model using Low-Rank Adaptation and a single leakage-free prompt. We also introduce Bangladesh Road Safety Audit (BD-ARSA), the first open, expert-grounded Bangladeshi visual road safety audit dataset containing 21,947 image-audit records with near-national coverage, and Expert-Grounded Road Safety Auditor (EG-ARSA), the first vision-language model developed specifically for this task. Experimental results show that grounded fine-tuning substantially improves ordinal risk assessment over the zero-shot baseline, while blind expert evaluation demonstrates that the compact student outperforms both its 31 billion-parameter teacher and Gemini-2.5-Flash. These findings demonstrate that EGD provides an effective and scalable engineering solution for proactive road safety auditing in resource-constrained environments.
Analysis:
1. 摘要翻译
道路交通伤害仍是中低收入国家面临的重大挑战。由于事故记录不完整、合格审计人员短缺以及大规模现场检查成本高昂,主动式道路安全审计难以开展。为此,本文提出“专家锚定蒸馏”(Expert-Grounded Distillation,EGD),将机构化道路安全知识迁移到紧凑型视觉语言模型中,实现可扩展的视觉道路安全审计。
其关键创新是一个量化的专家锚定阶段:使用由国家道路安全研究机构在世界银行资助的农村交通项目中开展的权威现场审计,对教师视觉语言模型进行校准。当教师模型与专家风险判断达到较高一致性(Cohen’s κ=0.74)后,才允许大规模生成标注。随后,校准后的教师生成结构化监督信号,并通过LoRA将其蒸馏到80亿参数的学生视觉语言模型中,训练与推理均采用单一、无信息泄漏的提示词。
本文同时构建BD-ARSA数据集,包含21,947条图像—审计记录,覆盖孟加拉国大部分地区;并提出EG-ARSA模型,这是首个面向该任务的视觉语言模型。实验表明,基于专家锚定的微调显著提升了序数风险评估能力;盲测专家评估显示,紧凑学生模型优于其310亿参数教师模型和Gemini-2.5-Flash。结果说明,在资源受限环境中,专家知识的有效注入可能比单纯扩大模型规模更重要。
2. 方法动机分析
驱动力。 孟加拉国事故数据严重缺失,传统“依据历史事故寻找黑点”的被动安全管理不可靠;而正式道路安全审计依赖多学科专家,无法覆盖全国。因此作者希望用单张道路图像自动生成可解释的风险审计。
现有痛点。 CNN类方法需要大量逐属性标注,跨地区、跨审计标准迁移能力弱,且只能输出类别编码;零样本VLM虽能生成文本,但通常是闭源、未针对本地标准适配,对道路几何、细粒度设施和隐性风险识别较弱。直接使用大模型生成伪标签还会把教师自身的偏差复制给学生。
核心假设。 性能瓶颈主要不在参数规模,而在领域知识是否被正确锚定;只要先用少量权威审计校准教师,再将其结构化经验蒸馏到小模型,学生就可能超过未受约束的大教师。
3. 方法设计详解
3.1 整体Pipeline
-
构建专家基准。 从ARI-BUET为LGED开展的约1,433公里现场审计报告中提取风险和危险因素,归并为12类:视距遮挡、行人设施、路肩、路侧危险、道路标线、交叉口、边坡、速度管理、交通标志、抗滑、排水和公交停靠。
-
形成三层数据。
- Gold:343张由专家逐张说明危险因素的裁剪图,图像—标签对应最明确;
- Silver:707张现场道路图像,由作者将多图与专家危险描述人工对齐并复核;
- Street-view:20,897个全国道路位置,由教师模型生成完整审计。
-
专家锚定教师。 使用Gemma-4-31B作为教师,输入多角度街景和卫星图,并给予LGED规则、类别定义及针对教师错误模式的修正指令,例如避免漏检无路肩、减少对公交站和交叉口的过度判断。先在gold/silver专家数据上迭代提示词,只有达到κ=0.74后才用于全国规模标注。教师输出还经过JSON/类别校验、风险边界规则修正,并抽样人工审核。
-
构造学生监督。 将专家gold、人工对齐silver以及教师生成的street-view统一为结构化JSON,包括危险因素、类别、观察描述、严重度、总体风险和建议。不同来源通过
tasks_available控制监督任务:gold只训练危险因素和风险,silver及street-view还训练建议生成。 -
无泄漏蒸馏。 学生训练和部署只接收一张图像及标准化提示词,不看到审计报告、教师规则或位置 findings。教师依赖外部上下文,学生则将这些规则内化为参数,这种“提示词不对称”是EGD的核心。
3.2 模型与优化
学生为Qwen3-VL-8B-Instruct,冻结视觉编码器,仅对语言骨干注意力层的q、k、v、输出投影施加LoRA(秩16、α=32、dropout=0.05)。训练目标是三项归一化交叉熵的加权和:
[ L=L_{hazard}+L_{risk}+0.5L_{rec} ]
按任务内部token数归一化,避免较长的审计文本压制短风险标签。风险类别严重不均衡,因此仅对Low/Medium/High三个风险logit进行训练期先验调整:
[ \tilde z_c=z_c+\tau\log \pi_c ]
其中(\pi_c)是训练集类别比例,(\tau=1)。推理时恢复原始logit,并可在验证集上学习类别偏移,以在QWK与Low风险召回率之间调节 operating point。作者不对多标签、变长危险因素序列做类别重加权,因为其本质不是固定类别softmax,且困难类别主要受“不可视觉推断”限制,而非样本稀缺。
4. 方法对比、创新与适用性
EGD区别于普通知识蒸馏之处,不是简单复制教师输出,而是把专家审计—教师提示词校准—无泄漏学生内化串成闭环。创新主要包括:量化且有门槛的专家锚定;教师/学生提示词不对称;gold、silver、street-view三层置信度监督;面向LGED农村道路的开放数据与模型。
它最适合事故数据稀缺、专家知识存在但规模有限、且需要低成本巡检的地区。迁移到其他国家或道路标准时,需要重新建立少量机构化专家集、危险分类体系和校准提示词;不能直接假设跨辖区有效。
5. 实验分析
作者使用位置不重叠测试集、QWK、准确率、bootstrap置信区间、盲法专家评估,并将教师以无泄漏提示词测试以避免教师获得不公平的提示优势。代表性结论是:学生相较零样本基座的QWK由0.077提升至约0.482;在专家子集上,学生风险准确率约74%,高于Gemini约59%和无提示锚定教师约36%。主要优势是低成本、可解释、开放和适合单GPU训练。主要局限是单张图像无法可靠判断排水、抗滑及完整道路几何;street-view标签仍含教师噪声,专家真值集中于18个审计地区,且模型目前只覆盖LGED农村/半城市道路。
6. 实用指南
论文开源了BD-ARSA数据集、LoRA适配器和训练代码。复现需先按官方API重建Google街景,再执行位置无交叉划分;使用1024像素图像、bf16、有效batch size 16、学习率 (10^{-4})、cosine schedule、3% warmup、训练2个epoch,单张A100约6.3小时。迁移时应优先复刻“专家校准门控”,而不是直接扩大伪标签规模;同时保留来源置信度、任务掩码和独立专家测试集。
7. 总结
核心思想:专家校准后,把审计经验压入小模型。
速记版Pipeline:
- 收集少量权威现场审计;
- 用专家数据修正并验证教师;
- 生成分层、可追溯的图像审计标签;
- 用无报告提示词训练小型VLM;
- 通过位置隔离和盲测验证真实泛化。
Key Findings:
- To address this problem, we propose Expert-Grounded Distillation (EGD), a novel artificial intelligence framework that transfers institutional road safety expertise into a compact vision-language model for scalable visual road safety auditing.
- Experimental results show that grounded fine-tuning substantially improves ordinal risk assessment over the zero-shot baseline, while blind expert evaluation demonstrates that the compact student outperforms both its 31 billion-parameter teacher and Gemini-2.5-Flash.
Links:
Act with Intent: Distilling Behavior Intent for Vision-Language-Action Models
Authors: Sangoh Lee, Sangwoo Mo, Wook-Shin Han
Published: 2026-08-24
Categories: cs.RO, cs.AI, cs.CV
Abstract:
Vision-Language-Action (VLA) models can turn multimodal context into robot actions, but their action decoders are still trained largely by behavior cloning. This supervises which motor command was demonstrated while leaving implicit the local objective served by the behavior under the instruction. Future-based supervision enriches action learning with frames, latent observations, trajectories, or motion representations, but these signals capture particular realizations of what may happen rather than the shared semantic objective of the forthcoming behavior. We propose Intention Distillation (INDI), which distills behavior-level intent into the action decoder. During training, a frozen teacher VLM interprets a demonstrated segment from the current observation, instruction, coarse action summary, and corresponding execution video. From its standard inputs, the deployed VLA recovers the resulting multimodal intent representation at an intermediate decoder layer and uses it to organize action prediction together with representations of how the behavior unfolds and what it achieves. On SimplerEnv-Bridge, INDI improves GR00T-N1.7 from 64.3% to 84.7%, and on RoboCasa Kitchen it improves the controlled GR00T-N1.7 baseline from 64.1% to 70.3%, with consistent gains on $π_{0.5}$ across both benchmarks. In real-world tasks, INDI improves average success from 62.0% to 68.7%, with gains of up to 12.0 pp on longer-horizon tasks. Further analyses show that the recovered latent is used by the decoder, captures behavior objective and execution progress, and organizes downstream predictions in an objective-dependent manner. These results show that action decoders benefit from explicitly modeling the semantic objective of the behavior they generate.
Analysis:
1. 摘要翻译
视觉-语言-动作(VLA)模型能够将多模态上下文转化为机器人动作,但其动作解码器仍主要通过行为克隆训练,只学习“示范了什么动作”,却没有显式学习该行为在指令下要实现的局部目标。未来帧、轨迹、运动场等监督虽能描述行为如何展开,却通常只对应某一种具体实现,而非不同执行方式背后的共同语义目标。
本文提出意图蒸馏(INDI):训练时使用冻结的教师视觉语言模型(VLM),根据当前观测、指令、粗粒度动作摘要和执行视频解释一段示范行为,提取其多模态行为意图;学生VLA在动作解码器中间层通过可学习意图查询恢复该表示,并利用它共同组织动作预测、视觉结果预测和文本目的预测。部署时移除教师及所有目标生成模块。INDI在SimplerEnv-Bridge上将GR00T-N1.7成功率由64.3%提升至84.7%,在RoboCasa Kitchen上由64.1%提升至70.3%,真实任务平均成功率由62.0%提升至68.7%。
2. 方法动机
驱动力:同一个“接近—抓取—移动”阶段可能服务于不同目标;同一目标也可能由不同轨迹完成。因此动作序列和未来状态都不是最稳定的监督变量,解码器还需要表示“这段行为想完成什么”。
现有痛点:行为克隆只约束低层动作;未来帧、轨迹、光流等方法强调某一种未来实现,容易把目标与具体运动混淆;自由学习的潜变量又可能退化为动作重建码。
核心假设:若把“局部行为目标”作为动作生成前的语义瓶颈,并强制后续解码依赖其内容,策略就能获得更连贯的多阶段控制。
3. 方法设计详解
Pipeline
- 构造教师监督:从成功示范中截取约1.6秒窗口。教师输入当前图像、语言指令、离散化的粗动作摘要及对应视频,并生成一条30–50词的功能目的描述。
- 提取三类目标:
- 意图目标 (I^*):取教师中间层对“多模态输入证据”的隐藏状态,分成8段平均池化,保留对象、关系和上下文信息;
- 文本目的目标 (R^*):取生成目的语句末层表示;
- 视觉结果目标 (V^*):用冻结视觉编码器提取窗口末端观测特征。
这些目标均离线缓存,训练时不再运行教师。
- 改造动作解码器:在原有状态、噪声动作序列之外加入8个干净的意图查询、文本grounding行和视觉grounding行。意图查询先读取VLA上下文与机器人状态,在解码器中点恢复 (I^*)。
- 意图驱动后续预测:中间层之后,动作行读取意图及两类grounding,grounding行读取意图并彼此交互,最终共同预测动作、视觉结果和文本目的。
- 联合训练:总损失为动作流匹配损失、意图余弦对齐损失、视觉/文本表示对齐损失及意图错配损失。错配训练将一个样本的意图替换为另一样本的意图,要求正确意图产生更低的下游损失,从而避免模型只利用“存在一个潜变量”而忽略其内容。
- 部署:只输入图像、指令和本体状态,由学生内部确定性恢复意图;教师、视频、缓存目标和错配分支全部移除。
关键设计是上下文瓶颈:训练时以0.5概率切断动作和grounding对原始VLA上下文的直接访问,迫使信息经过意图查询传递;推理时恢复直接访问。由此意图不是辅助读出,而是实际控制中间状态。
4. 对比与创新
与行为克隆相比,INDI监督的是“行为目的”;与未来预测相比,它蒸馏跨执行方式共享的目标语义;与轨迹潜变量相比,它由具备多模态物理理解的教师提供语义锚点。创新主要在于:①提出行为级意图作为VLA解码器缺失的监督对象;②在解码器中间层恢复并使用教师多模态表示;③通过上下文瓶颈和错配损失保证意图对下游动作具有因果作用。适合长时程、多阶段、同类动作对应不同任务目标的机器人操作。
5. 实验结论
作者在Bridge、RoboCasa、真实双臂桌面任务及OOD物体/干扰物上验证。最具代表性的结果是:Bridge平均成功率提升20.4个百分点;真实任务在干扰物条件下由53%升至62%。消融表明,仅增加grounding或自由潜变量效果有限,教师意图是主要增益来源;清零意图后成功率从85.5%降至45.5%,说明其确实被解码器使用。
优势是提升明显、部署无需教师、额外参数仅约0.6%–1.3%。局限是效果受教师物理理解质量制约,当前意图是每次查询即时恢复的单一表示,不能保持多目标分布、接受人类纠正,也主要依赖成功示范。
6. 实用指南
论文提供项目页面,但所给材料未明确完整训练代码是否公开。复现关键点包括:使用Cosmos-Reason2-8B生成教师缓存;动作按训练集分位数离散化;窗口固定约1.6秒;意图/文本/视觉token数为8/8/每相机16;中点监督;意图错配margin为0.05,context dropout为0.5,辅助损失权重通常为0.5。迁移到其他任务时,应替换教师提示、端点视觉目标和动作窗口,并确保教师能识别目标状态变化;该框架原则上可迁移至导航、装配、工具使用等具有“局部目标—连续动作”结构的任务。
7. 总结
核心思想:用教师语义意图组织动作生成。
速记Pipeline:
- 用视频和动作让教师说明行为目的;
- 缓存教师意图及视觉、文本结果表示;
- 在动作解码器中间层恢复意图;
- 强制动作预测依赖意图内容;
- 部署时仅用原始观测自主恢复意图。
Key Findings:
- We propose Intention Distillation (INDI), which distills behavior-level intent into the action decoder.
- These results show that action decoders benefit from explicitly modeling the semantic objective of the behavior they generate.
Links:
E2S-Pruner: Progressive Two-Stage Evidence Fusion for Visual Token Pruning in Vision-Language Models
Authors: Taoyu Qian, Qi Wang, Daqian Shi, Yuanhao Jiang, Shang Gao, Hualong Yu
Published: 2026-08-24
Categories: cs.CV, cs.AI
Abstract:
Vision-language models typically encode an image into hundreds of visual tokens, incurring substantial inference latency and GPU memory overhead. Existing pruning methods largely rely on attention scores and directly aggregate outputs across attention heads and network layers, making it difficult to characterize evidential uncertainty and conflict. We propose E2S-Pruner, a progressive two-stage evidence-fusion framework for visual token pruning that requires no auxiliary model, trainable parameters, or fine-tuning. In the first stage, E2S-Pruner treats each attention head as an independent evidence source, estimates its reliability from evidence clarity and inter-head consistency, and represents each visual token using three states: important, unimportant, and uncertain. In the second stage, Dempster--Shafer evidence theory is used to quantify inter-layer conflict and fuse complementary evidence from multiple network layers. We further introduce a spatial novelty constraint that promotes coverage of distinct image regions and prevents the retained tokens from concentrating in a few locally salient areas. On LLaVA-1.5-7B, E2S-Pruner retains 98.0%, 96.8%, and 90.6% of the aggregate performance when the average numbers of retained visual tokens are 192, 128, and 64, respectively, while improving throughput by 1.96x and 2.09x under the 128-token and 64-token settings. Experiments on Qwen2-VL-7B further demonstrate cross-model generalization. Code is available at https://github.com/taoyu-qian/E2S-Pruner.git.
Analysis:
1. 摘要翻译
视觉语言模型通常将图像编码为数百个视觉Token,带来较大的推理延迟与GPU显存开销。现有剪枝方法大多依赖注意力分数,并直接聚合不同注意力头和网络层的输出,难以刻画证据的不确定性与冲突。本文提出E2S-Pruner,一种渐进式两阶段证据融合框架,无需辅助模型、可训练参数或微调。第一阶段将每个注意力头视为独立证据源,根据证据清晰度和头间一致性估计可靠性,并以“重要、不重要、不确定”三种状态表示视觉Token。第二阶段利用Dempster–Shafer证据理论量化层间冲突,并融合多层互补证据。此外,作者引入空间新颖性约束,促进不同图像区域覆盖,避免保留Token集中在少数显著区域。在LLaVA-1.5-7B上,平均保留192、128和64个视觉Token时,分别保持密集模型98.0%、96.8%和90.6%的综合性能,并获得1.96倍和2.09倍吞吐提升。
2. 方法动机分析
**驱动力:**视觉Token数量直接决定LLM后续自注意力和前馈网络的计算量,因此需要在尽量不损害视觉理解的前提下删除冗余Token。
**现有痛点:**FastV等方法通常把多头、多层注意力直接平均或求和。这会抹平三类信息:不同头的可靠性差异、不同层的互补证据,以及证据冲突本身。例如某Token在浅层不显著、但在中深层均重要,平均后可能被错误删除。
**核心假设:**注意力不是单一可信分数,而是多个质量不同的证据源;“不确定”不应等同于“不重要”,冲突Token可能恰好包含关键视觉信息。
3. 方法设计详解
Pipeline
-
**获取文本到视觉注意力。**在指定浅层、中层和深层剪枝位置,计算每个文本Token对视觉Token的注意力,并对文本Token求平均,得到头级分数 (a_{l,h,n})。
-
**归一化并映射为支持度。**在当前候选Token集合内进行Softmax: [ r_{l,h,n}=\mathrm{Softmax}n(a{l,h,n}) ] 再通过 [ p_{l,h,n}=\frac{N_lr_{l,h,n}}{1+N_lr_{l,h,n}} ] 将相对注意力转为支持度。平均注意力对应(p=0.5),表示该头没有明显偏好。
-
**估计头级证据可靠性。**对同一Token,先计算各头偏离0.5的平均程度,表示“决策清晰度”;再计算各头与均值的偏差,表示“头间一致性”。二者相乘得到可靠性(\rho_{l,n})。头响应越明确且越一致,可靠性越高;若部分头强支持、部分头强反对,则可靠性下降。
-
**构造D–S质量函数。**令(\bar p_{l,n})为多头支持度均值,构造: [ m(I)=\rho\bar p,\quad m(U)=\rho(1-\bar p),\quad m(\Theta)=1-\rho ] 其中(I)表示重要,(U)表示不重要,(\Theta)表示未知。这样,头间冲突不会被强行压成一个中间分数,而是转化为不确定性质量。
-
**递归融合多层证据。**将当前层质量函数与历史累积质量函数按Dempster规则融合。层间冲突为: [ K=\tilde m_{\text{old}}(I)m(U)+\tilde m_{\text{old}}(U)m(I) ] 融合后得到重要、不重要和不确定质量。Token的重要性采用可然度: [ Pl(I)=m(I)+m(\Theta) ] 它比Belief更保守,因为不确定证据仍可能支持保留。
-
**冲突保护与空间约束。**最终优先级为: [ q=1-(1-Pl(I))(1-K) ] 因此,可然度高或层间冲突强的Token都会获得保护。随后将24×24视觉网格划分为4×4空间单元,每个非空单元中选出(q)最高的代表Token,并给予软奖励: [ \tilde q=(1-\lambda)q+\lambda b,\quad \lambda=0.1 ] 最后进行Top-K剪枝,并在浅、中、深层逐步压缩Token数量。
模块协同
多头可靠性负责判断“当前层证据是否可信”;层间融合负责整合局部纹理、目标结构和全局语义;冲突保护避免删除存在分歧但潜在重要的Token;空间约束则弥补纯语义排序造成的区域坍缩。
4. 方法对比分析
其本质区别不是提出新的注意力,而是把注意力从“标量排序信号”改造成“带可靠性、不确定性和冲突的证据”。相较直接Top-K,它能保留互补证据;相较Token merging,它不改变Token表示,避免视觉上相似但语义不同的区域被合并。创新主要集中在多头可靠性建模、跨层D–S融合和空间新颖性保护。它适合无训练、即插即用的VLM推理加速,尤其适用于复杂场景、空间关系和多层语义均重要的任务。
5. 实验分析
作者在LLaVA-1.5-7B的GQA、SQA、TextVQA、POPE、MME和MMBench上比较,并在Qwen2-VL-7B上验证迁移性;同时进行模块消融、剪枝调度和延迟/显存测试。代表性结论是:平均128个Token时保持约96.8%综合性能并达到1.96倍吞吐;64个Token时仍保持90.6%,吞吐达2.09倍。主要优势是无需训练、跨模型有效、对层间互补信息更稳健。局限是证据缓存增加约21%峰值显存,极低预算下TextVQA等细粒度文字任务容易丢失关键区域。
6. 实用指南
论文已开源:github.com/taoyu-qian/E2S-Pruner。复现时需提取各剪枝层的文本到视觉注意力,使用指定剪枝层和Token预算,默认空间网格(G=4)、奖励系数(\lambda=0.1),并按层递归保存质量函数。该方法无需训练,但需保证视觉Token具有规则空间映射。迁移到其他VLM时,应重新适配视觉网格、注意力接口、剪枝层位置和预算;也可迁移至视频帧Token、文档区域Token或多尺度图像Token。
7. 总结
**核心思想:**用可靠证据融合替代注意力平均剪枝。
速记版Pipeline:
- 收集不同注意力头对视觉区域的判断。
- 根据清晰度和一致性判断证据可信度。
- 将支持、反对和未知信息进行跨层融合。
- 保护冲突区域,并奖励空间上分散的代表Token。
- 在多个层逐步保留最有价值的视觉Token。
Key Findings:
- We propose E2S-Pruner, a progressive two-stage evidence-fusion framework for visual token pruning that requires no auxiliary model, trainable parameters, or fine-tuning.
- We further introduce a spatial novelty constraint that promotes coverage of distinct image regions and prevents the retained tokens from concentrating in a few locally salient areas.
Links:
Mover360: Controllable Object Manipulation in 360° Panoramic Images
Authors: Haoyi Zhong, Fang-Lue Zhang, Andrew Chalmers, Taehyun Rhee
Published: 2026-08-24
Categories: cs.CV
Abstract:
We present Mover360, a controllable object manipulation framework for 360° images. Unlike perspective images, 360° images in equirectangular projection (ERP) exhibit horizontal wrap-around, latitude-dependent distortion, and global scene continuity, which makes object-level edits difficult for existing perspective editors to produce and for users to specify. To address this, Mover360 centers on object Translation (relocating a specified object within an existing panorama) while supporting reference-guided Insert and Remove as auxiliary tasks. Its interface unifies point-, bbox-, and mask-guided control by encoding each task into a fixed prompt and a compact, ERP-aligned instruction map. In the default point mode, a single click relocates an object, allowing the model to infer a plausible size, support, and illumination using panoramic context and an auxiliary depth condition. Structurally, Mover360 is a lightweight adaptation of a pretrained diffusion transformer. To generate paired supervision, we construct a UE5 data-generation pipeline with surface-aware object placement and randomized illumination, yielding large-scale paired data and a dual-domain benchmark of synthetic and real panoramas with ground truth for all three tasks. Across both test domains and two evaluation protocols, Mover360 outperforms strong baselines for perspective editing, insertion, and inpainting in reconstruction fidelity, semantic consistency, and distributional quality. Code and our benchmark dataset are available at https://zhonghaoyi.github.io/Mover360/.
Analysis:
1. 摘要翻译
本文提出 Mover360,一种面向360°图像的可控对象操作框架。与透视图不同,采用等距柱状投影(ERP)的全景图具有水平环绕、随纬度变化的畸变以及全局场景连续性,使现有对象编辑器难以实现可靠编辑,也增加了用户指定目标位置的难度。Mover360以对象平移为核心,同时支持参考图引导的插入和移除。统一接口通过固定任务提示词和紧凑的ERP对齐指令图,支持点、边界框和掩码控制。默认点模式下,用户只需点击目标接触位置,模型便可结合全景上下文和辅助深度估计对象尺寸、支撑关系与光照。模型基于预训练扩散Transformer进行轻量适配。作者还通过UE5构建带表面感知摆放和随机光照的大规模配对数据,并建立包含合成与真实全景的双域基准。实验表明,Mover360在重建保真度、语义一致性和分布质量方面优于多种透视编辑基线。
2. 方法动机分析
**驱动力:**全景编辑不能只修改局部像素,还必须保持球面上的接缝、尺度、遮挡、接触、阴影和反射一致。
**现有痛点:**直接在ERP上编辑会遭遇横向周期断裂和纬度畸变;“投影到透视图—编辑—重投影”虽能缓解畸变,却看不到视锥外的阴影、反射和环境,且会产生边界不连续。
**核心假设:**若模型直接在完整ERP域中学习对象移动,并将空间指令、深度和全局上下文联合输入,就能同时完成源区域背景修复与目标区域对象重建。
3. 方法设计详解
Pipeline
- **输入与控制编码:**输入ERP全景 (I),通过DA2预测深度 (D)。构造三通道指令图 (C=[C_s,C_t,C_p]):分别表示源区域、目标区域和目标接触点。点模式用高斯热图表示,bbox/掩码模式提供更强的尺寸或轮廓约束。
- **任务统一:**Translation使用源区域+目标点/区域;Remove只激活源区域;Insert使用目标点/区域,并额外输入参考物体图像。三类任务分别配套固定提示词。
- **ERP感知预处理:**对VAE输入在水平方向循环填充64像素,编码后裁剪;解码前同样循环扩展并裁剪,以保持左右边界的球面连续性。
- **多条件编码:**输入图、指令图、归一化深度图、可选参考图及目标图分别经VAE编码,条件latent拼接并切分为token。深度按有效值的0和98百分位归一化,再复制为三通道。
- **Transformer生成:**基于Flux2-Klein-4B-Base,通过LoRA适配,不修改主干结构。利用4D RoPE的不同坐标轴区分文本、噪声目标ERP和各条件图,同时保留条件图的二维位置关系。
- **流匹配训练:**目标latent为 (z_0),噪声为 (\epsilon),采样 (t=\sigma(u)),构造 (z_t=(1-t)z_0+t\epsilon),训练模型预测速度 (v=\epsilon-z_0),损失为预测速度与真实速度的均方误差。推理时50步采样生成编辑后ERP。
结构作用
DA2提供几何先验,帮助模型判断目标处的合理投影尺度和支撑面;指令图承担精确空间控制;参考分支只服务Insert;循环VAE处理ERP周期性;Translation通过一次生成同时完成“源处移除”和“目标处放置”,而非串联两个编辑器。
4. 方法对比分析
其本质区别不是提出新扩散主干,而是把透视编辑器适配为全景原生对象编辑器:在完整ERP上下文中生成,使用球面一致的空间指令,并引入深度辅助。创新主要包括:三任务统一接口、点到掩码的渐进控制、UE5表面感知配对数据、ERP循环编码及全景级评测。适合家具重排、虚拟布景、全景场景清理和参考物体插入;不适合需要大范围重新照明、移动建筑等场景级编辑。
5. 实验分析
作者在210个UE5样本和50个真实样本上,以ERP直接编辑及有利于基线的透视重投影两种协议,与多种插入、移除和拖拽方法比较。代表性结论是:Mover360在三任务的大多数指标上领先,尤其能保持全景级一致性;深度条件和更明确的bbox/掩码控制均能提升效果,点控制则以更低交互成本保持竞争力。
优势是全局上下文完整、支持跨接缝移动、能生成接触与光照变化。局限是固定提示词、点目标存在歧义,深度估计可能失效,复杂阴影/反射和大尺度光照变化仍难处理。
6. 实用指南
论文提供代码和基准数据链接。复现重点:准备UE5配对全景、对象掩码、背景和参考图;使用1024×512训练分辨率、AdamW、学习率 (2\times10^{-4})、8张GPU、约8 epochs;LoRA rank/alpha均为32,推理50步、CFG为3。训练时深度随机丢弃率0.1,提示词丢弃率0.01。
迁移到其他任务时,可保留ERP循环VAE和条件latent设计,仅替换任务提示词、指令通道及配对数据;例如可迁移到全景属性修改、物体旋转或多物体布局,但必须重新构造具有真实几何和光照变化的监督数据。
7. 总结
**核心思想:**在完整ERP上下文中生成一致的对象移动。
速记版Pipeline:
- 输入全景,预测深度并标记源、目标位置。
- 将全景、指令、深度和参考图编码为条件。
- 用循环边界和位置编码保持球面连续。
- 通过LoRA扩散Transformer同时修复源处并生成目标物体。
- 解码得到全局一致的编辑后全景图。
Key Findings:
- We present Mover360, a controllable object manipulation framework for 360° images.
- Across both test domains and two evaluation protocols, Mover360 outperforms strong baselines for perspective editing, insertion, and inpainting in reconstruction fidelity, semantic consistency, and distributional quality.
Links:
Think Only When Needed: Prompt-Authority Control for Selective Slow-Path Intervention in Vision-Language-Action Manipulation
Authors: Zhiruo Zhou, Zelin Li, Xiwen Chen, Jiazhuo Li, Chenwei Wang, Huiming Chen, Xiaojun Zhu
Published: 2026-08-24
Categories: cs.RO, cs.AI, cs.CV
Abstract:
Retrieval can efficiently and effectively augment a frozen vision--language--action (VLA) policy without retraining, yet retrieved text becomes a control intervention once it enters the executed prompt. In a matched audit, raw appended text reduces mean success from 92.47% to 3.00%, while meaningful and length-matched meaningless appends both fail on all 500 states. This result identifies \emph{prompt-form collapse}: changing the instruction form, rather than adding useful semantics, can dominate execution. We introduce TOWN-VLA (Think Only When Needed), a prompt-authority interface that separates candidate generation from permission to alter the policy input. A fixed compatibility rule authorizes a canonical compact instruction; otherwise, the interface restores the original Base prompt exactly. Across 900 audited routes, every route follows this contract: 525 routes recover Base with matching hashes, and all 375 authorized prompts preserve the task signature. On a matched $4\times7$ LIBERO-Plus evaluation with 10{,}030 episodes per method, success rises from 69.5% to 73.1% ($+362$ episodes; 95% CI 1.89--5.45 points), improving on six perturbation axes and all four suites. On a physical PiPER arm with a frozen \pizerofive{} checkpoint, success rises from 52.7% to 78.7% over 150 trials per method ($p=3.16\times10^{-6}$). Prompt authority is enforceable for a frozen controller; oracle-free admission calibration is the next deployment target.
Analysis:
1. 摘要翻译
检索能够在无需重新训练的情况下高效增强冻结的视觉-语言-动作(VLA)策略,但检索文本一旦进入实际执行提示词,就会成为控制干预。在匹配审计中,直接追加文本使平均成功率由92.47%降至3.00%;有意义追加和长度匹配的无意义追加均在500个状态上全部失败,说明执行崩溃主要源于提示词形式变化,而非语义质量。为此,本文提出TOWN-VLA(Think Only When Needed),在候选生成与修改策略输入的许可之间建立接口隔离。固定兼容性规则只允许规范化的紧凑指令通过,否则精确恢复原始Base提示词。在900条审计路径中,525条恢复了哈希一致的Base提示词,375条授权提示均保持任务签名。在LIBERO-Plus上,成功率由69.5%提升至73.1%;在冻结π0.5模型和PiPER机械臂上,由52.7%提升至78.7%。冻结控制器的提示词权限可以被强制执行,但免Oracle的准入校准仍是下一步目标。
2. 方法动机
**驱动力:**冻结VLA通常已适应固定指令模板,外部记忆、规划器生成的文本可能因格式、长度和边界变化而破坏策略输入。
**痛点:**现有检索增强方法往往把“候选有用”直接等同于“允许执行”,采用原始计划拼接或Top-K直接注入,缺少显式授权、拒绝和可审计回退机制。
**核心假设:**检索的价值与其控制权限应分离;即使需要慢路径生成候选,也不代表候选文本值得被策略遵循。
3. 方法设计详解
Pipeline
- **输入与冻结策略:**输入任务指令ℓ、图像、机器人状态及动作历史。固定渲染器将ℓ转换为Base提示词,冻结策略πθ据此闭环输出动作;参数、动作空间和控制频率均不变。
- **可选慢路径:**Task-Prior可决定是否调用检索模块。主实验始终调用,选择性实验使用预先给定的任务族路由。
- **Top-K检索:**从48条只读示范记忆中,用CLIP文本特征检索K=5个候选。候选包含任务描述、结构化对象/目标/上下文、原始计划和提示,但原始计划与hint仅作溯源,不能直接执行。
- **兼容性重排:**解析任务和候选文本,计算对象、目标及上下文的Jaccard重叠,并加入CLIP相似度、对象/目标冲突惩罚和原始检索排名惩罚。固定权重为(1,2,1.5,0.8,0.6,0.4,0.01),仅改变检查顺序,不直接授予权限。
- **Top-2故障闭合授权:**按重排顺序最多检查两个候选。若对象和目标均无明确冲突,则候选通过;否则拒绝并继续检查第二个。两个均失败时,使用与Base逐字节一致的原始提示词。
- **规范化渲染与执行:**通过的候选不能原样注入,而是按固定模板渲染为“任务指令+对象+关系+目标+上下文”的紧凑capsule;每个episode只解析一次提示词,整个闭环 rollout 中保持不变,并记录候选ID、分数、拒绝原因、路由状态和提示词哈希。
关键思想是:Proposal ≠ Authority。检索器负责提出候选,规则检查器负责授予权限,冻结VLA仍是唯一动作生成器。
4. 方法对比与创新
与主流记忆增强、规划器或VLA steering方法相比,TOWN-VLA不优化策略、不切换专家,也不让外部模块直接控制动作;其创新在于把“文本是否能跨越策略边界”形式化为独立的授权决策,并提供失败闭合和哈希审计保证。它尤其适合冻结模型、提示模板脆弱、需要安全回退和可追责执行的机器人系统。局限是文本规则依赖解析器,难以处理抽屉、相对位置等复杂关系;当前免Oracle准入器几乎不会授权,且记忆库规模小、物理实验有限。
5. 实验分析
作者通过提示形式控制、LIBERO-Plus匹配评测、路由审计、OOD测试及PiPER实机验证。最关键结论是:原始追加几乎摧毁性能,而规范化capsule与精确Base恢复可维持高成功率;在LIBERO-Plus上提升3.61个百分点,在实机上提升26个百分点。优势是无需训练、权限可验证、拒绝可逆。不足是增益来源尚未完成逐路径归因,真正可靠的免Oracle选择仍未解决。
6. 实用指南
文中未说明官方代码或数据开源情况,不能据此认定已开源。复现需冻结VLA、构造只读示范记忆、实现文本解析器、CLIP检索、固定重排权重、Top-2检查、规范化渲染及提示词哈希日志;必须严格区分“调用慢路径”和“授权改提示词”。该框架可迁移至规划器、工具调用、代码生成或多专家系统:只需替换候选生成器,并设计任务一致性检查器和安全回退输入。
7. 总结
核心思想:先审查文本,再允许它改策略。
速记版Pipeline:
- 冻结原策略并保存原始指令。
- 检索少量候选建议并按任务匹配度排序。
- 最多检查两个候选,发现冲突立即拒绝。
- 通过者改写成固定短格式,否则恢复原提示。
- 固定提示完成整段闭环执行并记录审计信息。
Key Findings:
- We introduce TOWN-VLA (Think Only When Needed), a prompt-authority interface that separates candidate generation from permission to alter the policy input.
Links:
Toward a Foundation Plug-and-Play Prior for Computed Tomography Reconstruction via a Multimodal Diffusion Model
Authors: Haley Duba-Sullivan, Patxi Fernandez-Zelaia, Obaidullah Rahman, Amirkoushyar Ziabari
Published: 2026-08-24
Categories: cs.CV
Abstract:
Computed tomography (CT) throughput is limited by scan time, which grows with both the number of projections acquired and the detector integration time for each. Reconstructing high-quality volumes from sparse-view or low-dose measurements therefore depends on an informative prior, typically a neural network trained for one specific scan setting and retrained whenever the modality, geometry, or material changes. We investigate whether a single diffusion model trained across several imaging domains can instead serve as a prior for many CT problems simultaneously. We evaluate the proposed method using the same frozen model on three datasets that differ in modality, beam geometry, material, and degradation type, spanning flaw analysis in additively manufactured metal parts imaged with cone-beam X-ray CT and concrete microstructure imaged with parallel-beam neutron CT. Our proposed method out-performs analytic reconstructions in all three cases, providing a step toward a reusable foundation prior for heterogeneous CT reconstruction problems.
Analysis:
论文方法分析与总结
1. 摘要翻译
CT吞吐量受扫描时间限制,而扫描时间随投影数量和单次探测器积分时间增加。因此,从稀疏视角或低剂量测量中重建高质量体数据,需要具有信息量的先验。现有先验通常针对单一扫描设置训练,当成像模态、几何结构或材料改变时必须重新训练。本文研究:一个在多个成像领域上训练的扩散模型,能否同时作为多种CT问题的通用先验。
作者使用同一个冻结的扩散模型,在三个不同数据集上进行验证。这些数据覆盖了增材制造金属零件的锥束X射线CT,以及混凝土微结构的平行束中子CT,且具有不同模态、几何结构、材料和退化类型。实验表明,该方法在三种任务中均优于解析重建,说明多模态扩散模型可作为异构CT重建的可复用基础先验。
2. 方法动机分析
驱动力: CT设施需要连续处理不同材料、不同设备和不同采集条件的数据。为每种情况训练专用重建网络,成本高且难以维护。作者希望把“图像先验”和“成像物理”解耦,使一个模型能够服务多个CT任务。
现有痛点: 端到端重建网络通常绑定特定前向算子、扫描几何和数据分布;扩散模型虽然先验能力强,但完整反向扩散轨迹计算昂贵,尤其是三维CT需要对大量切片反复调用;测试时自适应又增加了额外计算。
核心假设: 如果扩散模型学习的是跨模态、跨材料的广泛图像分布,那么它不必直接学习某一种CT退化,而可以作为与前向物理无关的通用去噪先验,由PnP算法负责数据一致性。
3. 方法设计详解
Pipeline
-
建立数据保真项。
将CT重建写成加权最小二乘问题: [ \min_x \frac12|y-Ax|_\Lambda^2+g(x) ] 其中 (A) 是当前任务专属的投影算子,(\Lambda) 根据光子统计得到,(g(x)) 是未知先验正则项。 -
采用PnP-ADMM分裂物理与先验。
每轮包含三步:- 数据更新:求解 [ (A^\top\Lambda A+\gamma^{-2}I)v =A^\top\Lambda y+\gamma^{-2}(x-u) ] 作者使用共轭梯度法,并以上一轮结果 warm start。
- 先验更新:不显式构造 (g(x)),而将 [ x^{k+1}=D_\theta(v^{k+1}+u^k;\gamma) ] 视作去噪。
- 对偶变量更新:(u\leftarrow u+v-x)。
-
将噪声预测网络改造成可控去噪器。
扩散网络本身预测噪声 (\epsilon_\theta(\cdot|t)),不能直接接受任意物理噪声强度 (\gamma)。作者首先从初始解析重建 (x_0) 计算全体积标准差: [ s=\mathrm{std}(x_0),\qquad \sigma=\gamma/s ] 用 (\sigma) 将不同CT任务映射到统一的无量纲强度空间。这里的 (s) 主要反映物体对比度,不被解释为真实测量噪声。 -
匹配扩散时间步并执行单步DDIM去噪。
在训练噪声日程中寻找最接近 (\sigma) 的时间步: [ t^=\arg\min_t\left|\sigma-\sqrt{(1-\bar\alpha_t)/\bar\alpha_t}\right| ] 将输入 (z) 除以 (s) 后送入网络,在该时间步预测噪声,再通过DDIM反向映射得到: [ D_\theta(z;\gamma)\approx z-\gamma\hat\epsilon_{t^} ] 因而每次PnP迭代只需一次网络推理,而不是运行完整扩散采样轨迹。 -
二维先验处理三维体数据。
模型输入固定为 (128\times128)。作者沿轴向逐切片处理,并用重叠小块覆盖大切片;各块通过平方正弦窗进行加权重叠相加,以减弱块边界接缝。
模型结构与训练
模型是39.5M参数的ViT扩散网络:5层Transformer、8个注意力头、512维隐变量、4×4 patch、固定正弦位置编码和线性解码头。训练数据来自四类模态:金属增材制造CT、细胞显微镜、金属粉末微CT和混凝土CT;每类同时包含模拟和实验数据,共八个域。训练时使用域标签及模拟相位掩膜条件,但重建时采用无条件推理,从而避免为每个测试数据指定域标签。
4. 方法对比分析
本质区别: 该方法不是训练“测量到重建”的端到端模型,而是把扩散模型仅作为通用图像去噪器,把成像差异留给 (A) 和数据一致性步骤处理。
创新点:
- 将多域扩散模型引入异构CT的PnP先验;
- 用初始重建标准差实现跨物理量、跨数据集的噪声强度归一化;
- 用单步DDIM噪声预测替代完整扩散采样,降低迭代成本。
适用场景: 稀疏视角、低剂量、噪声、环状伪影等退化明显,且扫描模态和材料频繁变化的工业CT或中子CT。
5. 实验分析
作者在镍增材制造、钢增材制造和混凝土中子CT上验证,并与解析重建和PnP-BM3D比较。代表性结论是:同一冻结模型和同一 (\sigma=0.25) 在三种任务上均显著改善解析重建,并取得所有数据集最低HFEN;在两个实测数据集上同时优于BM3D。其主要优势是跨任务复用、无需测试时适应,且单步扩散推理明显快于CPU版BM3D。
局限包括:仅使用二维切片先验,缺乏真正三维结构建模;测试数据集数量少,且没有架构匹配的单域模型消融;评价参考是高质量重建而非真实真值,指标可能受参考算法影响;中子CT上的改善相对有限。
6. 实用指南
论文未说明代码或模型权重已公开。复现需准备多域模拟/实验图像,训练1000步线性噪声日程扩散ViT;训练650 epochs、Adam学习率 (10^{-5})、batch size 256,并进行旋转和翻转增强。重建时固定5轮PnP-ADMM,先由解析方法获得 (x_0),计算 (s),将物理步长转换为 (\sigma),再执行CG数据更新和单步DDIM去噪。迁移到其他任务时,只需替换前向投影算子、测量权重和预处理;若目标图像分布明显超出训练域,则应增加相应域数据或进行微调。
7. 总结
核心思想: 用多模态扩散去噪器统一CT先验。
速记版Pipeline:
- 用当前CT物理模型进行解析初始重建;
- 用ADMM把数据拟合与图像先验分开;
- 根据初始图像尺度统一去噪强度;
- 每轮用扩散模型做一次切片去噪;
- 反复迭代后拼接得到三维重建。
Key Findings:
- We evaluate the proposed method using the same frozen model on three datasets that differ in modality, beam geometry, material, and degradation type, spanning flaw analysis in additively manufactured metal parts imaged with cone-beam X-ray CT and concrete microstructure imaged with parallel-beam neutron CT.
- Our proposed method out-performs analytic reconstructions in all three cases, providing a step toward a reusable foundation prior for heterogeneous CT reconstruction problems.
Links:
BenthicFlow: Generating Extensible Underwater Environments via Flow Matching
Authors: Joaquín Figueira, Camile Lendering, Manfred Gonzalez-Hernandez, Giacomo D'Amicantonio, Erkut Akdag, Egor Bondarev
Published: 2026-08-24
Categories: cs.CV
Abstract:
Computer vision applications for 3D scene understanding in underwater environments remain challenging due to the lack of high-quality 3D data and the inability of surface-trained models to generalize to underwater scenes. To address this challenge, an emerging trend is to employ generative models to close the data domain gap. However, existing methods assemble large scenes by stitching independently generated tiles post hoc with separately trained models, while demonstrating heterogeneous landscapes only within individual survey sites. We introduce BenthicFlow, a unified framework based on a single conditional flow-matching model that jointly generates aligned textures and depth maps. A MultiDiffusion-inspired sampling procedure reconciles overlapping windows throughout the generative trajectory, enabling spatially extensible RGBD mosaics without a separate stitching model. The generated mosaics are subsequently lifted into explicit 3D benthic environments using surface-aligned Gaussian surfels. Experiments across geographically distinct survey sites demonstrate that BenthicFlow preserves site-specific appearance while generating coherent, large-scale 3D scenes that closely match the target distributions. Code and trained models are available at https://github.com/jacomof/BenthicFlow.
Analysis:
1. 论文主要贡献概述
BenthicFlow 提出一个统一的条件流匹配(conditional flow matching)框架,联合生成空间对齐的水下纹理(RGB)与深度图,从而避免传统方法使用多个独立模型生成图块后再进行拼接。通过受 MultiDiffusion 启发的重叠窗口采样策略,模型能够在生成过程中保持不同窗口之间的一致性,并进一步利用表面对齐的 Gaussian surfels 将生成的 RGBD 马赛克提升为可显式渲染的三维海底环境。
2. 关键创新与方法路线
(1)统一的 RGBD 联合生成
论文的核心不是分别生成图像和深度,而是使用单一的条件流匹配模型联合生成对齐的纹理与深度。这一点较为重要,因为水下三维重建或场景生成不仅需要视觉外观合理,还需要 RGB 与几何结构之间保持一致。
流匹配可以理解为学习一个从简单先验分布到目标数据分布的连续向量场,并通过数值积分完成样本生成。相较于传统扩散模型,它通常具有不同的训练目标和采样轨迹,可能在生成效率或连续性建模方面具有优势。
(2)基于重叠窗口的可扩展生成
为了生成大尺度海底场景,论文并非仅生成固定尺寸的一张图,而是使用多个存在重叠区域的局部窗口。受 MultiDiffusion 启发,模型在整个生成轨迹中对重叠窗口进行协调或融合,使相邻区域在纹理、结构和深度上保持一致。
这比“先独立生成图块、最后进行后处理拼接”的流程更统一,潜在优势包括:
- 减少接缝、重复纹理和不连续结构;
- 让全局空间布局在生成过程中得到一定约束;
- 支持生成尺寸超过单个模型输入窗口的空间延展场景;
- 无需额外训练独立的拼接模型。
(3)从生成 RGBD 到显式三维环境
生成的 RGBD 马赛克随后被转换为基于表面对齐的 Gaussian surfels 的三维场景。与仅输出二维图像相比,这使结果能够用于三维可视化、渲染以及潜在的下游三维感知任务。该步骤也体现了论文试图连接“生成式视觉模型”和“可交互的三维场景表示”。
(4)跨调查地点的场景生成
摘要声称实验覆盖地理位置不同的调查站点,并且生成结果能够保留地点特有的外观,同时产生大尺度、连贯的三维场景。这暗示方法不仅追求局部视觉逼真度,也关注不同海底生态环境之间的分布差异。
3. 对领域的潜在影响
对水下计算机视觉的影响
水下场景通常存在数据采集成本高、光照变化复杂、颜色偏移严重、深度传感器受限以及真实三维标注稀缺等问题。BenthicFlow 若能稳定生成具有真实几何和外观分布的 RGBD 三维环境,将有助于缓解水下数据不足和域偏移问题。
潜在用途包括:
- 训练水下目标检测、语义分割和实例分割模型;
- 生成三维场景理解与水下测绘数据;
- 进行视觉里程计、SLAM 和三维重建算法的预训练或压力测试;
- 研究从陆地或浅水环境迁移到深海环境的域适应问题;
- 构建可控的水下仿真数据集。
对生成式三维建模的影响
该工作具有一定的普适方法学价值:它将条件生成、长范围空间扩展、跨窗口一致性和显式三维表示结合起来。若其 MultiDiffusion 式的流匹配采样策略有效,类似思想也可能应用于其他大尺度、纹理和几何需要同步生成的领域,例如室内环境、地形、医学体数据或遥感场景。
对生态和海洋科学的影响
真实海底环境的数字化对于珊瑚礁监测、底栖生物调查、海洋生态变化分析以及水下机器人任务规划都具有价值。生成的场景还可以用于在不影响真实生态环境的情况下,测试机器人感知和导航系统。
4. 可能受益的相关领域和应用
-
水下机器人与自主导航
用于训练和测试 AUV/ROV 的视觉导航、避障、定位和路径规划系统。 -
水下三维重建与测绘
为点云配准、稠密重建、三维语义地图构建提供合成 RGBD 数据。 -
水下目标检测与生物识别
例如珊瑚、海草、鱼类、沉船、海底垃圾和矿物目标识别。 -
海洋生态监测
生成不同生态区域或调查站点的可扩展数字场景,用于生态变化模拟和数据增强。 -
域适应与仿真到现实迁移
研究合成水下数据与真实水下数据之间的外观、几何和传感器域差异。 -
三维生成模型与场景扩展
该框架可启发其他领域构建空间连续的二维—三维联合生成模型,而非仅生成孤立的局部样本。 -
虚拟现实与教育仿真
用于构建海底虚拟探索环境、训练平台或科学可视化系统。
5. 根据摘要可以推断的局限性
以下限制是根据摘要推断的,具体程度仍需结合论文正文和实验结果判断。
(1)生成质量依赖训练数据覆盖范围
模型可能较好地保留训练调查站点的外观分布,但对于完全未见过的海域、生态类型、深度范围或成像设备,泛化能力未必可靠。摘要中的“跨地理位置站点实验”说明存在一定泛化评估,但不能据此确认其具有广泛的跨海域泛化能力。
(2)大尺度一致性可能仍然有限
重叠窗口融合能够缓解接缝问题,但它未必能完全解决长距离的全局一致性,例如:
- 大尺度地形起伏不连续;
- 生态结构重复;
- 纹理或生物对象周期性复制;
- 远距离区域之间缺乏统一的场景布局;
- 深度场出现逐渐累积的几何漂移。
MultiDiffusion 类策略通常更擅长局部协调,全局语义和拓扑一致性仍可能是挑战。
(3)RGB 与深度的一致性不等于真实几何准确性
联合生成可以提高颜色与深度的对应关系,但生成的深度可能只是符合数据分布的“视觉合理深度”,不一定具有真实测量精度。若深度图包含局部错误,随后构建的 Gaussian surfels 可能将这些错误显式化为三维几何伪影。
(4)对水下成像物理的建模可能不充分
水下图像受到光吸收、散射、浑浊度、非均匀照明、悬浮颗粒和相机白平衡等因素影响。仅通过数据驱动生成模型学习这些现象,可能无法保证对不同能见度、照明条件或传感器配置的物理一致性。
(5)条件控制能力的细节尚不明确
摘要提到“conditional” flow-matching 模型,但没有说明条件变量具体包括哪些内容,例如地理位置、站点类别、深度、生态类型、布局或用户指定结构。如果条件控制粒度有限,模型可能只能进行分布级生成,而难以按照明确的语义或几何要求生成场景。
(6)计算和采样成本可能较高
重叠窗口在整个生成轨迹中进行协调,可能需要同时维护多个窗口的特征或样本,导致显存和计算量随场景面积、窗口数量或重叠比例增长。对于大规模场景和实时水下机器人应用,这一点可能是实际部署障碍。
(7)评价标准可能偏重视觉分布匹配
摘要强调生成结果“closely match the target distributions”,但仅凭摘要无法判断是否充分评估了:
- 几何精度;
- RGBD 对齐误差;
- 长距离空间一致性;
- 三维重建质量;
- 下游任务性能;
- 对真实机器人或真实测绘系统的实际帮助。
如果主要使用图像质量或分布距离指标,可能不足以证明生成的三维环境真正适合科学测绘或机器人感知。
总体评价
BenthicFlow 的潜在趣味性在于,它并非简单地生成水下图像,而是试图统一解决三个相互关联的问题:水下数据稀缺、RGB 与深度联合生成、以及大尺度场景的空间连续扩展。尤其是将流匹配模型与重叠窗口协调采样、Gaussian surfel 三维表示结合起来,使其成为连接生成式模型、水下视觉和显式三维场景建模的有潜力工作;但其真实价值仍取决于几何准确性、跨海域泛化能力、长距离一致性以及对下游水下视觉任务的实证提升。
Key Findings:
- We introduce BenthicFlow, a unified framework based on a single conditional flow-matching model that jointly generates aligned textures and depth maps.
Links:
MIVIFI: Bridging Perspective and Fisheye Domains for Training Multi-View Fisheye Image Generation Models
Authors: Matthias Neuwirth-Trapp, Begüm Altunbas, Jiayi Wang, Yan Xia, Maarten Bieshaar, Xinyu Huang, Daniel Cremers
Published: 2026-08-24
Categories: cs.CV, cs.RO
Abstract:
Achieving 360° coverage is critical for the visual perception systems of autonomous vehicles. Fisheye cameras offer a cost-effective solution by enabling full surround coverage with as few as two sensors. However, existing multi-view fisheye datasets are limited, and synthesizing rare corner cases typically requires computationally expensive 3D simulations, hindering the training. While generative models have achieved significant success in standard perspective imagery, their application to wide-angle distortion remains unexplored. In this work, we formally introduce the novel problem of multi-view fisheye image generation conditioned on volumetric semantic representations and present two distinct methods. We first propose SyntheOcc-FE, which adapts the SyntheOcc architecture to fisheye data. While effective, this method is constrained by the scarcity of fisheye datasets, which limits its generalization. To overcome these limitations, we propose our second method, MIVIFI (multi-view fisheye), which leverages cross-domain learning with Equirectangular Projections. By bridging the gap between dataset domains using KITTI-360 fisheye images alongside nuScenes multi-view standard images, our approach enables high-fidelity manipulation of scene content. This framework enables the structural modification of semantic occupancy inputs to introduce or eliminate specific actors and facilitates the rendering of diverse meteorological conditions and illumination scenarios absent in the limited fisheye datasets. Quantitative and qualitative experiments demonstrate that our methods achieve robust photorealistic multi-view fisheye image generation and highlight the specific advantages of our cross-domain strategy for handling data scarcity.
Analysis:
1. 论文主要贡献概述
本文提出了一个新的任务:根据体素化语义占据(volumetric semantic occupancy)表示,生成多视角鱼眼图像,以缓解真实鱼眼数据稀缺和极端场景难以采集的问题。论文首先将 SyntheOcc 适配到鱼眼图像生成,进一步提出 MIVIFI,通过等距柱状投影(Equirectangular Projection)连接鱼眼图像域与标准透视图像域,从而利用更丰富的透视图像数据生成具有真实宽视场畸变的多视角鱼眼图像。
2. 关键创新与方法
2.1 提出多视角鱼眼图像生成任务
传统条件图像生成大多面向标准透视相机。本文关注的是:
- 输入:三维语义占据或体素语义表示;
- 输出:多个相机视角下的鱼眼图像;
- 目标:保持多视角之间的几何一致性,并正确呈现鱼眼镜头的宽视场畸变。
这一任务直接面向自动驾驶中的环视感知系统,尤其适合覆盖车辆周围大范围视野。
2.2 SyntheOcc-FE:面向鱼眼数据的架构适配
论文首先将 SyntheOcc 类方法扩展到鱼眼数据,形成 SyntheOcc-FE。其优势是能够直接在鱼眼图像域中学习语义占据到图像的映射,但受到鱼眼训练数据规模有限的影响,泛化能力受到约束。
2.3 MIVIFI:基于等距柱状投影的跨域学习
MIVIFI 的核心是利用 Equirectangular Projection 作为中间表示,建立以下两个数据域之间的联系:
- KITTI-360 中的鱼眼图像域;
- nuScenes 中规模更大、更加成熟的多视角标准透视图像域。
等距柱状投影可以将不同相机模型和宽视场视觉内容映射到统一的球面参数化空间。这样,模型可以借助大量标准透视数据学习场景结构、外观、天气和光照变化,同时使用真实鱼眼数据学习最终的鱼眼成像特性。
2.4 语义占据驱动的场景编辑
该框架不仅用于重建或生成已有场景,还可以修改输入的语义占据结构,例如:
- 添加或移除车辆、行人等目标;
- 改变场景中的物体布局;
- 渲染鱼眼数据集中缺少的天气条件;
- 生成不同时间或光照条件下的图像。
因此,它兼具图像生成、场景编辑和自动驾驶数据增强的功能。
3. 对领域的潜在影响
3.1 缓解鱼眼数据稀缺问题
鱼眼相机具有更大的视场,但真实采集和标注成本较高,公开数据集也相对有限。MIVIFI 通过跨域学习利用标准透视数据,有望降低对大规模鱼眼数据的依赖,为训练鱼眼感知模型提供更丰富的合成数据。
3.2 推动从“透视图像生成”到“全景/鱼眼生成”
目前许多生成模型主要面向普通视角图像。本文将生成建模扩展到宽视场、非线性投影的鱼眼域,具有一定的任务和建模范式创新意义。特别是,它说明标准透视数据与鱼眼数据并不一定需要完全独立建模,而可以通过球面或等距柱状中间表示进行连接。
3.3 支持更系统的自动驾驶极端场景测试
通过修改语义占据输入,模型可以较有针对性地生成:
- 车辆突然出现;
- 行人或骑行者进入盲区;
- 环岛、路口或车辆密集区域;
- 雨雪、雾霾、夜晚和逆光场景;
- 多个目标同时出现在不同环视视角中的复杂情况。
这些数据可用于训练和测试环视感知、目标检测、跟踪、占据预测和规划系统。
3.4 促进多视角生成中的几何一致性研究
多视角生成并非简单地分别生成多张图像,还需要满足:
- 同一物体在相邻视角中的位置和外观一致;
- 鱼眼畸变随视场位置合理变化;
- 场景布局与三维语义占据相符合。
如果 MIVIFI 能够稳定实现这些约束,它也可能为多相机生成、全景视频生成和三维条件图像合成提供有价值的研究思路。
4. 可能受益的相关领域和应用
自动驾驶与机器人
- 鱼眼环视相机数据增强;
- 车辆周围目标检测、分割和跟踪;
- 3D occupancy prediction;
- 自动驾驶规划与闭环仿真;
- 机器人近距离避障和导航。
多视角与全景视觉
- 360°图像或视频生成;
- 全景场景编辑;
- 球面图像补全;
- 多相机图像联合生成;
- 宽视场相机标定和域适配。
计算机视觉数据合成
- 稀有事件和长尾场景生成;
- 天气、光照和季节变化合成;
- 基于语义结构的目标插入与移除;
- 用于检测、分割和深度估计的数据增强。
机器人仿真与安全验证
- 自动驾驶系统的极端场景测试;
- 传感器感知鲁棒性评估;
- sim-to-real 数据补充;
- 多传感器系统的视觉仿真。
其他宽视场成像应用
- 安防摄像头;
- 无人机环视系统;
- 室内机器人和服务机器人;
- 可穿戴或车载全景摄像设备。
5. 从摘要中可以推断的局限性
5.1 跨数据集域差异可能仍然明显
KITTI-360 和 nuScenes 在以下方面可能存在差异:
- 相机内外参数;
- 鱼眼镜头类型和畸变模型;
- 图像分辨率与视场范围;
- 传感器安装位置;
- 城市环境、国家地区和交通模式;
- 标注定义与语义类别。
因此,等距柱状投影能够缓解表示层面的差异,但未必能完全消除数据分布差异。模型可能在训练数据覆盖之外的车辆类型、道路结构或天气条件上泛化不足。
5.2 投影变换并不能完全解决相机成像差异
鱼眼图像不是简单的透视图像重采样。不同鱼眼镜头可能采用不同的投影模型,例如等距投影、等立体角投影或其他非线性模型。等距柱状投影作为中间空间虽然有利于统一表示,但仍可能引入:
- 极区域的采样失真;
- 分辨率分布不均;
- 图像边缘细节损失;
- 鱼眼特有的局部成像和遮挡关系建模误差。
5.3 生成结果可能缺乏严格的三维和多视角一致性
摘要提到高保真和多视角生成,但没有说明是否使用了显式的:
- 多视角几何约束;
- 3D-aware latent representation;
- 视角间特征共享;
- 时序一致性约束;
- 物体遮挡和深度排序约束。
如果这些约束不足,生成结果可能在单张图像上逼真,但在相邻相机视角之间出现物体位置漂移、形状不一致或纹理不连续。
5.4 语义占据表示对外观信息的表达有限
语义占据主要描述物体类别和空间占据,而不一定包含:
- 具体车辆外观;
- 纹理和材质;
- 细粒度道路标线;
- 反射和透明性;
- 交通参与者姿态;
- 真实光照条件。
因此,生成模型仍需从数据分布中“猜测”大量外观细节,可能出现纹理幻觉、类别混淆或局部结构不合理。
5.5 极端天气和罕见事件的真实性需要谨慎验证
论文强调可以生成数据集中缺失的天气、光照和场景条件,但“可生成”不等于“物理可信”。例如:
- 雨滴、雾和积水是否与场景几何一致;
- 夜间光源是否符合真实光照规律;
- 目标阴影和反射是否合理;
- 恶劣天气下的可见性衰减是否符合传感器特性。
如果这些合成数据用于训练感知系统,过于理想化或不真实的生成结果可能引入新的偏差。
5.6 数据规模和训练成本仍可能较高
尽管跨域学习减少了对鱼眼数据的依赖,但生成式模型通常仍需要较高的训练和推理成本。对于自动驾驶中的高分辨率、多相机、视频级输出,计算开销和实时性可能是实际部署中的重要障碍。
5.7 摘要尚未明确下游任务收益
摘要主要强调图像质量和生成能力,但尚未说明合成数据是否显著改善了下游任务,例如:
- 鱼眼目标检测;
- 语义分割;
- 3D占据预测;
- 跟踪;
- 自动驾驶规划性能。
因此,MIVIFI 对实际感知系统的价值仍需要通过下游任务实验、真实数据迁移实验以及 sim-to-real 评估进一步验证。
总体而言,这项工作的趣味性在于:它没有简单地将透视图像生成模型直接应用于鱼眼图像,而是尝试通过球面化的中间表示连接不同相机域,并把三维语义占据、跨域生成和多视角一致性结合起来。其成功与否的关键,将取决于模型能否同时保留透视数据中的丰富外观变化和鱼眼数据中的真实成像规律。
Key Findings:
- In this work, we formally introduce the novel problem of multi-view fisheye image generation conditioned on volumetric semantic representations and present two distinct methods.
- To overcome these limitations, we propose our second method, MIVIFI (multi-view fisheye), which leverages cross-domain learning with Equirectangular Projections.
- By bridging the gap between dataset domains using KITTI-360 fisheye images alongside nuScenes multi-view standard images, our approach enables high-fidelity manipulation of scene content.
- Quantitative and qualitative experiments demonstrate that our methods achieve robust photorealistic multi-view fisheye image generation and highlight the specific advantages of our cross-domain strategy for handling data scarcity.
Links:
Pointing-VLA: Typed Spatial Grounding Interfaces for Vision-Language-Action Manipulation
Authors: Xiwen Chen, Zelin Li, Zhiruo Zhou, Huiming Chen, Chenwei Wang, Xiaojun Zhu
Published: 2026-08-24
Categories: cs.RO, cs.AI, cs.CV
Abstract:
Vision-language-action (VLA) models often expose spatial grounding through autoregressive text coordinates or opaque action tokens, creating brittle interfaces between multimodal reasoning and robot execution. We present Pointing-VLA, a typed hidden-state spatial readout built on Embodied-R1. Geometry-specific heads predict normalized points, object-functional grounding (OFG) heatmaps, and visual trajectories without serializing geometry as text. For the evaluated Bridge/WidowX and physical pick-place deployments, an explicit execution contract assigns PICK to source-conditioned OFG and PLACE to Pointing, providing direct stage-aligned spatial targets. Pointing-VLA achieves SOTA performance on Bridge/WidowX, averaging 72.9% across the evaluated four-task set without Bridge-specific finetuning under collision-enabled CuRobo execution. Pointing and OFG show complementary strengths across native and cross-dataset evaluations. The OFG/contact readout transfers to NORA-1.5, preserving or improving success while reducing recorded controller time by more than 20$\times$; typed heads are also 6.68--6.90$\times$ faster than Embodied-R1 text decoding on a shared external suite. When integrated as spatial guidance for a $π_{0.5}$ action policy, Pointing-VLA raises autonomous real-robot success from 52.7% to 80.7% across three visual contexts. These results establish typed spatial readouts as an efficient, inspectable interface between embodied reasoning and robot execution.
Analysis:
1. 摘要翻译
视觉—语言—动作(VLA)模型通常通过自回归文本坐标或不透明动作 token 表达空间定位,导致多模态推理与机器人执行之间的接口脆弱。本文提出 Pointing-VLA:一种构建于 Embodied-R1 之上的类型化隐状态空间读出方法。模型通过专门的几何头直接预测归一化点、目标功能区域(OFG)热图和视觉轨迹,而不将几何信息序列化为文本。在 Bridge/WidowX 与真实机器人抓取—放置实验中,作者规定:PICK 使用源目标条件化的 OFG,PLACE 使用 Pointing,从而为不同执行阶段提供匹配的空间目标。该方法在 Bridge/WidowX 四类任务上平均成功率达 72.9%,OFG/contact 读出可迁移至 NORA-1.5,并使控制器记录时间降低超过 20 倍;相较 Embodied-R1 文本解码,类型化读出速度提升 6.68–6.90 倍。结合 π0.5 后,真实机器人成功率由 52.7% 提升至 80.7%。
2. 方法动机分析
驱动力与痛点: 文本坐标需要逐 token 生成、字符串解析和坐标反变换,可能出现“无法解析”或“坐标可解析但位置错误”。直接动作 token 虽省去解析,却隐藏了机器人可检查的空间依据;同时,点、功能区域和轨迹本质不同,强行使用同一坐标接口会损失区域结构并产生任务间干扰。
核心假设: 空间意图已编码在 VLA 的多模态隐状态中,应通过与执行阶段匹配的专用几何读出器直接提取,而非让语言模型“说出”几何。
3. 方法设计详解
Pipeline
- 输入机器人观测图像、语言指令,以及 PICK 的源物体描述和 PLACE 的目标区域描述。
- 冻结的 Embodied-R1 编码视觉、语言和推理信息,得到多模态隐状态 (H_{mm})。
- Grounding Adapter 将隐状态投影到 1024 维 grounding 空间,并加入位置编码;专家专属的 8 个可学习 query 通过交叉注意力读取相关证据,得到 grounded tokens (G)。Pointing 与 OFG 各自拥有独立 LoRA、query 和解码器。VTG 则使用带时间编码的 waypoint query,直接访问完整隐状态,避免固定 grounding token 瓶颈。
- Pointing head: 使用一个 point query 从 (G) 中聚合信息,经 LayerNorm、线性层和 sigmoid 输出归一化坐标 ((\hat x,\hat y)\in[0,1]^2),再映射为像素点。它适合表示 PLACE 的紧凑目标。
- OFG head: 将 grounded 全局摘要通过 FiLM 调制视觉二维特征图,再由卷积热图解码器预测功能区域。取热图峰值作为功能接触点,因此既保留区域范围,又能输出抓取位置。
- VTG head: 预测 8 个有序归一化视觉 waypoint,用于表达短程视觉轨迹,而非底层机器人动作。
- 执行合同固定为:
- (q_{pick}=T_{pick}(\ell,c_{src})),OFG 输出 PICK 接触点;
- (q_{place}=T_{place}(\ell,c_{goal})),Pointing 输出 PLACE 目标点。
外部 wrapper 利用深度、相机内参和相机—机器人变换,将图像坐标转换至机器人坐标,再交给执行器或 CuRobo。
- 训练阶段先进行几何 warm-up(训练 Adapter、query 和几何头),再仅更新 LoRA,最后针对任务所需模块进行 continuation。损失由点坐标、OFG 热图、轨迹及辅助损失组成;最终 Pointing 还使用 GRPO 风格的连续采样 refinement,利用点是否落入目标框及距离奖励修正预测分布。
4. 方法对比分析
本质区别: 主流 VLA 将空间信息转成文本坐标或动作序列;Pointing-VLA 将空间预测视为“类型化接口”,让不同几何对象使用不同输出空间和执行合同。
创新点: ① 隐状态直接读出、彻底去除坐标文本解析;② Pointing/OFG/VTG 的几何专门化;③ 明确的 OFG-PICK、Pointing-PLACE 阶段绑定;④ OFG 的热图保留功能区域结构,并可跨 backbone 迁移。
适用场景: 尤其适合抓取接触、部件级操作、容器放置和已有低层控制器的机器人系统。它并不直接替代动作策略,对需要闭环修正、复杂三维姿态或长时序规划的任务仍需额外模块。
5. 实验分析
作者通过原生 grounding、跨数据集、消融、跨 backbone、Bridge/WidowX 仿真和 PiPER 实机验证。代表性结果是:OFG 将 Part-Affordance-2K 准确率从 40.9% 提升至 57.3%;固定 OFG-PICK/Pointing-PLACE 在 Bridge/WidowX 上达到 72.9%,实机结合 π0.5 达到 80.7%。
主要优势是输出稳定、可解释、速度快,并能直接接入已有执行器。局限在于固定 PICK/PLACE 合同依赖任务分解,图像到机器人坐标仍依赖深度和标定;转移与实验任务规模也相对有限,闭环纠错能力不足。
6. 实用指南
论文明确提到评测代码随补充材料发布,但未在给定文本中确认完整训练代码和模型权重开源。复现关键是:冻结 Embodied-R1,分别训练几何头;使用 8 queries、较优 rank-32 LoRA;按点、区域、轨迹准备监督;严格实现 OFG-PICK/Pointing-PLACE 合同及相机标定转换。迁移到其他 VLA 时,只需将其多模态隐状态接入 Adapter,并重新训练对应 LoRA、queries 与几何头;迁移到导航、插接等任务时,可保留类型化思想,设计方向、接触区域或轨迹专用读出器。
7. 总结
核心思想: 用专用几何头直接读取空间意图。
速记版 pipeline:
- 图像和指令进入 VLA,提取内部多模态信息。
- 不生成文字坐标,而用不同模块读取点、区域或轨迹。
- 抓取读功能区域,放置读目标点。
- 将图像位置结合深度和标定转换为机器人坐标。
- 交给原有规划器或动作策略执行。
Key Findings:
- We present Pointing-VLA, a typed hidden-state spatial readout built on Embodied-R1.
Links:
Training-Free Pseudo-Fusion for Composed Image Retrieval with Diffusion Models and Multimodal Large Language Models
Authors: Fan Xu, Luis A. Leiva
Published: 2026-08-24
Categories: cs.CV, cs.IR
Abstract:
Composed Image Retrieval (CIR) is an emerging paradigm in content-based image retrieval that enables users to formulate compositional queries by combining a reference image with an auxiliary modality, usually text-based. This approach supports fine-grained search where the target image shares structural elements with the user-provided image while incorporating the modifications specified by the auxiliary text. Conventional CIR methods rely on multimodal fusion to combine visual and textual features into a joint query embedding, which requires training modules that align composed queries with the targets. In this work, we propose PeFuse (for pseudo-fusion), a training-free framework that leverages pretrained Diffusion Models and Multimodal Large Language Models to bridge modalities via generative conversion. We introduce two novel strategies: uni-directional and bi-directional conversion, which convert CIR into four single-modality retrieval problems. These methods reformulate CIR as either intra-modal or cross-modal single-query retrieval tasks, bypassing the need for dedicated task-specific training. Extensive experiments on standard benchmarks demonstrate that converting CIR into text-to-image retrieval tasks is more effective than alternative conversion strategies, achieving competitive or superior performance compared with state-of-the-art methods, while maintaining high flexibility thanks to replaceable components of the conversion pipeline. These results highlight the effectiveness of the pseudo-fusion paradigm for zero-shot CIR. Our code is publicly available at: https://github.com/StevenXuf/PeFuse4CIR.
Analysis:
1. 主要贡献概述
本文提出 PeFuse(Pseudo-Fusion),一个无需针对 CIR 任务进行额外训练的组合图像检索框架。它利用预训练扩散模型和多模态大语言模型,将“参考图像 + 修改文本”的组合查询转换为单模态查询,从而把 CIR 重新表述为若干图像到图像、文本到图像等单模态检索问题,在避免训练专用融合模块的同时取得了具有竞争力的性能。
2. 关键创新与方法
核心思想:用生成式转换替代显式特征融合
传统 CIR 通常需要学习一个融合网络,将参考图像和辅助文本映射到统一的查询嵌入空间,再与目标图像匹配。PeFuse 不直接训练这种融合器,而是借助已有的生成模型完成“伪融合”:
- 多模态大语言模型(MLLM):理解参考图像与文本修改指令之间的语义关系;
- 扩散模型(Diffusion Model):根据转换后的语义生成或编辑图像,提供视觉侧的中间表示;
- 单模态检索系统:利用成熟的图像检索或文本到图像检索能力完成最终匹配。
两种转换策略
论文提出:
-
单向转换(uni-directional conversion)
将组合查询沿一个方向转换为单模态查询,例如将图像和文本转换为新的图像查询或文本查询。 -
双向转换(bi-directional conversion)
在视觉和文本之间进行更充分的转换或互相约束,以构造另一类单模态检索形式。
这两种策略最终将 CIR 转换为四类单模态检索问题,涉及图像到图像、文本到图像等不同组合。摘要中特别指出,将 CIR 转换为文本到图像检索通常比其他转换策略更有效,这说明语言可能更适合作为组合属性和修改意图的中间表示。
该方法的重要特点是:
- 不需要 CIR 专用训练数据或融合模块;
- 转换流水线中的 MLLM、扩散模型和检索模型具有一定可替换性;
- 可以直接利用不断进步的通用视觉语言模型和生成模型。
3. 对领域的潜在影响
训练范式上的意义
PeFuse 代表了一种从“学习融合函数”转向“生成式重构查询”的思路。它表明,CIR 不一定必须通过端到端训练获得联合嵌入,也可以通过预训练模型之间的协作,将复杂的跨模态检索任务拆解为已有能力较强的单模态任务。
降低数据和训练成本
传统 CIR 方法通常依赖特定数据集上的配对样本、复杂的对齐目标和专门设计的网络结构。训练免费的方案可能:
- 降低模型开发和部署成本;
- 更容易迁移到新的领域或商品类别;
- 在缺少 CIR 标注数据时仍具有实用价值;
- 方便快速验证新的检索任务和模型组件。
推动生成模型用于检索
扩散模型通常主要用于图像生成、编辑和合成。本文将其作为跨模态检索中的“语义转换器”,拓展了生成模型在检索系统中的用途。其潜在价值不仅在于具体性能,也在于说明生成式模型可以承担传统判别式融合模块的部分功能。
促进模块化和可扩展系统设计
如果不同的 MLLM、扩散模型或检索器可以替换,系统便能够随着基础模型能力提升而迭代,而不必重新训练完整的 CIR 网络。这对快速演化的视觉语言模型生态尤其有吸引力。
4. 可能受益的相关领域和应用
相关研究方向
- 组合图像检索(CIR)
- 文本到图像检索与图像到图像检索
- 零样本和开放词汇检索
- 视觉语言模型与多模态大语言模型
- 基于扩散模型的图像编辑和语义重构
- 跨模态表示学习
- 无需训练或少样本学习
- 模块化检索系统和基础模型组合
潜在应用
-
电商与商品搜索
用户上传一件商品图片,并输入“换成黑色”“采用短款设计”“增加条纹”等修改要求,系统检索符合描述的商品。 -
服装和时尚检索
根据参考服饰的版型,再结合颜色、材质、风格或配饰要求搜索目标服装。 -
室内设计与家具搜索
以一张房间或家具图片为参考,通过文本指定“更现代”“换成木质”“增加落地灯”等属性。 -
图像编辑与素材检索
根据输入图像及编辑意图,在图库中查找满足修改要求的相似图像,而不仅是生成新图像。 -
视觉问答和多模态搜索系统
在更一般的场景中,将复杂多模态请求转换为文本查询,以接入已有的搜索引擎或知识库。 -
低资源领域检索
在医学影像、工业缺陷、遥感图像等缺乏大规模 CIR 标注数据的领域,利用通用预训练模型进行初步跨模态检索。
5. 从摘要中可以推断的局限性
生成转换可能损失细节
将组合查询先转换为文本或图像,可能造成信息瓶颈:
- 参考图像中的细粒度结构、纹理、姿态或局部几何关系可能丢失;
- MLLM 可能无法准确理解复杂或隐含的视觉属性;
- 扩散模型生成的图像可能改变原始身份、布局或关键细节;
- 文本化过程可能把连续视觉信息离散化为不完整的语言描述。
因此,转换结果未必严格保留原始参考图像的结构约束。
对预训练模型能力和偏差高度依赖
PeFuse 虽然不需要 CIR 专用训练,但并不意味着完全不依赖模型能力。其性能可能受以下因素显著影响:
- MLLM 的视觉理解和指令遵循能力;
- 扩散模型的图像编辑和结构保持能力;
- 基础文本到图像模型的语言-视觉对齐质量;
- 预训练模型的领域偏差和生成偏差。
在专业领域、长尾类别或分布外数据上,效果可能下降。
计算与延迟成本可能较高
推理过程中如果需要调用 MLLM、扩散模型和检索模型,系统可能带来:
- 较高的 GPU 和显存需求;
- 较长的查询处理时间;
- 扩散采样带来的额外延迟;
- 多阶段流水线部署复杂度。
因此,“training-free”并不等同于“低成本”或“实时”。
文本到图像优势可能具有任务依赖性
摘要指出文本到图像转换效果较好,但这可能依赖于当前基准数据的属性主要能够被语言描述。如果目标任务更强调精确几何结构、局部外观或身份一致性,纯文本中间表示可能不如保留视觉特征的方案。
基准性能与真实应用之间仍可能存在差距
摘要提到在标准基准上取得有竞争力或更优结果,但真实应用通常包含:
- 更复杂的语言表达;
- 模糊或不完整的用户意图;
- 多目标和多属性修改;
- 更大的检索库;
- 更严格的实时性要求;
- 更高的身份和细节保持要求。
因此,还需要进一步验证该方法在大规模、跨领域和工业级场景中的稳定性。
“无需训练”可能仍需工程和提示设计
即使不训练任务专用模块,系统仍可能依赖:
- 精心设计的提示词;
- 对不同模型的接口适配;
- 转换策略和采样参数调节;
- 检索器或模型组件的选择。
这可能影响不同环境下的可复现性与公平比较。
总体而言,PeFuse 的有趣之处在于:它将 CIR 从一个必须学习跨模态融合的任务,重新解释为一个可以通过基础模型进行语义转换和任务分解的问题。其潜在重要性不仅体现在零样本检索性能,还体现在为视觉检索系统提供了一种更灵活、模块化且依赖专用训练更少的设计范式。
Key Findings:
- In this work, we propose PeFuse (for pseudo-fusion), a training-free framework that leverages pretrained Diffusion Models and Multimodal Large Language Models to bridge modalities via generative conversion.
- We introduce two novel strategies: uni-directional and bi-directional conversion, which convert CIR into four single-modality retrieval problems.
- Extensive experiments on standard benchmarks demonstrate that converting CIR into text-to-image retrieval tasks is more effective than alternative conversion strategies, achieving competitive or superior performance compared with state-of-the-art methods, while maintaining high flexibility thanks to replaceable components of the conversion pipeline.
Links: