Arxiv Report 2026 09 02 - Owen-Liuyuxuan/everyday_my_arxiv GitHub Wiki
Arxiv Computer Vision Papers - 2026-09-02
Table of Contents
- On-the-Fly3R: Towards Robust Online 3D Reconstruction with Feed-Forward 3R Models for Large-Scale UAV Scenarios
- Accelerating Reinforcement Learning via MPC Solver-Gradient Guidance for Weights-varying MPC
- Non-Prehensile Throwing: A Reinforcement Learning Perspective
- VOIM: Training-Free Open-Vocabulary 3D Instance Mapping for RGB-D and Monocular SLAM
- HELIOS: From midnight to noon, continuous outdoor urban scene relighting
- HitMem: Hierarchical Temporal 3D Memory with Multi-Modal Context-Aware Retrieval for Dynamic Environments
- Efficient and Robust Absolute Pose Estimation via Gravity-Prior-Driven Transformation Decoupling and Pose Refinement
- Adaptive Depth-Map-Guided Bundle Adjustment for Correspondence-Free Multi-View Point Cloud Registration
- Peg-in-Bench: A Modular Benchmark for High-Precision Robotic Insertion
- AM-Bench: A Modular Simulation Suite and Benchmark for Aerial Manipulation Policy Learning
Papers
On-the-Fly3R: Towards Robust Online 3D Reconstruction with Feed-Forward 3R Models for Large-Scale UAV Scenarios
Authors: Zhe Shen, Liyuan Lou, Yifei Yu, Guanbo Wang, Quanjian Ji, Xin Wang, Zongqian Zhan
Published: 2026-09-01
Categories: cs.CV
Abstract:
While feed-forward 3D reconstruction (3R) offers efficient end-to-end modeling, its application in large-scale UAV mapping is hindered by the prohibitive memory cost of Transformer attention. Current scalable streaming 3R methods assume temporally and spatially continuous inputs, rendering them ineffective for the weakly ordered or unordered image streams common in cross-strip UAV operations. To address this, we propose On-the-Fly3R, a training-free, progressive online 3D reconstruction framework for large-scale UAV images that upgrades various 3R backbones for large-scale UAV scenarios. Our method enables reconstruction from unordered inputs via retrieval-guided dynamic subset construction, which adaptively selects spatially relevant images. To further improve the robustness, a validation-rejection-retry mechanism is designed to guarantee global consistency, performing a pre-integration consistency check and automatically rejecting misaligned images and retrying with alternative subset. Finally, inspired by VSLAM, pose graph optimization based on the retrieval loop closure is employed to mitigate camera drift. Evaluations on several UAV benchmarks show that our On-the-Fly3R successfully scales various 3R models to over 5,000 images across square-kilometer UAV scenes, delivering substantially superior accuracy compared to several SOTA streaming 3R methods. Code is available at https://github.com/Sh1nZzz/On_the_Fly3R
论文解读
研究问题与动机
前馈三维重建(3R)模型能够从未经校正的影像直接预测相机位姿和稠密点云,但它们通常依赖 Transformer 的全局注意力,影像数量一多就会出现显存瓶颈。在无人机测绘中,输入规模可能达到数千张,而且影像常来自跨航带、多架次任务,未必按照拍摄顺序到达。固定滑动窗口的流式方法因此容易找不到有效重叠;简单分块拼接若某次局部对齐出错,还会把误差持续传给后续地图。
On-the-Fly3R 的出发点是保留已有 3R 模型的重建能力,把大规模扩展、错误控制和全局一致性放在外部在线框架中完成。它不要求重新训练 backbone,试图回答一个实际问题:在消费级显卡上,能否让原本面向小批量影像的模型可靠地处理无序的大范围 UAV 数据?
核心方法
框架首先用冻结的 SupScene 编码器为影像生成特征。新影像到来时,系统按余弦相似度从已建立的地图中检索候选参考帧,而不是机械地选择时间上相邻的帧;只有引用重叠计数达到阈值、且最大视觉相似度达到阈值的候选才会组成当前动态子集。这样可以在有限显存内为 3R 模型提供更可能具有共同几何的上下文,也能适应乱序和跨航带输入。
局部重建完成后,系统不会立即融合结果,而是执行验证—拒绝—重试(VRR)。它用参考帧的紧凑几何点和 Huber 鲁棒损失估计局部结果与全局地图之间的 Sim(3) 变换,再依据平移、旋转残差剔除几何上可疑的参考帧。同时,3R 模型输出的 Register Tokens 被用于语境剪枝,以识别“看起来相似但实际位置无关”的错误关联。验证失败就删去可疑帧并重试,重试仍失败则拒绝整批,避免局部错误污染全局地图。
最后,框架维护一个位姿图,将历史回环、批次内部关系和时间连续关系作为约束,在 SE(3) 上进行鲁棒最小二乘优化。该后端把局部误差分散到全局、抑制长距离累积漂移;平移容差还会按场景特征尺度自适应调整。整个设计可以作为 Pi3x、VGGT-Omega 等前馈模型的插件使用。
实验结果
实验在 RTX 4090(24 GB 显存)上进行,使用 GauU-ScenesV2(1500 张影像)、UrbanScene 的 Campus 场景(最多 5871 张)以及 7Scenes 等数据。规模测试显示,On-the-Fly3R 能完成 5000 张以上影像的 Campus 重建,而 FastVGGT 在这一规模直接发生显存溢出,说明动态子集确实绕开了全局注意力对输入数量的平方级压力。
精度和效率也同时改善。在六个 UAV 场景的宏平均绝对平移误差(ATE)中,基于 Pi3x 的 On-the-Fly3R 将 MERG3R 的 124.42 m 降至 18.56 m;平均 Chamfer Distance 从 16.41 m 降至 3.85 m,表明稠密点云与真实几何更接近。在线处理速度约为 0.7–0.8 s/frame,而分块式 Scal3R 约为 2.27 s/frame。消融实验进一步显示,单独使用动态子集仍可能发生局部崩溃;加入 VRR 后 ATE 可由约 208 m 降到 30 m 以下,再加入位姿图优化后,示例误差可降至 3.64 m。
按 ATE 数值计算,相对 MERG3R 的下降幅度约为 85.1%;Chamfer Distance 也减少约 76.5%。这些数字分别从相机轨迹和稠密几何两个层面支持同一结论:系统不仅能继续处理更长的影像流,而且能把错误局部化,不让早期错配扩散成整条航线的全局漂移。需要注意的是,论文报告的是跨场景宏平均,实际效果仍会随纹理、重叠度和航线组织方式变化。
局限性与意义
该方法的关键前提是视觉检索能找到合理的几何邻居。在重复纹理、纹理缺失、视角或光照变化极大的区域,SupScene 特征可能产生外观相似却空间错误的候选。VRR 能够阻止这类结果写入地图,但剪枝和再次推理会增加计算开销;如果有效重叠本身极少,系统也可能频繁拒绝批次。论文提出未来引入语义信息辅助检索,以增强这些边界场景的可靠性。
总体而言,On-the-Fly3R 的贡献不在于重新打造一个更大的 3R backbone,而在于把动态组帧、显式验收和全局优化组合成可复用的安全层。它在 24 GB 显存上支持 5871 张级别的 UAV 影像,并在 ATE、点云距离和速度上取得同时改善,为无人机实时测绘、应急救援和多架次实景三维提供了一条可扩展路径;其模块化设计也使同一套控制逻辑有机会迁移到其他前馈三维重建模型。
Links:
Accelerating Reinforcement Learning via MPC Solver-Gradient Guidance for Weights-varying MPC
Authors: Baha Zarrouki, Arslan Thobani, Jasper Hoffmann, Mattia Piccinini, Rudolf Reiter, Felix Jahncke, Sébastien Gros, Davide Scaramuzza, Johannes Betz
Published: 2026-09-01
Categories: cs.RO, cs.LG, eess.SY
Abstract:
In Model Predictive Control (MPC), cost-function weights shape closed-loop behavior, yet changing conditions often make fixed parametrizations suboptimal and motivate context-dependent online adaptation. Learning such policies is difficult because behavior depends implicitly on numerical MPC solutions, producing nonlinear, potentially nonsmooth, long-horizon dependencies on policy parameters. This creates a bias-variance tradeoff: Reinforcement Learning (RL) optimizes realized closed-loop return from environment samples but is sample-inefficient, whereas Gradient-Based Policy Learning (GB-PL) uses low-variance solver gradients from differentiable MPC to optimize surrogate losses on predicted trajectories but can be biased under model mismatch. We propose Solver-Gradient Guided Reinforcement Learning (SG-RL), a solver-sensitivity augmentation for RL-based online MPC cost-weight adaptation. SG-RL keeps sampled closed-loop return as the objective and uses bounded solver-derived gradients as auxiliary guidance to improve stability and sample efficiency. We instantiate SG-RL in Proximal Policy Optimization (PPO) with four modular algorithms that inject solver-gradient guidance into actor-update scaling, policy loss, advantage estimation, and value-function learning. On two full-scale autonomous racing platforms with intentional model mismatch, SG-RL reaches PPO's best closed-loop return with up to 70.6% fewer samples, outperforms GB-PL baselines by at least 54% in closed-loop return, and generalizes zero-shot to unseen environments.
论文解读
研究问题与动机
模型预测控制(MPC)通过代价函数权重平衡跟踪精度、速度、平滑性和安全性。固定权重在工况稳定时有效,但自动赛车进入直道、急弯或不同赛道后,最优取舍会变化,因此更合理的做法是让策略根据上下文在线调整MPC权重。问题在于,策略的动作并不直接产生控制效果:它先改变权重,数值求解器再生成控制序列,车辆经过长时域闭环演化后才体现为回报。这是一个带有隐式、非线性甚至非光滑依赖的学习问题。
纯强化学习(RL)可以直接优化真实环境中的闭环回报,却需要大量试错,训练方差也较大。另一类梯度型策略学习方法利用可微MPC得到低方差的求解器梯度,在预测轨迹上优化代理损失;但当轮胎、空气动力学等模型与真实环境不一致时,代理梯度可能把策略带向错误方向。论文提出Solver-Gradient Guided Reinforcement Learning(SG-RL),保留RL对采样闭环回报的最终决定权,同时把求解器提供的局部方向作为辅助指导,试图取得样本效率与模型鲁棒性的平衡。
核心方法
SG-RL以PPO为基础。策略观测不仅包括车辆当前状态,还包括参考轨迹预览和历史性能偏差:前者提供即将到来的道路情境,后者帮助识别当前权重是否造成持续误差。Actor输出MPC代价权重,并经过Tanh投影和有界参数化,确保权重保持为正且处于安全范围。MPC随后根据这些权重求解控制问题。
在求解阶段,方法利用优化问题的KKT条件和隐函数定理,计算最优决策变量对权重的灵敏度,再得到性能损失沿权重方向的solver-gradient。由于模型失配可能导致该信号不可靠,SG-RL对梯度进行边界约束,并把它作为辅助信息而非替代真实回报。具体地,SG-SCA依据PPO梯度与求解器梯度的方向一致性动态缩放Actor步长;SG-LOS只在RL优势显示表现不佳时加入求解器方向的辅助策略损失;SG-ADV用求解器诱导的修正项塑造优势估计;SG-CRT则把求解器梯度作为Critic输入,帮助价值网络判断状态的调参难度。四个模块可以组合使用,核心训练目标仍是采样得到的闭环回报。
实验结果
实验覆盖两种全尺寸自主赛车平台:Dallara AV-24和Super Formula EAV-24。作者有意让预测模型和环境存在失配,以检验求解器梯度在非理想条件下是否仍能帮助RL。结果显示,SG-RL达到PPO最佳闭环回报时最多减少70.6%的环境样本,说明辅助方向显著提高了学习效率;相同闭环评价下,它相对GB-PL基线的回报至少高54%,表明直接使用真实回报可以减轻代理目标偏差。
方法还展示了跨环境能力:在Monza训练的策略无需针对新环境重新训练,即可零样本迁移到Laguna Seca和Suzuka。消融结果进一步指出,去除参考轨迹预览造成的性能下降最大,说明在线权重调整不能只依赖车辆当前状态,主动感知未来赛道结构是重要的信息来源。这些结果共同支持论文的证据链:求解器梯度提供样本高效的局部提示,PPO闭环回报负责校正模型失配,二者结合在真实赛车控制场景中更稳健。
局限性与意义
SG-RL并没有消除对物理模型的依赖。它需要一个至少能正确描述局部趋势的MPC模型;若模型严重错误,求解器梯度可能持续提供负面引导。工程实现还需要可靠地求解KKT灵敏度、限制梯度幅值,并仔细调节四种注入机制之间的权重。论文给出的核心实验摘要强调样本节省和闭环回报,但没有在现有材料中统一列出可直接迁移的batch size、学习率和训练轮数,因此复现时仍需根据平台和求解器重新标定。
这项工作的意义在于重新界定“模型知识”和“强化学习”的分工:物理求解器不再被当作必须完全正确的教师,而是提供可被门控、缩放和校正的建议。该思路适合已有MPC基础、又必须面对动力学失配和环境变化的机器人系统,并可能迁移到无人机、移动机器人及其他需要在线调节控制代价的任务。其实际价值不仅是更快训练,也在于让控制器能把对未来情境的预览转化为动态的控制偏好。
Links:
Non-Prehensile Throwing: A Reinforcement Learning Perspective
Authors: Abdullah Mustafa, Ryo Hanai, Ixchel G. Ramirez-Alpizar, Floris Erich, Ryoichi Nakajo, Yukiyasu Domae, Tetsuya Ogata
Published: 2026-09-01
Categories: cs.RO
Abstract:
Robotic throwing enables fast object transport and extends a robot's reachable operating envelope beyond traditional pick-and-place. While prehensile (grasp-based) throwing works well for graspable items, non-prehensile (grasp-free) throwing is better suited for large, heavy, and/or deformable objects. Existing approaches rely on model-based optimization with simplified contact models (e.g., dynamic grasping) and low-dimensional trajectory parameterizations, which limit solution quality and reachable operating envelope. We propose a reinforcement learning approach that additionally leverages sliding and rolling contact modes and directly optimizes joint-space trajectories without analytical contact models or custom parameterizations. The Markov Decision Process (MDP) is formulated as a dynamical system that evolves the robot's joint state conditioned on the throwing target, object model, and initial configuration. Joint-jerk trajectories are planned offline at a low control rate and upsampled into smooth, high-rate velocity commands for deployment. For sim-to-real transfer, we minimize the robot-dynamics gap through minimum-jerk system identification and train uncertainty-aware policies to mitigate object-modeling errors, particularly sensitivity to dynamic friction. In simulation, the policy achieves 99% success across thousands of configurations and generalizes to unseen objects. Sensitivity analysis shows robustness to mass uncertainty but high sensitivity to dynamic friction, consistent with the sliding-based release mechanism. Deployed zero-shot on a UR5e operating near its physical limits (5 m/s end-effector velocity), our method throws diverse objects including heavy (790 g) and large (20x20x28 cm) items to targets up to 350 cm distance or 180 cm elevation, achieving a 97% real-world success rate.
论文解读
研究问题与动机
机器人抛掷能把物体送到传统抓取-搬运难以覆盖的远处。对于大型、沉重或可变形、难以稳定抓取的物体,不依赖夹持的非抓取式抛掷尤其有价值。但已有方案多用动态抓取等简化接触模型,并把动作限制为低维多项式或样条轨迹;一旦物体发生滑动、滚动或接触模式切换,模型误差和局部优化就会限制可达范围与落点质量。
本文提出从强化学习角度直接学习抛掷过程。关键想法是把机器人关节状态、目标、物体几何与摩擦参数放进同一决策过程,让策略自行发现何时滑动、滚动以及释放,而不是预先写出解析接触公式。这样既适合难建模的接触,也有望迁移到不同重量、尺寸和形状的物体。
核心方法
任务被建模为一个以目标、物体模型和初始配置为条件的动力学系统。策略观测机器人位置、速度、加速度、物体参数、目标位置及上一动作,输出三个关节的jerk(加加速度)。每个动作在较低频率下产生,再通过积分和上采样变成平滑的高速速度指令:训练仿真采用20 Hz决策、120 Hz执行,真实机器人采用500 Hz执行。相比直接输出速度,这种控制让轨迹连续且便于施加平滑和安全约束。
奖励同时考虑是否及时完成释放、物体落点与目标的距离、飞行速度方向、成功判定和动作平滑性。成功区域半径为0.25 m,并用精度奖励区分“碰到目标”和“落得准确”。滑动、滚动、粘附三类接触由动力学仿真自然产生,策略不需要显式选择接触模式。训练使用PPO与非对称actor-critic:策略只依赖部署时可获得的信息,价值网络可以使用物体位姿和速度等特权信息。实验在4096个并行环境中训练1000个epoch,约2.62亿步,RTX 4090上约需1小时。
为了实现sim-to-real,作者先用真实机器人执行循环轨迹,调节仿真执行器刚度和阻尼,使关节位置、速度响应一致;再进行敏感性分析和参数随机化。结果显示质量误差相对容易承受,但动态摩擦系数对基于滑动释放的结果极其关键,因此训练中对摩擦加入均匀扰动,最佳设置约为±0.3。
实验结果
在模拟中,策略在数千种配置上达到约99%的成功率;对未见过的圆柱,成功率为98.54%,多数YCB物体也超过95%,说明它并非只记住训练形状。控制消融表明,20 Hz决策优于60 Hz;jerk控制优于速度或加速度控制;使用平面三自由度比直接探索六自由度更稳定。
真实实验部署在UR5e及定制托盘上,末端速度接近5 m/s的硬件极限。系统覆盖组织盒、790 g木块、罐体、部分装液瓶和20×20×28 cm大箱体,对60个物体-目标组合取得97%的平均成功率;目标最远约350 cm、最高约180 cm。失败主要集中在极端远距离或高位目标,原因包括速度上限和机器人基座碰撞,而非普通目标下的接触模式失效。
局限性与意义
这项工作的意义在于展示了一条不依赖手工接触模型的非抓取抛掷路线:用高频平滑执行承接低频策略决策,用摩擦不确定性训练弥合仿真与现实,并能零样本部署到真实机器人。它对大件、重件和软物体的远距离转运具有直接启发,也说明动态摩擦应成为sim-to-real建模的重点。
当前方法仍主要处理平面三自由度任务,初始物体需要在托盘上正确居中;训练没有显式加入机器人基座碰撞,极端目标会触发安全边界。此外,质量鲁棒并不意味着对所有材料都鲁棒,动态摩擦变化仍可能显著改变滑动释放。未来需要扩展到三维姿态与空间接触,引入碰撞和关节极限约束,并在更丰富的物体材料、托盘几何和环境扰动下验证泛化能力。
从工程角度看,本文还提示评估抛掷策略不能只报告平均成功率:应同时记录目标距离、高度、物体尺寸质量、摩擦扰动和动作平滑性。对真实部署而言,释放前的托盘姿态、执行器延迟以及安全区域同样是决定成败的变量。将这些因素纳入训练和测试,才能判断方法是否真正适用于开放场景中的长距离物料搬运。
Links:
VOIM: Training-Free Open-Vocabulary 3D Instance Mapping for RGB-D and Monocular SLAM
Authors: Sangmin Song, Sarath Kodagoda, Marc G. Carmichael, Karthick Thiyagarajan, Amal Gunatilake, Kelly Prentice, Jodi Martin
Published: 2026-09-01
Categories: cs.CV, cs.AI
Abstract:
We present Voxel-Grounded Online Instance Manager (VOIM), a training-free voxel-grounded instance manager that builds open-vocabulary 3D instance maps from RGB-D or from monocular RGB alone, a regime no prior training-free system addresses. Online systems typically segment object instances and label them at first detection, committing when evidence is weakest. VOIM instead defers label and instance decisions until soft evidence from unmodified, off-the-shelf perception has accumulated per voxel across views. We show that the mapping stage, rather than the particular perception models, carries the result: across four perception configurations on ScanNet++, varying the region descriptor, the detector label prior and the mask source, the map exceeds the strongest online RGB-D system, OVO-SLAM, by between 4.8 and 11.7 mIoU. Perception is not neutral, and substituting that baseline's own descriptor family costs 4.1 of the margin, yet the baseline carries the marginally better 2D descriptor (33.7 vs. 31.5 mIoU over three scenes) and still realizes the weaker map. Under a like-for-like protocol VOIM reaches 44.07 mIoU on ScanNet++ against 32.37, winning all ten scenes and both aggregations (pooled 33.31 vs. 25.97), and the same system runs unchanged to fully monocular RGB, matching that baseline pooled on Replica (27.80 vs. 27.50). The advantage is regime-specific: under Replica's all-classes scoring, matched inputs give a split result, 28.60 vs. 27.50 pooled against 24.59 vs. 30.11 on the per-scene mean. Room scale is label-limited and building scale drift-limited. Labeling does not run in real time, dominated by per-class detection over the full vocabulary. The maps export occupancy grids and resolve free-form queries to object instances.
论文解读
研究问题与动机
VOIM(Voxel-Grounded Online Instance Manager)研究的是一个面向机器人的实际问题:如何从连续的 RGB-D 或普通单目 RGB 视频,在线构建能够被自然语言查询、同时区分不同物体的三维实例地图。开放词汇检测器可以识别预先没有专门训练的类别,但在线系统通常在物体第一次出现时就立刻决定类别和实例身份。初次观测可能来自遮挡严重或视角不佳的单帧,检测器幻觉、掩码越过深度边界以及偶然的错分类一旦写入地图,后续观测很难纠正。
作者的核心判断是,二维感知输出不应过早变成不可逆的硬标签。若把每次观测看成带置信度的软证据,在三维体素中跨视角、跨时间累积,等几何和语义证据充分后再分类和聚类,就能用场景冗余抵消单帧噪声。该设计还减轻了对深度相机的依赖:RGB-D 可直接提供深度,单目模式则由单目 SLAM 的点图和位姿提供几何。系统不针对场景重新训练,目标是让开放词汇建图更容易迁移。
核心方法
输入视频先由 MASt3R-SLAM 或 VGGT 估计关键帧相机位姿和稠密点图。冻结的 Grounding DINO Swin-B 按给定词汇表进行开放词汇检测,SAM2 Hiera-L 将检测框细化为实例掩码;检测置信度阈值为 0.25。对每个掩码,PE-Core TextRegion(L14-336)计算区域与全部文本类别的相似度,并以温度 0.03 的 softmax 形成软标签分布。系统把检测器的 one-hot 类别和区域描述符分布按 alpha=0.5 融合;若检测器类别不在描述符预测的前五名中,便启动跨模型否决,仅保留描述符证据,从而抑制检测器幻觉。
随后将关键帧点变换到世界坐标并去重到规则体素网格。每个体素不只保存一个类别,而是保存所有历史掩码的观察。对体素 v 和类别 l,累积概率为 P_v(l)=(1/Z_v)Σ c_m p̃_m(l),其中 c_m 是掩码对应的检测置信度,Z_v 是所有观察置信度之和。这样高置信度观测贡献更大,软分布则避免一次错误 argmax 覆盖后续证据;同时保存归一化区域嵌入,使体素地图可以响应自由文本查询。全部观测完成后才取类别最大值,再以 15 邻域和 60% 多数票进行空间平滑,并对每一类别独立运行 HDBSCAN(最小簇大小 15、最小样本数 5、合并半径 6 cm)得到物理实例。ScanNet++ 使用 2 cm 体素和 512 输入,Replica 使用 1 cm 体素与全分辨率;单目轨迹通过一次全局 Sim(3) 对齐。
实验结果
在 ScanNet++ 的 10 个场景、前 100 个类别上,使用相同关键帧、真值位姿和词汇表进行公平比较,VOIM 的逐场景 mIoU 为 44.07,而在线 RGB-D 基线 OVO-SLAM 为 32.37,绝对提高 11.70 个百分点,并在全部 10 个场景获胜;池化 mIoU 也由 25.97 提高到 33.31。Replica 的 51 类实验中,VOIM 使用 RGB-D 和真值几何时 pooled mIoU 为 28.60,仅用单目 RGB 时为 27.80,逐场景均值为 23.55,说明房间尺度下单目几何没有造成决定性损失。
消融结果直接支持延迟决策。单目设置中去除跨模型否决后,逐场景 mIoU 从 23.55 降到 19.48,下降 4.07;把软分布改成映射前的 one-hot 硬标签后降到 20.38,软投票带来 3.17 个百分点收益。实例级指标中,单目 VOIM 的 AP@25/AP@50 为 27.28/14.79,覆盖率 30.1%、纯度 52.4%,RGB-D OVO-SLAM 对应为 33.07/26.05、40.8%/65.1%,表明无深度时主要损失在实例召回和纯度。Replica room0 在 NVIDIA A10G 上端到端耗时 290 秒,关键帧语义标注为 15.3 秒,超过 90% 的标注时间用于遍历 51 类词汇表的检测。
局限性与意义
VOIM 的单目优势目前主要体现在房间尺度。建筑尺度上,位姿漂移会使本应重合的点分裂成错误几何;某个 ScanNet++ 序列的 mIoU 仅为 4.6,换用真值位姿也只是将另一组结果从 7.9 提高到 16.9。检测器对墙壁、地板等 stuff 类不够可靠,小物体漏检也会限制实例召回;Replica 的 office1 仅有 15.4 mIoU,说明大面积类别的错标会显著拉低全类别指标。逐类检测的时间随词汇量增长,当前不能实时运行;区域特征缓存也线性占用内存,约 400 万个 1024 维特征可消耗 23 GiB 显存。
这项工作的意义在于重新安排证据进入地图后的决策时机,而不是再训练一个更大的感知网络:先保留不确定性,再借助空间和时间冗余消歧,最后生成可查询实例。其信息流可迁移到新的词汇表、VIO 后端或其他区域描述符,只要能提供对齐的世界坐标点。未来需要压缩逐类检测开销、改善 stuff 和小物体识别,并抑制单目漂移,才能把这种免训练的开放词汇建图扩展到实时、大尺度部署。
Links:
HELIOS: From midnight to noon, continuous outdoor urban scene relighting
Authors: Hala Djeghim, Nathan Piasco, Luis Roldão, Moussab Bennehar, Dzmitry Tsishkou, Céline Loscos, Désiré Sidibé
Published: 2026-09-01
Categories: cs.CV
Abstract:
Modifying the illumination of driving images is a fundamental challenge, as most datasets are captured at specific times of day. Existing methods rely on synthetic data or paired multi-illumination supervision, which limits their generalization to the diverse and challenging conditions of real-world scenarios. To address this, we propose HELIOS, a novel image relighting approach that relies on unlabeled real-world datasets without requiring any paired images for training. Our approach integrates albedo-based conditioning into a cycle-consistent diffusion pipeline to prevent identity collapse and ensure accurate domain translation. To handle low-visibility nighttime conditions, we introduce a robust albedo distillation strategy that transfers structural stability from the daytime domain. Additionally, we replace traditional text prompts with a fine-grained control mechanism based on GPS-derived solar angles, enabling smooth and continuous lighting manipulation across the day-night cycle. Through extensive evaluation and a user study, we demonstrate that HELIOS produces structurally consistent and realistic results in both night-to-day and day-to-night tasks, outperforming state-of-the-art methods.
论文解读
研究问题与动机
自动驾驶系统需要覆盖不同时间和光照的训练图像,但真实世界中几乎不可能为同一城市道路采集严格对齐的昼夜成对照片。现有重打光方法往往依赖合成数据,存在明显域差;依赖配对监督,采集成本又很高。无配对的循环一致性模型也可能发生“身份坍塌”:为了满足重建损失,模型复制输入,光照并没有真正改变。HELIOS(From midnight to noon, continuous outdoor urban scene relighting)要解决的正是这一矛盾:在真实驾驶数据上,从单张夜图生成白天图,也能反向生成夜图,并且让中间光照连续可控。
作者的基本直觉是把场景内容和照明因素分开。反照率表示物体较稳定的本征颜色与结构,太阳高度角则是具有物理含义的照明控制变量。这样,模型不能只把源图像当作复制模板,而必须依据结构条件保持道路、车辆和建筑,同时依据目标光照生成新的阴影、亮度和局部光源效果。
核心方法
HELIOS 建立在 Stable Diffusion 2.1 与 ControlNet 之上。模型接收带噪图像、光照条件以及反照率图,经扩散 UNet 逐步恢复目标光照下的图像。光照不再用“night”“day”这类离散文本描述,而由 GPS 元数据计算太阳高度角:sin(theta_s)=sin(phi)sin(delta)+cos(phi)cos(delta)cos(h),其中 phi 是纬度、delta 是太阳赤纬、h 是时角。角度经过位置编码后注入 UNet 交叉注意力;正值对应白昼、负值对应夜间,因此可以在午夜到正午之间连续调节。
训练包括自重建和跨光照循环。源图像先被变换到目标太阳角,再用源角和同一反照率变换回来,重建损失与循环损失共同约束场景身份。关键难点是夜间过暗、噪声大,普通反照率估计器会把阴影误当成物体颜色。作者先用初步的昼转夜模型为同一场景合成 3 个夜间版本和 2 个白天版本,再用白天图像得到的高质量反照率作为伪标签,蒸馏并微调 Stable Diffusion 反照率估计器,使其在极暗夜景中仍能输出稳定结构条件。
实验结果
实验使用 nuScenes、Waymo Open Dataset 和 PandaSet,真实样本覆盖约 -40° 到 +70°的太阳高度角。训练时 U-Net 微调 100k steps,ControlNet 训练 300k steps,约耗时 4 天,使用 RTX 4090 等效算力。作者从 FID、CLIP-Score、DINO-struct、mIoU 和 18 人用户研究多个维度评估图像质量、语义一致性与结构保持。
在夜转昼任务中,HELIOS 的 FID 达到 74.65,而多数比较方法高于 110,说明其生成分布更接近真实白天图像。去掉反照率蒸馏后,FID 降质到 141.75,表明该模块并非装饰性设计,而是夜景重打光的关键。定性上,CycleNet 与 IP2P 常常几乎复制输入,Qwen-Image 虽能产生醒目的光影,却可能凭空增加车辆或改变建筑;HELIOS 在保持几何布局的同时生成路灯、车灯影响及白天漫反射。作为数据增强工具,它还使 YOLOv11 在夜图上的 mAP@50 从 6.0 提高到 10.0,mAP@75 从 2.7 提高到 8.0。
局限性与意义
模型不能恢复在无路灯极端微光中完全不可见的细节;反照率伪标签依赖初始重打光模型,也可能把真实光照与材质混淆。此外,太阳高度角主要描述太阳而非所有局部人工光源,连续角度控制并不等于完整的物理渲染。因而它更适合作为真实驾驶数据的数据增强与跨时段鲁棒性工具,而不是替代高保真三维渲染器。
总体而言,HELIOS 的贡献不是简单套用扩散模型,而是用反照率条件阻断循环模型的复制捷径,再用 GPS 太阳角提供连续、可解释的控制,并以蒸馏解决夜间结构估计失效。对研究者而言,这提供了一条在无配对真实数据上学习可控视觉变换的实用范式;对自动驾驶而言,检测指标的提升说明重打光结果至少能转化为有用的感知训练样本。
这一思路也提示了实际部署时的边界:输入元数据质量会直接影响目标照明,缺少可靠 GPS 时间信息时需要额外估计太阳角;不同城市的材质、天气和摄像机曝光分布也可能带来迁移误差。后续工作可进一步建模云层、街灯等非太阳光源,并用真实跨时段采样检验生成样本对检测器的长期收益。
Links:
HitMem: Hierarchical Temporal 3D Memory with Multi-Modal Context-Aware Retrieval for Dynamic Environments
Authors: Ruijie Tang, Chenye Zou, Guoquan Wu, Jun Wei, Wei Chen, Jiaxin Zhu
Published: 2026-09-01
Categories: cs.RO
Abstract:
Executing long-term tasks in dynamic environments requires embodied agents to maintain robust and adaptive 3D scene representations. However, most existing 3D memory frameworks rely on static world assumptions. When objects are displaced by human activities or unobserved events, agents encounter memory-observation conflicts and often require costly geometric recomputations or inefficient global re-exploration. To address this, we propose HitMem, a hierarchical temporal 3D memory framework with a multi-modal context-aware retrieval mechanism. Through continuous perception, HitMem unifies semantic and spatial information into a lightweight topological graph that captures support relationships, while a temporal decay mechanism dynamically regulates memory activeness to mitigate the impact of stale representations. In addition, the multi-modal context-aware retrieval mechanism defaults to filtering candidates using integrated semantic, spatial, and temporal memory features, and activates a specialized two-stage retrieval process when object displacement is detected. This process combines spatial constraints inferred from external agent trajectories with semantic common sense grounded in class affinities, efficiently identifying high-probability candidate regions. Extensive evaluations on our constructed Dyna-THOR benchmark demonstrate that HitMem significantly improves object relocation accuracy, reduces exploration costs, and enhances task execution performance in dynamic environments.
论文解读
研究问题与动机
机器人在家庭、办公室等环境中执行长程任务时,物体并不会一直留在原处。人或其他机器人移动物体后,传统三维场景图仍保存着旧坐标,导致记忆与观测冲突;重新构建几何关系代价高,而物体丢失后的全局搜索又十分低效。HitMem 关注的正是这个问题:如何判断哪些记忆仍可信,并在物体被移动后快速推断它的新位置。
论文的关键直觉是区分稳定的承载物与易移动的被承载物。桌子、柜子等通常不会频繁改变,而苹果、杯子等可能被拿走或重新摆放。因此,系统可以让两类记忆拥有不同的“新鲜度”,再利用外部代理的运动轨迹和物体类别常识缩小重定位范围。作者还构建了 Dyna-THOR 动态基准:基于 AI2-THOR 的 12 个交互场景、4 类房间和 60 个长程任务,让外部代理主动移动物体。
核心方法
HitMem 首先为每个实例建立三维记忆节点,保存边界框、分割掩码、CLIP 视觉特征、点云和全局位置;图中的边只表示“承载—被承载”关系。承载关系由空间邻近、水平覆盖、垂直支撑和高度一致性综合判定,承载评分超过 0.5 才建立层级边。这样做能把场景组织为较稳定的承载层和变化更快的物体层,减少动态更新范围。
系统给每个节点维护随时间衰减的活跃度:活跃度是最近观测间隔的指数函数。承载物的衰减率设为 0,被承载物使用基础衰减率 0.1,并依据场景规模调节,使大场景中的稳定信息不会过早失效。收到“找到桌上的苹果”之类指令后,系统以 CLIP 语义相似度和活跃度联合检索,机器人前往最高分位置进行主动验证。图像感知使用 RAM-Grounded-SAM2,特征提取使用 CLIP,规划器使用 GPT-4o,自我中心输入统一为 400×400。
若验证发现目标不在原处,HitMem 不立即进行全局搜索,而是执行两阶段重定位。第一阶段分析目标消失附近的人或机器人轨迹,依据局部运动方向和半圆候选扇区筛出可能的承载物。第二阶段让 LLM 或文本模板评估“某类物体与某承载物”的语义亲和度,例如物品可能被放入水池、柜子或垃圾桶,再用 softmax 得到候选概率并依次扫描。轨迹提供空间约束,语义关联提供常识约束,两者互补。
实验结果
在 Dyna-THOR 上,HitMem 的总体成功率(SR)为 51.67%,路径长度加权成功率(SPL)为 34.24%,真值完成率(GCR)为 64.08%。相比在线时空记忆方法 DynaMem 的 35.00% SR、16.86% SPL 和 47.69% GCR,三项均明显提高;相比支持局部更新的 DovSG,HitMem 也将 SR 从 18.33% 提升到 51.67%,SPL 从 13.09% 提升到 34.24%。这说明收益不仅来自“记住更多”,也来自更少的无效移动。
消融结果进一步揭示各模块作用:去掉分层结构后 SR 降至 46.67%;去掉时间衰减后 SPL 从 34.24% 降至 20.45%,表明过期坐标会诱发重复访问;去掉完整重定位策略后 SR 仅为 31.67%。在 ALFRED unseen 数据集上,系统 SR 达到 52.94%。当轨迹点随机丢失 30%或加入高斯噪声时,性能只出现轻微下降,说明方法不要求完美的外部代理跟踪。
局限性与意义
HitMem 的边界首先由感知质量决定:极薄的盘子可能无法被分割,垃圾桶等关键容器漏检会使语义索引缺失;杯子与马克杯等相似类别也可能造成错误关联。系统依赖 CLIP、视觉分割模型和 LLM,LLM 的常识判断仍可能产生幻觉动作,当前流程还缺少更强的事前规划验证。此外,Dyna-THOR 的场景规模和交互类型有限,真实世界中的遮挡、多人同时操作和更复杂的物体关系仍需检验。
这也使系统能够把有限的导航预算优先用于最可能的位置,降低长程任务中的无效往返。
总体而言,论文的意义在于把动态三维记忆从“不断重建地图”转向“管理信息时效并利用事件上下文”。分层记忆适合承载关系明显的室内环境;轨迹过滤和语义候选排序也可迁移到其他具身任务,只需替换实例感知器、承载关系规则和类别知识库。其后续重点应是提高感知鲁棒性、校验语言模型动作,并在更多真实动态环境中评估长期记忆的可靠性。
Links:
Efficient and Robust Absolute Pose Estimation via Gravity-Prior-Driven Transformation Decoupling and Pose Refinement
Authors: Hu Cao, Qianyi Yang, Xinyi Li, Jiong Liu, Yinlong Liu, Alois Knoll
Published: 2026-09-01
Categories: cs.CV
Abstract:
Estimation of the absolute pose of an object is an essential task for various robotic applications. Recently, incorporating gravity direction as prior information has emerged as a popular approach to simplify absolute pose estimation. However, developing a robust and efficient algorithm to solve this challenging problem remains a difficult question due to large amounts of mismatches. In addition, obtaining an accurate pose solution from selected inlier correspondences with gravity prior is still a research gap. In this paper, we propose a novel transformation strategy that exploits geometric relations derived from the gravity prior. Through transformation decoupling, the original 6 degrees of freedom (DoF) absolute pose estimation problem is simplified into a 4-DoFs problem: 1-DoF for the rotation angle and 3-DoFs for translation, significantly improving the efficiency. For the 1-DoF rotation angle, we apply a one-dimensional global voting algorithm for optimal estimation. Once the optimal rotation is obtained, the mismatched correspondences are preliminarily filtered, and translation estimation, a linear problem, can be easily solved. Furthermore, to obtain accurate pose results, we introduce a novel pose refinement algorithm to enhance the accuracy of both rotation and translation. Extensive experiments on synthetic data and three publicly available real-world datasets (TUM RGB-D, ETH3D, and RobotCar) demonstrate that the proposed method achieves stronger performance compared to existing state-of-the-art (SOTA) approaches. To further validate our method, we integrated it into ORB-SLAM2. The results on the KITTI dataset show it effectively reduces drift and improves trajectory alignment during relocalization. The source code will be released upon acceptance.
论文解读
研究问题与动机
机器人和视觉SLAM常需要根据3D地图点与图像中的2D观测恢复相机绝对位姿。标准PnP同时估计三维旋转和三维平移,是6自由度问题;真实匹配中又常有大量误匹配,使RANSAC需要反复采样,确定性方法则往往计算昂贵。许多设备能通过IMU或消失点提供重力方向,因此旋转并非完全未知:只剩绕重力轴的一个角度。论文的关键判断是,既有重力约束方法偏向先解三维平移,仍未充分利用这个更简单的一维旋转空间,也没有为后续高精度优化设计专门的4自由度精化器。
作者据此提出一个“旋转优先”的两阶段框架。它先在一维角度上进行全局投票和异常匹配过滤,再求平移并做非最小精化,目标是在高外点率下保持确定性和准确性,同时让最昂贵的点对计算可以并行化。
核心方法
对每个3D点x_i及其相机归一化视线y_i,有λ_i y_i=R x_i+t。已知世界重力g_w和相机重力g_c后,先构造固定旋转R_0将前者对齐到后者,再把姿态写成R=R(θ,g_c)R_0;因此未知旋转只剩θ。对两组对应取叉积可消除深度和共同平移,得到m_k^T R n_k=0,其中m_k=y_i×y_j、n_k=x_i−x_j。代入旋转表达式后,每个点对都产生A_k sinθ+B_k cosθ+C_k=0。算法将[-π,π]划分为360个角度箱,对N(N−1)/2个点对投票,票数峰值给出旋转并帮助排除外点。
旋转固定后,平移变成线性估计,作者用RANSAC从筛出的内点求t。第二阶段最小化投影叉积残差Σ||[y_i]_×(Rx_i+t)||²。对平移求导可先消去t,再把旋转写为cosθ和sinθ,转成带x²+y²=1约束的二次优化。hidden-variable resultant消去拉格朗日乘子,得到四次一元多项式;求出候选根并选择原目标最小者,形成适配重力约束4-DoF空间的非最小精化。实现采用C++,实验使用R7-6800H 3.20GHz处理器和16GB内存。
从工程角度看,第一阶段并不需要先相信单个匹配:每个点对都只贡献一个关于θ的几何约束,错误点对的投票会分散,而一致内点会在同一角度附近聚集。获得峰值后再估计平移,避免让三维平移的不确定性干扰旋转判别。精化阶段则使用全部保留下来的内点,而不是继续依赖最小样本,因此能把粗粒度投票结果转化为更稳定的连续数值解。
实验结果
合成实验在外点率0.1–0.8、噪声σ=0.5–10、重力偏差0.5°–5°范围测试,每种设置重复100次;成功标准为旋转误差小于1°、平移误差小于1.5。外点率达到0.8时,本方法两类成功率仍接近100%,而多数SqPnP、EPnP等基线在外点率超过0.4后跌至20%以下。噪声σ=4时,本方法成功率约98%;在外点率0.5且σ=10的极端设置下,在约2.5°旋转和7的平移容差下仍达到100%成功率。
重力并非无误差:偏差从0.5°增至5°时,平均旋转误差约由0.5°增至3°,平移误差约由1增至5。运行方面,在N=1000、σ=1、外点率0.5时,旋转估计约0.70秒、平移约0.21秒、精化约0.004秒;总耗时通过并行由1线程8.05秒降至16线程0.91秒。TUM RGB-D、ETH3D和RobotCar上的平均耗时分别为0.60、1.47和0.87秒。
在ORB-SLAM2中替换原PnP求解器并测试KITTI 01后,APE RMSE从16.40降至9.36,最大APE从32.15降至14.93;RPE RMSE从1.029降至0.539,最大RPE从31.36降至16.70,说明更稳健的重定位能够明显减轻轨迹漂移。真实RobotCar实验中,在平移精度0.05米处,本方法成功率约95%,而SupeRANSAC约60%。
局限性与意义
方法的价值在于重新安排求解顺序:先解决最容易被全局处理的一维旋转,再处理线性平移,并用结果式精化补足精度。它尤其适合有可靠重力估计、误匹配比例高的机器人定位和视觉SLAM。精化模块的消融结果表明,粗估计负责稳定抗外点,精化负责降低最终误差,两者具有互补性。
局限也很明确。点对投票随输入数量呈二次增长,尽管可多线程,超大规模匹配时仍可能慢于简单RANSAC;重力偏差会系统性地恶化旋转和平移。论文所给实验主要采用固定360箱、合成噪声模型和若干真实数据集,部署时还需评估IMU偏置、匹配分布及阈值迁移。总体而言,它展示了将传感器先验直接转化为低维几何搜索和专用精化器的有效路径。这一路径也便于接入已有定位系统。
Links:
Adaptive Depth-Map-Guided Bundle Adjustment for Correspondence-Free Multi-View Point Cloud Registration
Authors: Yiran Zhou, Yingyu Wang, Shoudong Huang, Liang Zhao
Published: 2026-09-01
Categories: cs.RO
Abstract:
Robotic processing of irregular steel scrap requires dense 3-D measurement to replace manual visual assessment in hazardous cutting workcells. The reconstructed map is used to estimate piece dimensions, boundary geometry, feasible preheating and cutting regions, and collision-aware torch paths. The reconstruction errors therefore propagate directly to downstream measurement and planning. Existing multi-view registration methods commonly rely on feature extraction and data association to establish correspondences between views. In workcells with smooth metallic surfaces, repeated structures, occlusions, and partial overlaps, however, wrong correspondences may be established, leading to inaccurate pose estimation and distorted reconstruction. This paper presents an adaptive layered depth-map-guided bundle adjustment framework for correspondence-free multi-view point cloud registration. The scene is represented by a global 2.5-D grid, where each cell can adaptively maintain multiple depth hypotheses. Raw depth observations are directly projected into the global map to form depth constraints without explicit feature correspondences. At grid cells where multiple surfaces produce conflicting depths, a softmax-based layer assignment links each observation to compatible depth hypotheses. The resulting nonlinear least-squares formulation jointly refines sensor poses and the layered depth map, with correspondences implicitly induced by the depth-map representation and projection model. Experiments on self-collected industrial datasets show that the proposed method achieves consistently competitive reconstruction accuracy while maintaining robustness and low computational cost in challenging industrial scenarios. We release the open-source code implementation at: https://github.com/YiranZhou-Robotics/ADM-BA.git
论文解读
研究问题与动机
工业废钢、钢胚和钢卷的三维重建常面对光滑反光金属、重复结构、遮挡和较小视场重叠。传统多视图配准通常依赖稳定的特征点和跨帧对应,但这些条件在工业现场并不可靠:错误匹配会让位姿估计和地图一起扭曲,逐帧 ICP 又容易陷入局部最优并累积漂移。三维占据栅格虽然更通用,却需要维护高分辨率体素,难以满足效率要求。
论文的出发点是,对于以俯视扫描为主的工业场景,可以把全局几何表示成二维网格上的深度图;而遮挡和重叠意味着同一网格位置不能总是只有一个深度。因此作者提出 ADM-BA,在每个网格单元自适应保留多个深度层,用几何兼容性直接连接观测与地图,绕开显式点对应。方法重点不是增加更复杂的特征,而是改变地图表示,使不连续表面和局部遮挡成为可优化的变量。
核心方法
系统先把各帧点云依据待估计的传感器位姿变换到全局坐标,并投影到全局 2.5-D 网格,随后剔除不适合当前表达的垂直面。对每个网格位置收集深度样本,用核密度估计(KDE)寻找深度分布的峰值,以此初始化多个候选层。层数和层的位置由观测分布决定,因此平坦区域可以简单,重叠或遮挡区域则能保留多个表面。
对于投影到单元的观测,算法计算它与各深度层的差异,把负的深度差平方作为兼容性分数,再通过 softmax 产生分配权重。这样一个观测不是被硬塞给某一层,而是以连续权重参与多个层的优化;随着位姿和深度更新,权重也随之调整。状态同时包含所有帧位姿和深度图变量,目标由两部分组成:深度残差用网格插值约束观测与地图表面的距离,平滑残差抑制相邻网格的不合理剧烈变化。作者用 Gauss–Newton 交替/联合更新位姿与地图,形成从投影、分层、软分配到全局平差的闭环。
为控制计算量,实验把约 130 万个原始点降采样到约 2.8 万点参与优化,网格分辨率采用 0.05 m 或 0.025 m,softmax 锐度由 β 控制。整个框架不需要训练神经网络,主要计算来自 KDE 初始化、残差构建和 Gauss–Newton 迭代,因此更接近可解释的几何优化系统。
实验结果
作者在 9 个自采工业数据集上评估方法,数据覆盖受控的塑料薄膜背景、含已知路标的半现实废钢渣底座,以及随机堆放钢胚和钢卷的真实场景。比较对象包括 TEASER 初始化的 ICP(T+ICP)、位姿图优化(T+PGO)、传统特征 BA(T+BA)、BALM2 和三维占据栅格方法 3D Occ。以长度、宽度以及水平和垂直位移误差衡量时,ADM-BA 在各类场景总体达到最优或次优;在特征方法发生配准失败的弱特征场景中仍能保持稳定几何结构。
效率优势也很明显。在一个 21 帧序列上,ADM-BA 处理时间为 24.4 秒;T+ICP 约 500 秒,T+PGO 约 691 秒,而 3D Occ 达到 1750.5 秒。单层深度图的对照实验显示,物体边缘和堆叠区域会出现边缘模糊或表面加厚;自适应多层地图则能保留局部不连续,说明性能提升来自地图表示本身,而不只是优化器更快。
局限性与意义
ADM-BA 的表达本质上是 2.5-D,最适合从上方或相对单一方向观察的扫描路径。若场景需要完全三维环绕、存在大量垂直表面或深度层数极其复杂,单个二维网格可能无法表达所有可见结构,届时需要更一般的体地图或多视角表示。方法还假设扫描期间环境静止;运动中的废料、机械臂遮挡变化或强反光导致的系统性深度异常,可能使深度残差和平滑先验失效。
尽管如此,论文提供了一个很实用的设计视角:在工业点云中,避免不可靠对应未必意味着使用昂贵的全三维模型,也可以用自适应的多层深度结构把遮挡显式化,再通过软分配和联合平差吸收不确定性。该方法尤其适合需要高效率、可解释误差项和弱纹理鲁棒性的工业重建;代码已公开,便于围绕网格尺度、KDE 带宽、β 及深度/平滑权重开展复现和迁移。
Links:
Peg-in-Bench: A Modular Benchmark for High-Precision Robotic Insertion
Authors: Yosel Delgado, José G. Buenaventura-Carreón, Floris Erich, Roman Mykhailyshyn, Tomohiro Motoda, Koshi Makihara, Yukiyasu Domae
Published: 2026-09-01
Categories: cs.RO
Abstract:
High-precision insertion remains a fundamental challenge in robotic manipulation due to the strict alignment requirements and contact-rich interactions involved. Although peg-in-hole tasks are widely used for evaluation, existing bench- marks often rely on fixed task configurations, limiting their ability to assess robustness and generalization across different insertion scenarios. This paper introduces a reconfigurable peg-in-hole benchmark designed to evaluate task generalization in high-precision insertion. The benchmark consists of a set of fully 3D-printable modular components, including multiple peg geometries, tolerance levels, and configurable base structures that can be combined to generate a large variety of insertion and assembly tasks. By varying object layouts, orientations, and task structures while maintaining controlled physical conditions, the benchmark enables systematic evaluation of adaptation to unseen scenarios. To support reproducibility, we additionally provide a scenario generation tool capable of producing standardized task configurations and machine-readable task descriptions. The scenario generation tool and the STL files of the benchmark pieces are available through the project repository: https://github.com/aistairc/peg-in-bench.
论文解读
研究问题与动机
高精度插入看似是简单的“销钉入孔”,实际同时要求位置、姿态和接触控制足够准确。机器人只在一个固定孔位和固定物体上表现良好,并不意味着它能适应新的布局、方向或装配顺序。现有插入与装配基准往往预先固定任务配置,因此很难系统地区分“学会了插入动作”和“泛化到了未见任务”。
Peg-in-Bench 的目标正是测量后者:在照明、摩擦和材料等物理条件保持受控时,只改变任务配置,观察机器人对新情形的适应。基准完全由可3D打印的模块构成,支持空间泛化、几何泛化和任务组合泛化。它还提供场景生成器,同时输出便于人工布置的场景示意和机器可读的 JSON 任务描述,从而让训练、测试和复现实验有统一规范。
核心方法
基准包含三类可组合部件。第一类是销钉,提供圆形、长方形、六边形、三角形和 L 形五种几何;第二类是带孔工件,设置 0.1 mm、1 mm、3 mm 三档公差,让实验可以从宽松间隙逐步推进到高精度插入。工件采用八角棱柱,因此有八种安装方向;孔位是偏心的,旋转工件会改变插入点的全局坐标,红色方向线则提供明确的朝向参照。
工件内嵌 N50 磁铁,既方便快速替换,又形成安全保护:插入力过大时工件会脱开,避免脆弱的打印件折断。第三类是底座,包括 Corner、Empty、Line、Cross 四种结构;侧面的互锁设计允许把多个底座拼成长时域、多阶段装配任务。五种几何与三档公差形成 5×3 个基础组合,八角工件还提供 8/8 个离散朝向配置。改变孔的位置和方向即可测试空间泛化,替换销钉和公差即可测试几何泛化,串接底座则可测试任务规划、状态管理和连续执行能力。
使用时,场景生成器随机采样孔位、朝向、销钉形状、公差和任务序列,并写入 JSON。研究者据此打印或装配场景,让机器人执行插入,再在训练中未出现的布局、姿态、形状或组合上评估。论文建议使用约 0.05 mm 分辨率的树脂打印,以保证细小几何和公差设置能够被稳定实现。
实验结果
本文的主要产出是物理基准和生成工具,而不是某个机器人策略的性能排名。论文给出了清晰的能力覆盖:五种销钉几何、三档公差、四类可互锁底座,以及工件的八种安装方向;这些离散选项构成了可重复扩展的任务变化来源。与 NIST Assembly、ManipulationNet、FMB 和 EasyInsert 等代表性基准相比,Peg-in-Bench 同时支持高精度插入、公差变化、任务重构和装配任务,评估重点从单一动作转向任务泛化。
论文没有报告成功率、延迟、参数量或训练曲线,也没有宣称某种控制器优于基线,因此不能把上述组件数量误读为算法效果提升。公差实验可从 3 mm 逐级收紧到 0.1 mm,形成明确的精度压力梯度。它提供的证据是可变硬件、随机场景规范和可复现实验流程;未来研究者可以在不同泛化轴上固定训练集、改变测试集,并补充成功率、耗时、碰撞和轨迹等量化指标。
局限性与意义
当前版本刻意固定照明、摩擦系数和材料属性,因而更适合回答“任务配置变化是否造成性能下降”,不适合直接评价光照、材质或接触动力学变化下的感知与控制鲁棒性。固定底座还针对特定铝型材桌设计,迁移到其他实验室可能需要重新制作安装支架。此外,论文尚未提供完整的算法基线结果,多阶段任务的难度分级和评价协议仍有进一步标准化空间。
尽管如此,这项工作把机器人插入中的泛化问题拆成可操作的变量:位置与方向、形状与间隙、以及任务长度和组合方式。STL 文件和场景生成器公开后,研究者可以用同一套实体部件比较视觉伺服、力控和学习策略,也能通过重新组合底座快速构造未见任务。后续若加入多臂协作、更多安装环境和基线数据,Peg-in-Bench 有望成为连接实验室原型与可量化泛化评测的基础设施。
Links:
AM-Bench: A Modular Simulation Suite and Benchmark for Aerial Manipulation Policy Learning
Authors: Yutong Wang, Dongjae Lee, Xiaofeng Guo, Yuanzhu Zhan, Yufei Jiang, Bavin Saravanan, Muqing Cao, Jia Xie, Chenyang Mao, Sebastian Scherer, Junyi Geng, Guanya Shi
Published: 2026-09-01
Categories: cs.RO
Abstract:
Standardized benchmarks have played a central role in advancing robot manipulation learning, yet most focus on ground-supported manipulation systems, which limits their applicability to dynamics-critical domains such as aerial manipulation (AM). AM presents distinct system-level challenges, including environmental disturbances, coupled dynamics between the manipulator and floating base, and constrained degrees of freedom. Consequently, task performance depends jointly on robot embodiment, low-level control, and high-level policy design. We introduce AM-Bench, a modular simulation suite and benchmark for multirotor-based AM policy learning. AM-Bench includes representative embodiments spanning underactuated, fully actuated, and overactuated systems, 12 tasks across contact, transport, and constrained interaction, configurable aerodynamic disturbances and actuator saturation, standard low-level controllers, and baseline policy-learning algorithms. Unlike prior manipulation benchmarks that primarily emphasize end-to-end policy performance, AM-Bench enables system-level evaluation of how embodiment, control, disturbances, and policy choices interact. We demonstrate its diagnostic value through three simulation studies spanning high-level policies, policy--control interfaces, and embodiments, together with real-world validation of modeled effects and a hardware test of the learning pipeline.
论文解读
研究问题与动机
空中操作机器人需要同时解决飞行与接触操作:浮动基座和机械臂存在耦合,风、地面和墙面气动效应会改变受力,而有限自由度与旋翼推力上限又会让看似合理的末端动作无法执行。现有操作基准大多面向稳定的桌面或移动机器人,难以回答“策略、低层控制和机体形态究竟谁造成了失败”。AM-Bench 因而提出一个面向多旋翼空中操作策略学习的模块化仿真套件,目标是进行可重复的系统级比较,而不只是排列端到端成功率。
基准包含按按钮、插孔、框架装配、柜中取放、柠檬采摘、抛球、旋阀、推滑块、拉杆、开门、擦窗和无损检测等 12 个任务,覆盖瞬时接触、物体运输、铰接物体与受约束接触。墙面位置/姿态、材质、摩擦、物体位置和质量等可随机化,使研究者能够逐步增加难度,并在统一场景中比较策略和控制器。
核心方法
AM-Bench 将系统拆成任务环境、机器人平台、高层视觉策略接口、低层控制、物理扰动与执行器约束五个模块。平台包括欠驱动 UA-Quad/UA-Hexa、全驱动 FA-Hexa、过驱动 Omni-Hexa,以及用于理想末端能力对照的 EE-only 模型。策略可以读取末端和基座 RGB 相机、本体感知与关节状态,并输出低维的末端位姿加夹爪命令,或直接输出基座位姿和机械臂关节目标。
低层控制把末端目标通过非线性 IK 转成平滑且满足安全边界的全身配置,再由几何 PID 或 L1 自适应控制器跟踪;也可以用全身 MPC 联合优化基座 wrench 和关节参考。仿真先做控制分配并施加每旋翼 23 N 的推力上限,再模拟一阶执行器响应、地面效应、近墙效应、阻力和风,最后重构实际机体受力。这一链路让同一个视觉策略可以在不同机体和控制接口下接受诊断。
实验结果
高层策略实验在 FA-Hexa 上使用 12 个任务、每任务 80 个成功示范(总计 960 条),以 20 Hz 训练和评估,每种配置每任务 30 次 rollout。ACT、Diffusion Policy、π0 零样本和 π0.5 零样本的宏平均成功率分别为 26.94%、41.39%、8.61% 和 2.78%;多任务微调后 π0.5 达到 49.17%,再进行任务专门微调为 52.22%,说明适应 AM 领域比直接套用通用 VLA 更关键。π0.5 最终子任务完成率为 67.31%,但框架装配、旋阀、抛球等精细接触仍困难。
策略—控制接口也显著影响结果。Diffusion Policy 在按按钮任务中,末端目标配合 IK-PID、IK-L1、MPC 的成功率为 73.3%、83.3%、100%;推滑块任务为 63.3%、53.3%、83.3%,而直接输出基座和关节目标的 PID 只有 56.7% 和 0%。在推滑块任务中,FA-Hexa 的末端误差为 0.990×10^-2,UA-Quad 为 7.506×10^-2;相应旋翼饱和率为 39.52% 与 48.01%,表明全驱动平台可以减少通过倾斜换取横向运动的耦合。真实近地实验中加入地面效应后,末端高度仿真到现实 RMSE 从 1.91 降到 0.99 cm,降低 48%;实机识别的电机时间常数为 47.5 ms,高频垂直跟踪的基座 RMSE 由 1.96 增至 2.33 cm。
局限性与意义
该工作最重要的实践含义是:高层策略不应独自承担基座姿态、冗余解析和推力约束,末端目标加有能力的全身控制器更适合作为空中操作的通用接口;同时,平台形态本身必须作为实验变量报告。研究者可以先用 80 条示范建立策略,再固定策略切换机体、IK/PID/L1/MPC 和扰动模型,通过末端误差、基座误差、倾角及饱和率定位瓶颈。套件还在 FA-Hexa 上完成了柠檬采摘的实机示范收集、Diffusion Policy 训练与部署流程验证。
基准目前只覆盖单机器人、多旋翼和刚性机械臂,未涵盖协同吊载、连续体/柔性机械臂或软夹爪;实验主要是模仿学习与 VLA,尚未系统评估强化学习。降阶气动模型也没有完整描述电机—螺旋桨—ESC 动力学,跨任务、跨平台的全面 sim-to-real 验证仍待完成。因此,AM-Bench 更适合作为可诊断的研究基础设施,而不是宣称某种策略在所有真实空中操作场景中普遍最优。 它的价值在于把“能否完成”与“为何失败”分开:同一策略可在不同 embodiment、接口和扰动组合下复测,形成对算法改进有指导意义的误差剖面,也为后续强化学习、更多传感器和更高保真气动模型提供统一接入点。
Links: