跳转到内容
新建笔记

2025 年六维位姿论文选读:14 篇论文与输入条件

这份清单整理原笔记中的 14 篇 2025 年论文:CVPR 9 篇、ICCV 5 篇,为每篇补上官方会议入口和阅读重点。它是有明确范围的选读目录,不代表两场会议的全部六维位姿论文;年份固定为 2025,也不承担最新排名的作用。

六维位姿通常指旋转和三维平移,但相同任务名称下,已知条件可能差别很大。读摘要之前先确定:有无目标 CAD、参考图像是否带位姿、测试是否有深度、输出在哪个坐标系,以及训练到底用了哪些标签。

1. 先按已有条件选择阅读路线

跳转到“1. 先按已有条件选择阅读路线”
手头已有的信息或问题优先阅读首先核对的条件
参考覆盖不完整、希望减少对象建模工作UA-Pose、Any6D、One2Any参考图像数、深度、参考姿态及输出坐标系
有模型或可渲染模板,处理新对象Pos3R、RefPose、RayPose目标模板来源、基础模型及额外训练
已知类别、实例形状变化CAP-Net、Global Stereo Consistency、Joint Learning部件还是整物体、类别先验、尺寸和对称性
已知 CAD,希望减少真实位姿标注ONDA-Pose、EA6D真实域训练是否有标签、是否需要多视角
从参考集或视频同时获得形状和姿态iG-6DoF、6DOPE-GS离线重建或在线跟踪、初始化、时间连续性
带周期图案的微小运动精密测量2D-IpDFT成像模型、图案制作、工作范围和标定

这些路线按主要阅读问题分组,并非互斥的算法分类。缺少的输入不是通过更换模型名称就能自动补齐;例如只有一张普通 RGB 图像时,需要另外解释物体尺寸和度量平移从哪里得到。

1. UA-Pose: Uncertainty-Aware 6D Object Pose Estimation and Online Object Completion with Partial References

跳转到“1. UA-Pose: Uncertainty-Aware 6D Object Pose Estimation and Online Object Completion with Partial References”

研究参考信息不完整时的位姿估计与在线补全。论文讨论少量带位姿的 RGB-D 参考,或从单张二维图像生成初始形状两种入口。阅读时重点区分已观测区域与补全区域的可信程度;这些参考条件不能直接概括成一种固定的训练监督类型。 官方论文页

2. Any6D: Model-free 6D Pose Estimation of Novel Objects

跳转到“2. Any6D: Model-free 6D Pose Estimation of Novel Objects”

使用单张 RGB-D 锚点图像,为新场景中的未知物体建立参考,并在同样提供 RGB-D 的查询图像中估计位姿和尺寸。这里的 model-free 指不要求事先提供精确 CAD;系统仍可能构建对象表示,并使用已经训练的模型。锚点坐标系与人工给定的物体规范姿态也不是同一概念。 官方论文页

3. CAP-Net: A Unified Network for 6D Pose and Size Estimation of Categorical Articulated Parts from a Single RGB-D Image

跳转到“3. CAP-Net: A Unified Network for 6D Pose and Size Estimation of Categorical Articulated Parts from a Single RGB-D Image”

目标是可关节物体各个部件的类别级位姿与尺寸。它融合 RGB-D,预测部件类别、中心偏移和 NPCS,再将每个部件的规范坐标与点云配准。应把部件实例分离、部件局部坐标和整物体坐标分开记录;它不是只输出一个整物体刚体变换。 官方论文页

4. ONDA-Pose: Occlusion-Aware Neural Domain Adaptation for Self-Supervised 6D Object Pose Estimation

跳转到“4. ONDA-Pose: Occlusion-Aware Neural Domain Adaptation for Self-Supervised 6D Object Pose Estimation”

关注已知 CAD 条件下的真实域适应:通过 CARF、跨视图位姿细化和真实训练图像的伪标签学习,减少真实六维姿态标注需求。训练使用多视角信息,最终单张 RGB 推理;应分别记录这两个阶段的输入。概念解释见自监督学习笔记。 官方论文页

5. Pos3R: 6D Pose Estimation for Unseen Objects Made Easy

跳转到“5. Pos3R: 6D Pose Estimation for Unseen Objects Made Easy”

用三维重建基础模型 MASt3R 的特征支持模板匹配和几何配准。论文方法图明确先从 CAD 渲染模板,再通过对应点求位姿。因此,无需额外训练不等于不需要目标模型,也不表示基础模型从未经过训练。 官方论文页

6. One2Any: One-Reference 6D Pose Estimation for Any Object

跳转到“6. One2Any: One-Reference 6D Pose Estimation for Any Object”

以单张 RGB-D 参考描述对象,通过参考对象表示和参考坐标预测估计新视图相对于参考的位姿。阅读时先确定输出参考系,再核对参考端与查询端各自使用的模态;不能把“相对参考”结果直接当作任意 CAD 规范坐标中的绝对位姿。 官方论文页

7. RefPose: Leveraging Reference Geometric Correspondences for Accurate 6D Pose Estimation of Unseen Objects

跳转到“7. RefPose: Leveraging Reference Geometric Correspondences for Accurate 6D Pose Estimation of Unseen Objects”

把渲染参考的几何对应信息引入查询图像的位姿细化。重点是模板选择、几何对应估计和重复渲染比较的配合。“参考图像”在这里与模板渲染链有关,不能仅根据名称把它归到单张真实参考、无模型的方法中。 官方论文页

8. Leveraging Global Stereo Consistency for Category-Level Shape and 6D Pose Estimation from Stereo Images

跳转到“8. Leveraging Global Stereo Consistency for Category-Level Shape and 6D Pose Estimation from Stereo Images”

研究已知类别中的形状和位姿,使用经过标定且基线已知的双目图像。通过两视图共享的形状表示与全局一致性,约束姿态、深度和尺度的相互耦合。没有外置深度测量,不代表没有标定、尺度来源或类别先验。 官方论文页

9. iG-6DoF: Model-free 6DoF Pose Estimation for Unseen Object via Iterative 3D Gaussian Splatting

跳转到“9. iG-6DoF: Model-free 6DoF Pose Estimation for Unseen Object via Iterative 3D Gaussian Splatting”

从一组参考图像构建三维高斯表示,并通过初始匹配和反复渲染比较估计新视图位姿。适合与已有精确 CAD 的路线比较对象准备成本;同时应记录参考图像覆盖、重建质量与离线准备时间。 官方论文页

1. 6DOPE-GS: Online 6D Object Pose Estimation using Gaussian Splatting

跳转到“1. 6DOPE-GS: Online 6D Object Pose Estimation using Gaussian Splatting”

处理 RGB-D 视频中的在线位姿跟踪与对象重建,采用增量二维高斯表示和关键帧选择。它利用时间连续性,研究问题与孤立图像检测不同;论文的相对加速不能脱离对应基线、硬件和更新频率解释。 官方论文页

2. Environment-Agnostic Pose: Generating Environment-independent Object Representations for 6D Pose Estimation

跳转到“2. Environment-Agnostic Pose: Generating Environment-independent Object Representations for 6D Pose Estimation”

方法名为 EA6D,利用扩散模型学习尽量减弱环境影响的对象表示,再用于位姿估计。论文强调仅用合成数据训练。应把这一点记为合成域带监督训练的条件,而不能因为没有真实训练标签就自动归为自监督。 官方论文页

3. Ultra-Precision 6DoF Pose Estimation Using 2-D Interpolated Discrete Fourier Transform

跳转到“3. Ultra-Precision 6DoF Pose Estimation Using 2-D Interpolated Discrete Fourier Transform”

面向周期图案和正交或近似正交成像的精密计量,通过频率与相位联系六自由度运动。它与普通物体的杂乱场景位姿估计具有不同成像条件、工作范围和目标图案,不能把其纳米级实验直接与 BOP 对象定位精度排名混在一起。 官方论文 PDF

4. RayPose: Ray Bundling Diffusion for Template Views in Unseen 6D Object Pose Estimation

跳转到“4. RayPose: Ray Bundling Diffusion for Template Views in Unseen 6D Object Pose Estimation”

将已有位姿模板与查询图像的对齐改写为射线相关的估计,并通过扩散模型预测位姿。适合关注模板未完全匹配时的几何推断;输入中的已知模板姿态是明确先验,不应省略。 官方论文页

5. Joint Learning of Pose Regression and Denoising Diffusion with Score Scaling Sampling for Category-level 6D Pose Estimation

跳转到“5. Joint Learning of Pose Regression and Denoising Diffusion with Score Scaling Sampling for Category-level 6D Pose Estimation”

从分割后的深度点云估计已知类别中新实例的位姿分布。训练结合直接姿态回归与扩散去噪,推理采用随时间变化的分数缩放。这里既有真值位姿监督,也有生成式采样;使用扩散模型本身不等于自监督学习。 官方论文页

4. 比较论文时记录同一组信息

跳转到“4. 比较论文时记录同一组信息”
项目需要写清楚的内容
任务范围已见实例、未见实例、已知类别、未知类别,或连续视频跟踪
训练资源合成带标签数据、真实姿态标签、无标签真实数据、预训练模型
测试资源RGB / RGB-D / 双目、多视角数量、CAD、参考图像及其姿态
几何约定物体到相机或相反方向、参考坐标原点、长度单位和尺度来源
评价协议数据划分、真值框或实际检测、对称性、指标与阈值
运行成本对象准备、重建、网络推理、细化、检测的时间是否都计算在内

同一个 ADD-S 百分数,若使用不同检测输入、对象集合或测试划分,就不一定可直接比较。单帧推理时间也不能直接和包含重建的在线系统总时间排列成统一速度榜。

“未见对象”“无 CAD”“无需额外训练”“自监督”描述的是不同轴:一个系统可以无需新对象专门训练,但仍依赖目标 CAD;也可以测试不需要 CAD,却依赖带标签数据预训练的组件。

5. 与本库的方法笔记衔接

跳转到“5. 与本库的方法笔记衔接”

从基础几何开始,可先读 NOCS 的规范坐标与尺度,再对比 FFB6D 的关键点配准和 G2L-Net 的局部点云表示。

研究 RGB 输入时,可结合 杂乱场景的关键点与 PnP、DGECN;研究多视角的几何约束和渲染搜索时,可读 CenDerNet。监督方式的讨论集中在自监督学习。

会议归属和题名于 2026-10-03 按官方论文集核对。上面的短注基于论文摘要及必要的方法、输入说明,作为选读入口;不表示已对 14 篇完成模型复现或逐篇全文评审。