# Paper Shelf 内容核验记录

核验日期：2026-09-12。范围：原有 11 篇 + 两篇文章重点介绍的 17 篇 = 28 篇。

## 核验口径

- 逐条读取 arXiv 的正式标题、完整作者列表、首发日期和原始摘要；中文摘要据此重写。
- 对 Flow Matching 理论、OmniXtreme 训练细节，以及存在疑点的原始仓库和项目页，补读论文 HTML、作者说明与代码 README。
- 这是来源核验与内容整理，不是 28 篇论文的逐式证明复查或实验复现。文章中找不到一手依据的数字、宣传性评价及跨论文归因不保留。
- 论文作者报告的结果不等于独立复现结论；不同基准、数据量、硬件和成功率定义不能直接横向排名。
- `year` / `publishedAt` 统一采用 arXiv 首发口径，不混用会议年份、修订年份与收录月份。BibTeX 统一生成 arXiv 版本，引用正式会议版本时应另取相应引用。
- 原有 11 篇的 `addedAt` 均写成 2025 年 1 月，多条早于论文公开。原值保存在 `legacyAddedAt`，不用于归档；真实历史收录日未知，新添的 17 篇记录 2026-09-12。

## 原有内容的重点修正

| 条目 | 修正 |
| --- | --- |
| LightNav-0 | arXiv 有正式记录，不可仅凭编号或仓库简介推测真伪；作者改为正式作者列表。256K–1M 是像素预算，不是视觉 token 数。 |
| SOLO | 重写查询式重建和时间信用分配；只保留来源可支持的通过率与 1.5 公里实机路线，移除赛事描述。纠正作者顺序。 |
| Kimodo | 明确为运动学动作生成。官方 CLI 有后处理，不能声称完全不需要；G1 为 Unitree，不是天工。去除星数及随意的下游归因。 |
| HIL | 正式 arXiv 标题为 *Hybrid Imitation Learning of Diverse Parkour Skills from Videos*，首发 2025-05-19；记录备注为待发表于 TOG / SIGGRAPH 2027。不能写成 2026 年已正式出版，也不能把仿真角色当作实机验证。 |
| UMR | 保留稠密表面对应、约束优化和接触迁移；去除未经验证的浏览器训练步骤及不通顺描述。区分运动学映射和物理可执行性。 |
| Flow Matching | Theorem 2 的等价关系是 CFM 与 FM（相差参数无关常数、梯度相同），不是 FM 与最大似然等价。首发为 2022 年；不把所有后续生成系统归入该方法。 |
| Diffusion Policy | 保留条件扩散、动作序列及滚动时域；删除 ALOHA、BAKU 和几乎全部机器人策略均由此派生的泛化。46.9% 提升不写成 46.9 个百分点。 |
| Any2Track | 正式标题为 *Track Any Motions under Any Disturbances*；移除“4B 参数”。40/40 来自 OpenTrack 2026-05-18 的后续发布，区分版本与成功率口径。 |
| OmniXtreme | 补上官方项目页引出的代码链接；明确流匹配预训练、残差精炼和执行器约束，不把功率正则当作硬件安全保证。 |
| ViBe | 参数高效微调不等于完全不训练；原文为四类任务。原 GitHub 地址返回 404，作者项目页标注 Code Coming Soon，移除失效按钮。 |
| OpenWAM | 保留模块化研究框架、约 6400 小时预训练和 8 个仿真基准；把“每项均 SOTA”改为作者报告的整体领先梯队。 |

## 新增论文及检索线索

第一篇文章：[Levine 团队研究盘点](https://www.bilibili.com/opus/1247000319431278595)。7 项重点工作全部收录；不将课程推广和顺带提及的基础模型扩充为新增论文。

| 名称 | 一手论文 | 所属方向 |
| --- | --- | --- |
| Steerable Policies | [2602.13193](https://arxiv.org/abs/2602.13193) | 语义引导与组合 |
| AsyncVLA: Fast and Robust Navigation on the Edge | [2602.13476](https://arxiv.org/abs/2602.13476) | 部署与在线学习 |
| Why Does Action Chunking Improve Behavioral Cloning Performance in Robotic Control? | [2608.02547](https://arxiv.org/abs/2608.02547) | 生成与策略基础 |
| Flow Reversal Steering | [2606.13675](https://arxiv.org/abs/2606.13675) | 语义引导与组合 |
| Success Visitation Matching | [2606.23640](https://arxiv.org/abs/2606.23640) | 部署与在线学习 |
| Semantic Action Reinforcement Learning | [2606.31958](https://arxiv.org/abs/2606.31958) | 语义引导与组合 |
| ARLI: Learning to Act While Waiting | [2608.23831](https://arxiv.org/abs/2608.23831) | 部署与在线学习 |

AsyncVLA 存在同名论文：此处不是 *Asynchronous Flow Matching for Vision-Language-Action Models*（2511.14148）。

第二篇文章：[世界动作模型研究梳理](https://www.bilibili.com/opus/1246629204181647368)。10 项重点工作全部收录。研究素材来自某团队，不代表每篇都具有相同作者、归属或发表年份，元数据逐篇以 arXiv 为准。

| 名称 | 一手论文 | 研究侧重 |
| --- | --- | --- |
| UD-VLA | [2511.01718](https://arxiv.org/abs/2511.01718) | 离散联合去噪 |
| FRAPPE | [2602.17259](https://arxiv.org/abs/2602.17259) | 多教师未来表征 |
| MMaDA-VLA | [2603.25406](https://arxiv.org/abs/2603.25406) | 原生多模态扩散 |
| HiF-VLA | [2512.09928](https://arxiv.org/abs/2512.09928) | 运动历史与未来 |
| S-VAM | [2603.16195](https://arxiv.org/abs/2603.16195) | 单步几何语义蒸馏 |
| Robust-WAM | [2608.05903](https://arxiv.org/abs/2608.05903) | 外观扰动鲁棒性 |
| PSG-JEPA | [2608.06799](https://arxiv.org/abs/2608.06799) | 物理状态监督 |
| 4D-WAM: Trajectory Fields | [2608.08023](https://arxiv.org/abs/2608.08023) | 三维轨迹场 |
| MobileWAM | [2608.04657](https://arxiv.org/abs/2608.04657) | 移动操作及训练期未来 |
| DreamTrajectory | [2608.01381](https://arxiv.org/abs/2608.01381) | 测试时动作后果筛选 |

4D-WAM 也存在同名论文：此处不是自动驾驶的 *4D Consistent World Modeling for Autonomous Driving*（2608.10107）。UD-VLA 和 HiF-VLA 首发在 2025 年，不能因综述标题含 2026 而改为 2026 年首发。

## 六类目录

| 分类 | 数量 | 收录 |
| --- | --- | --- |
| 生成与策略基础 | 3 | Flow Matching、Diffusion Policy、Action Chunking |
| 动作生成与本体 | 5 | Kimodo、HIL、UMR、Any2Track、OmniXtreme |
| 感知与具身控制 | 3 | LightNav-0、SOLO、ViBe |
| 世界动作模型 | 11 | OpenWAM 与第二篇文章的 10 项研究 |
| 语义引导与组合 | 3 | Steerable Policies、FRS、SARL |
| 部署与在线学习 | 3 | AsyncVLA、SVM、ARLI |

分类是便于阅读的主要归属，不表示论文只能属于一个研究方向；标签和交叉关联表达其他侧面。

## 能否打通完整链路

可以组织为三条**研究与工程候选路线**，不能声称已经有一套把全部方法接起来、经实机验证的完整系统。

1. **动作到具身执行**：动作生成 → 本体重定向 → 物理跟踪 → 感知适配。导航是并行的高层规划分支，而不是低层跟踪器的下游。需对齐骨架、坐标、帧率、接触、动作空间和动力学约束。
2. **世界表征到决策**：联合生成、未来表示、物理监督、移动操作与后果筛选是不同设计维度。尤其要区分训练期的未来监督与测试期实际预测未来，不能简单叠加所有专家和损失。
3. **基础策略到在线闭环**：行为先验 → 可引导接口 → 实时执行 → 过程奖励 → 延迟感知学习。FRS 要求流策略，SARL 优化语义接口，AsyncVLA 与 ARLI 的已验证任务不同，组合仍需实验。

页面把关系标成“方法基础”“对照阅读”“候选组合”，每项提供两篇原文入口以及解释。没有证据的直接继承、代码复用和已验证组合不作声明。

## 原有条目的来源索引

- [LightNav-0](https://arxiv.org/abs/2608.30935) / [代码及像素预算说明](https://github.com/lightorigins/LightNav-0)
- [SOLO](https://arxiv.org/abs/2608.26583) / [项目页](https://sunpihai-up.github.io/solo/)
- [Kimodo](https://arxiv.org/abs/2603.15546) / [项目页](https://research.nvidia.com/labs/sil/projects/kimodo/) / [代码与后处理](https://github.com/nv-tlabs/kimodo)
- [HIL](https://arxiv.org/abs/2505.12619) / [项目页](https://jiashunwang.github.io/HIL/)
- [UMR](https://arxiv.org/abs/2609.02134) / [代码](https://github.com/hanyang9/UMR)
- [Flow Matching](https://arxiv.org/abs/2210.02747) / [Theorem 2](https://arxiv.org/html/2210.02747v2#Thmtheorem2)
- [Diffusion Policy，v4](https://arxiv.org/abs/2303.04137v4) / [项目页](https://diffusion-policy.cs.columbia.edu/)
- [Any2Track](https://arxiv.org/abs/2509.13833) / [OpenTrack 发布记录](https://github.com/GalaxyGeneralRobotics/OpenTrack)
- [OmniXtreme](https://arxiv.org/abs/2602.23843) / [原文方法](https://arxiv.org/html/2602.23843v1) / [项目页](https://extreme-humanoid.github.io/)
- [ViBe](https://arxiv.org/abs/2609.09918) / [项目页及代码待发布状态](https://lok-i.github.io/vibe-control/)
- [OpenWAM](https://arxiv.org/abs/2609.07398) / [代码](https://github.com/OpenWAM-Official/OpenWAM)

## 图示与归属

- `assets/vibe-approach.png`：ViBe 作者项目页的模型架构图，未修改；来源页注明 CC BY-SA 4.0。页面保留作者原图入口。
- `assets/kimodo-architecture.png`：NVIDIA Kimodo 作者项目页的架构图，未修改，用于该论文的学术说明，权利归原作者；不声称具有项目整体的再许可。
- Lucide 图标遵循随附的 ISC 许可证，见 `assets/LUCIDE-LICENSE`。

所有核验是 2026-09-12 的一次性检查，不表示持续监控链接或后续版本。
