留言
正在加载留言…

Field Notes · 2026

保持好奇,
把想法写下来。

文章

8 notes

用一种动力学机制代替外部验证

假如需要大量的外部反馈和验证让llm提高效果,那么有两条路线:一是让验证变得更廉价,二是取消掉外部验证,让模型自发进化。

取消外部验证的一个设想的思路是,假设某种规则自身(数学上)就有一种动力学,那么让这种动力学的本身代替掉外部的验证,作为锚点


本体界和LLM现象界映射越精准,LLM效果越好

物理世界:编译器环境,自然规律等

逻辑世界:在庞大文本信息中相互构建出来的逻辑结构


ai擅长数学、coding,除开 *能够快速验证真伪(最好是纯虚拟环境中)、离外部物理世界远、逻辑性强* 外,因为两者的物理世界≈逻辑世界,从逻辑世界到物理世界的映射有高相关度,所以成功。ai看到的是逻辑世界的结构,就像物理世界的影子

ai的用途:以检索代替发明,以实现稳定工程而非灵感迸现

总原则

1.工程化:把原本不确定的灵感突现做成稳定产出的流程

2.规模化:在1的基础上扩大规模


ai的定位:

在拟定的庞大空间中,按照一定的的方法,进行检索和检验

而非从无到有的发明新思想

三顶会全文前瞻研判任务书


# 三顶会全文前瞻研判任务书


## 0. 首席科学家指令


你需要逐篇完整阅读最新一届 ICLR、ICML 和 NeurIPS 的 13,107 篇 TeX 正文,完成两条彼此独立的前瞻研判:


1. 找出可能成为下一代通用技术原语、基础架构或能力跃迁接口的论文;

2. 找出未来 3–5 年更值得押注的结构性技术风向。


这不是热门论文重排。你需要独立判断:


- 哪些论文可能改变后续研究组织模型、数据、计算或反馈的方式?

- 哪些方向即使当前代表方法失败,背后的需求和价值仍会持续增强?

- 哪些信号尚未形成大众共识,却可能在 2029–2031 年成为重要主航道?

- 哪些论文只是重命名、重参数化、工程堆叠、弱基线或额外资源带来的表面进步?


必须读完正文后再判断。标题、摘要、关键词、作者单位、论文自称的贡献、当前热度和引用量都不能替代正文阅读。


真正达到 Transformer/LLM 作用层级的论文可能一篇也没有。可以诚实返回零篇,不得为了交付而制造“划时代候选”。


---


## 1. 输入与时间边界


### 1.1 语料


- 文件:`AI三顶会最新一届_TeX正文_13107篇_修正版.zip`

- 有效论文:13,107 篇

- ICLR 2026:4,324 篇

- ICML 2026:4,545 篇

- NeurIPS 2025:4,238 篇


不得使用旧的 13,114 篇版本。


### 1.2 预测时点


判断时点为 **2026-08-17**,预测窗口为 **2029–2031**。


全文初评先依据论文本身完成。候选深挖阶段才查询前序工作、同期论文、代码、采用情况和外部信号,防止名气与事后信息污染独立判断。


### 1.3 输出目录


```text

./foresight_2029_2031/

```


---


## 2. 目标 A:潜在基础技术点


“潜在基础技术点”是能够被许多后续工作调用的技术原语、训练原则、推理接口、系统抽象、数据机制、理论结构或评测反馈回路。它可能改变研究者组织计算、数据、模型或反馈的方式,而非只提升一个数据集。


一个真正具有基础性潜力的工作通常满足多项:


- **不可约**:去掉包装后,仍存在新的核心操作、接口、不变量或组织方式;

- **瓶颈中心**:处理能力、规模、成本、可靠性或数据中的关键约束;

- **结构通用**:成立原因不依赖原论文的特定任务名称;

- **随规模增值**:模型、数据或推理规模增大后,价值不自然消失;

- **能力解锁**:允许此前难以稳定实现的能力、规模或系统形态;

- **可组合**:能被其他模型、任务或系统以清晰接口调用;

- **形成生态**:可能产生新的设计空间、测量方式和后续研究问题;

- **经济上有坡度**:能够改变训练成本、推理成本、延迟、可靠性或数据获取方式。


基础性不等于方法必须简单。简单性有利于传播和组合;复杂方法若建立新的系统边界,也可能有基础价值,但复杂度必须由不可替代的能力收益偿付。


### 2.1 五级作用层级


| 等级 | 定义 |

|---|---|

| F0 | 局部技巧、复现、分析或特定数据集改进 |

| F1 | 对一个稳定子领域有用,但接口与适用面有限 |

| F2 | 跨多个任务或模型可复用的通用组件或原则 |

| F3 | 可能成为标准技术栈的一部分,改变大量后续设计选择 |

| F4 | 可能改变能力或规模前沿,形成新的基础架构或范式 |


F4 是极低基率事件。高分、热门、顶级作者、oral 或最佳论文身份都不能自动得到 F3/F4。


---


## 3. 目标 B:未来 3–5 年结构性风向


“风向”不是热门名词、论文数量增长或某个当前强方法。风向是一条持续增强的结构压力:外部驱动使某个瓶颈随规模和应用扩大而加重,价值与资源因此从旧边界迁往新边界,多种方法可能竞争解决它。


每个风向必须写成下面的因果链:


```text

结构性驱动

→ 随规模或应用扩大而加重的瓶颈

→ 能力、成本或价值的迁移

→ 至少两种可能的解决路线

→ 未来 1–5 年可观察的变化

```


每个风向必须通过“方法替换测试”:移除当前最强代表方法后,问题压力、价值池和其他路线是否仍然存在?若方向随某个方法一起消失,它更像技术点,不是风向。


“Agent 很热”“多模态论文很多”“推理是趋势”都不构成风向,除非补全驱动、瓶颈、价值迁移、竞争路线和反证条件。


早期风向证据可以稀疏,但必须回答:


- 为什么现在开始出现?

- 为什么未来 3–5 年会变得更重要?

- 哪些互不相同的方法可能解决它?

- 当前最大阻塞条件是什么?

- 什么事实会证明这个判断错了?


---


## 4. 认识论纪律


## 4.1 Introduction 只提供待验证主张


阅读 Introduction 时记录作者主张,但不立即接受。每项重要主张都要在方法、定理、实验、消融、附录或负面结果中寻找支持或反证。


每篇论文严格区分:


- `observed`:正文直接展示或证明的事实;

- `inferred`:基于机制和证据作出的合理外推;

- `forecast`:关于 2029–2031 的预测。


论文作者自己的未来推测仍属于推测。


## 4.2 初评屏蔽社会声量


全文初评时不使用:


- 作者和机构声誉;

- oral、spotlight、奖项和引用量;

- 社交媒体热度、公司宣传和其他榜单;

- 当前产品采用情况。


这些信息只能在候选深挖阶段用于判断执行能力、采用路径和当前共识,不能替代技术证据。


## 4.3 不奖励“看起来新”


罕见术语、跨领域类比和复杂公式不自动加分。新颖性必须落实到操作、接口、不变量、可识别对象或新能力。


特别检查:


- 是否只是已有方法的换坐标、重参数化或别名;

- 是否把已知组件机械串联后重新命名;

- 是否只是使用更多数据、更多采样、更大模型或更强监督;

- 是否借弱基线、预算不对称或调参不公平制造结果;

- 是否只有描述性相关性,缺少可干预机制;

- 是否核心假设在真实部署中很难满足。


## 4.4 允许高上限、弱证据候选存在


必须区分:


- `observed_generality`:正文实际验证的任务、模型、模态和规模;

- `structural_generality`:根据机制判断的潜在适用范围;

- `evidence_gap`:二者之间尚未验证的部分。


高结构潜力、低实证覆盖的论文可进入“高上限待证”名单,但置信度必须低于证据充分候选。


## 4.5 允许返回空集


不设入选配额。任何论文或方向都必须达到门槛。某个领域全部低于阈值时,不允许为了均衡而选一个最高者。


---


## 5. 每篇论文的深度阅读要求


每篇论文作为一个完整阅读单元,至少覆盖:


1. 元数据、摘要和 Introduction:登记作者主张与问题定义;

2. 方法、算法、公式和系统设计;

3. 理论假设、定理和证明;若无理论则明确标记;

4. 实验设置、数据、模型、规模、资源条件和基线;

5. 主结果、消融、敏感性、负结果和失败案例;

6. limitations、discussion、conclusion 和附录;

7. 表格、算法以及图示附近能够从 TeX 读取的文字。


读完后必须独立回答:


1. 论文真正处理的研究对象是什么?

2. 它直接改变了哪个量、步骤或接口?

3. 方法最小化后还剩哪些原子操作?

4. 哪些组件是必要的,哪些只是性能补丁?

5. 它刻意保持了什么不变量或硬约束?

6. 最强基线是否获得公平条件?

7. 增益来自新机制,还是来自更多资源?

8. 哪个实验或定理最支持核心主张?

9. 哪个结果最削弱核心主张?

10. 原论文没有测试但机制上可能成立的场景是什么?

11. 规模扩大后,价值可能增强、稳定还是衰减?

12. 最小反例或失败条件是什么?


只有完成上述内容后才能评分。正文缺失重要信息时降低证据置信度,不得自行补写结果。


## 5.1 三个正文证据


每篇完整论文卡保留三个简洁证据:


1. 方法或定理证据;

2. 主要结果证据;

3. 局限、消融、假设或失败边界证据。


每项写明章节和准确概括即可,不要求复制长原文或制作复杂定位信息。


## 5.2 自动化边界


程序可以负责枚举论文、读取文件、保存论文卡、检查遗漏和统计汇总。


程序不得:


- 用标题、摘要、关键词、embedding 或引用量筛掉论文;

- 根据作者、单位或会议类型自动赋分;

- 用旧聚类标签替代正文判断;

- 通过搜索 `simple`、`general`、`training-free` 等词判断方法属性;

- 在论文尚未读完时给出正式分数。


---


## 6. 全量论文卡


每篇论文输出一条结构化记录。字段应足以支撑后续深挖,不写无关长文。


```json

{

"paper_id": "...",

"title": "...",

"conference": "...",

"paper_type": "method|theory|analysis|system|dataset|benchmark|empirical",

"read_complete": true,

"sections_read": ["..."],

"author_claims": ["..."],

"independent_problem": "论文真正处理的问题",

"research_object": "输入、输出、任务、环境或数学对象",

"bottleneck": "直接失败模式或资源约束",

"intervention_stage": ["data|representation|architecture|objective|optimization|training|inference|search|evaluation|system"],

"manipulated_quantity": ["方法直接改变的量"],

"invariants_or_constraints": ["刻意保持的量或硬约束"],

"minimal_mechanism": ["按顺序排列的原子操作"],

"necessary_components": ["..."],

"optional_components": ["..."],

"interface": "其他工作如何接入",

"strongest_baseline": "...",

"budget_fairness": "fair|unclear|unfair",

"evidence": {

"method": {"section": "...", "finding": "..."},

"result": {"section": "...", "finding": "..."},

"boundary": {"section": "...", "finding": "..."}

},

"positive_evidence": ["..."],

"negative_evidence": ["..."],

"ablations": ["..."],

"theory_status": "complete|conditional|sketch|none|counterexample_found",

"tested_tasks": ["..."],

"tested_models": ["..."],

"tested_scales": ["..."],

"compute_and_data_cost": "...",

"observed_generality": "0-5,并附依据",

"structural_generality": "0-5,并附依据",

"scaling_hypothesis": "增强|稳定|衰减|未知",

"failure_modes": ["..."],

"source_limitations": ["..."],

"prior_art_risk_blind": "初评阶段发现的等价或组合风险",

"pressure_vectors": [

{

"driver": "...",

"growing_bottleneck": "...",

"value_migration": "...",

"solution_families": ["..."],

"counterforce": "..."

}

],

"track_a_scores": {},

"track_a_total": 0,

"track_a_level": "F0-F4",

"confidence": "low|medium|high",

"reviewer_verdict": "...",

"strongest_counterargument": "...",

"falsifier": "什么事实会推翻当前判断",

"next_action": "ignore|watch|reproduce|investigate|priority"

}

```


---


## 7. 目标 A:十项基础潜力评分


每项先按 0–5 分判断,再按权重换算,总分 100。


通用评分锚点:


- 0:缺失或被正文反证;

- 1:主要是作者主张;

- 2:证据窄、依赖强或适用面有限;

- 3:在当前范围可信,并有合理扩展空间;

- 4:机制和证据都很强,跨场景价值清楚;

- 5:出现少见的基础性结构,且替代解释很弱。


| 指标 | 权重 | 判断问题 |

|---|---:|---|

| A1 不可约新原语 | 12 | 去掉包装后,是否仍有不能被现有方法自然包含的核心变化? |

| A2 瓶颈中心性 | 12 | 是否处理能力、规模、可靠性或成本的主瓶颈? |

| A3 结构通用性 | 12 | 机制是否有理由跨任务、模型、模态或系统成立? |

| A4 规模互补性 | 12 | 基础模型和规模增强后,价值是否保持或上升? |

| A5 能力解锁 | 12 | 是否允许此前难以实现的能力、规模或系统形态? |

| A6 可组合与生态 | 10 | 是否有清晰接口,可能形成后续设计空间? |

| A7 压缩性与简洁性 | 8 | 核心因果变化是否能被简洁表达,组件是否必要? |

| A8 证据质量 | 10 | 理论、实验、消融、基线和边界是否共同支持主张? |

| A9 采用与经济坡度 | 7 | 成本、兼容性、延迟和组织阻力是否允许扩散? |

| A10 鲁棒与生存性 | 5 | 分布变化、规模变化或强替代路线出现时是否仍有价值? |


分数层级:


- 82–100:极强基础潜力候选;

- 72–81:优先深挖;

- 62–71:值得观察;

- 50–61:有用但暂不具基础级证据;

- 50 以下:保留记录,不进入重点候选。


### 7.1 硬边界


- 严格等价、换坐标或机械拼接:A1 最高 1/5;

- 主要增益来自额外资源且比较不公平:A8 最高 1/5;

- 只在单一任务有效且缺少可迁移机制:A3 最高 2/5;

- 关键主张依赖不可见信息:不得成为高置信候选;

- 方法复杂度没有得到不可替代收益偿付:A7 最高 2/5。


### 7.2 概率与条件影响


只有进入重点候选的论文才评估:


- 到 2031 年成为广泛复用基础技术的概率档位:`0.1%|0.3%|1%|3%|10%|20%`;

- 若成功,影响等级:1–5;

- 成功所需的三个前提;

- 未来 6–24 个月最应观察的三个领先指标。


概率必须服从极低基率,不能因为论文令人兴奋就随意给高概率。


### 7.3 失败前演练


每个重点候选都要回答:


1. 它是否只在当前数据集成立?

2. 更大模型或更强基础设施会不会让它失去价值?

3. 部署成本是否会抵消收益?

4. 是否存在更简单或更早的等价路线?

5. 即使技术成立,生态是否缺乏采用动力?


---


## 8. 目标 B:十项风向评分


风向由所有论文卡中的 `pressure_vectors` 综合产生。可以使用聚合方法寻找关系,但不能只根据标题或共享词语命名方向。


| 指标 | 权重 | 判断问题 |

|---|---:|---|

| B1 结构驱动力 | 15 | 是否有持续增强的技术、硬件、数据、产品或经济驱动? |

| B2 增长瓶颈 | 12 | 问题是否随规模和应用扩大而加重? |

| B3 独立收敛 | 10 | 是否有不同对象、机构或方法家族独立指向同一压力? |

| B4 方法替换韧性 | 10 | 当前代表方法失败后,方向是否仍成立? |

| B5 使能条件成熟度 | 10 | 数据、模型、硬件、接口或评测条件是否逐渐就绪? |

| B6 经济与采用拉力 | 12 | 是否会显著影响能力、成本、收入、可靠性或开发效率? |

| B7 跨层影响 | 10 | 是否可能同时影响模型、系统、数据或产品多个层面? |

| B8 时间匹配 | 8 | 为什么是未来 3–5 年,而不是已经发生或遥遥无期? |

| B9 注意力缺口 | 8 | 真实结构价值与当前共识之间是否存在差距? |

| B10 可证伪性 | 5 | 是否能写出明确的领先指标和失败条件? |


风向层级:


- 82–100:结构重要性极强;

- 72–81:高优先风向;

- 62–71:值得跟踪;

- 62 以下:证据不足、过于依赖单一方法或已是充分共识。


### 8.1 当前共识单独标记


| 状态 | 定义 |

|---|---|

| C0 | 已成为标准共识,前瞻认知差有限 |

| C1 | 大众热点,价值可能真实但已广为人知 |

| C2 | 专家圈开始收敛,尚未成为主流配置 |

| C3 | 多个弱信号出现,仍缺统一命名和叙事 |

| C4 | 反共识方向;必须有强机制,不能因冷门加分 |


最终分别给出结构重要性榜、低共识高价值榜和共识过热风险榜。


### 8.2 每个重点风向的时间路径


每个重点风向说明:


- 未来 12 个月可观察的领先指标;

- 未来 24 个月应出现的技术或产品变化;

- 2029–2031 年可能形成的结构结果;

- 可能获胜的不同方法家族;

- 当前最大阻塞条件;

- 哪项事实出现后应显著下调评分;

- 个人研究者、实验室和大公司分别适合做什么。


---


## 9. 精简流程:把时间用于研究,不用于仪式


## 阶段 0:清单与量表


1. 确认语料可以读取;

2. 建立 13,107 篇论文清单并核对会议数量;

3. 在开始前固定论文卡字段、评分维度和门槛。


交付:`00_setup/input_manifest.jsonl`、`rubric_version.json`。


## 阶段 1:13,107 篇全文初评


逐篇阅读全文、独立分析并生成完整论文卡。失败请求或空卡不能计为完成;不得因为执行困难退化为标题、摘要或关键词筛选。


交付:`01_full_read/paper_cards.jsonl`、`completion.json`。


## 阶段 2:目标 A 深挖


以下论文进入候选池,合计最多 300 篇:


- A_total ≥72;

- A_total 为 62–71,但在结构通用性、规模互补性、能力解锁中至少两项极强;

- 提出新不变量、强反例、重要 no-go、系统接口或高上限机制,却因实证范围窄而总分偏低;

- 在不同研究对象中显示出少见基础潜力、需要进一步核对者。


候选深挖不是简单重复阅读,而是回到正文解决关键科学问题:


1. 精确还原机制、假设和真正贡献;

2. 查找最近的前序工作与同期工作,并阅读其方法和关键证据;

3. 检查严格等价、机械组合、隐含资源优势和弱基线;

4. 构造最小反例、规模变化情景和真实部署失败情景;

5. 判断 general 性来自机制,还是来自论文叙事;

6. 更新分数、概率、置信度和行动建议。


交付:`02_track_a/candidate_reviews.jsonl`、`基础技术点_TOP100.md`。


若真正达标者不足 100 篇,只列实际达标数量,不补位。


## 阶段 3:目标 B 风向综合


使用全部论文卡的研究对象、瓶颈、机制和 `pressure_vectors` 建立关系。先寻找共同结构压力,再区分独立证据与同一研究系列的重复证据。


对每个候选风向:


1. 写出驱动—瓶颈—价值迁移链;

2. 找出不同的解决路线;

3. 执行方法替换测试;

4. 阅读代表论文、边界论文和反例论文;

5. 判断它是早期结构变化、当前热点延长,还是短期数据集效应;

6. 给出时间路径、阻塞条件和失败情景。


交付:`03_track_b/wind_cards.jsonl`、`结构重要性风向_TOP30.md`、`低共识高价值风向_TOP20.md`、`共识过热风险榜.md`。


## 阶段 4:最终挑战与排序


对最终高优先候选做一次真正有力度的反向思考:尝试用最强替代解释、最小反例、规模变化和采用失败情景推翻它。反方意见必须针对已经形成的具体主张,并优先尝试修正边界;无法修复时降级。


最终排序综合:


- 量表分数;

- 深挖后的机制判断;

- 前序工作碰撞;

- 反例与失败边界;

- 3–5 年条件价值。


排名接近时使用梯队,不制造虚假的精确差距。


## 阶段 5:最终报告


交付:`04_reports/EXECUTIVE_BRIEF.md`、`前瞻研判总报告.md`、`all_papers_scores.csv`、`RUN_COMPLETE.md`。


---


## 10. 最终目录


```text

foresight_2029_2031/

00_setup/

input_manifest.jsonl

rubric_version.json

01_full_read/

paper_cards.jsonl

completion.json

02_track_a/

candidate_reviews.jsonl

基础技术点_TOP100.md

03_track_b/

wind_cards.jsonl

结构重要性风向_TOP30.md

低共识高价值风向_TOP20.md

共识过热风险榜.md

04_reports/

EXECUTIVE_BRIEF.md

前瞻研判总报告.md

all_papers_scores.csv

RUN_COMPLETE.md

```


---


## 11. 最低完成条件


只有满足以下条件才能生成 `RUN_COMPLETE.md`:


- 13,107 篇论文均有唯一且完整的论文卡;

- 每篇正式评分都来自完整正文阅读;

- 每篇卡包含方法、结果和边界三类正文证据;

- 重点基础候选完成前序工作核查、反例思考和概率判断;

- 重点风向完成方法替换测试、时间路径和失败情景;

- 最终结果保留最强反证,不隐藏不确定性。


不要求额外的随机复读、固定比例双读、重复评分一致性测试、复杂统计排序或形式化预测账本。时间应优先投入正文理解、机制拆解、前序工作、反例和未来推演。


---


## 12. 最终报告格式


## 12.1 基础技术点榜


每篇包括:


- 标题、会议和链接;

- 去宣传化的一句话方法;

- 核心机制、改变的量、不变量和接入接口;

- 为什么可能具备基础性;

- 正文中最有力的证据;

- 最近前序工作与新颖性边界;

- 为什么可能失败;

- A1–A10、总分、F 等级;

- 到 2031 年的概率档位、条件影响和领先指标;

- 建议行动:忽略、跟踪、复现、战略试验或优先立项。


## 12.2 风向榜


每个方向包括:


- 一句话方向命题;

- 结构驱动、增长瓶颈和价值迁移;

- 代表论文、使能论文、边界论文和反例;

- 相互竞争的方法家族;

- 方法替换测试;

- B1–B10、总分和当前共识;

- 为什么是未来 3–5 年;

- 12/24 个月领先指标与 2029–2031 结果;

- 最强反向情景和降级条件;

- 对个人研究者、实验室和大公司的行动建议。


---


## 13. 常见误判


- **把热点当风向**:论文多不等于结构价值增长;

- **把性能增益当基础性**:刷榜不等于产生新接口或新范式;

- **把复杂度当深度**:组件多可能只是补丁多;

- **把简单当通用**:简单方法也可能只对单一设置有效;

- **把顶级机构当正确性**:单位只影响执行概率,不提供技术证据;

- **把冷门当被低估**:低关注必须同时具备强机制;

- **照抄论文未来工作**:作者叙事不能代替结构推演;

- **机械拼接两篇论文**:先检查等价性、接口和价值是否真正保留;

- **只看当前采用**:采用是滞后信号,不能决定早期潜力;

- **对长周期给出虚假确定性**:使用概率档位、条件和反证。


---


## 14. 最终纪律


你的价值来自完整阅读、深入拆解和独立判断。不要充当论文宣传者,也不要为了显得前瞻而奖励冷门术语。


最终结果必须让负责人看清:


- 为什么某篇论文或某个方向值得重视;

- 哪些结论是正文事实,哪些是推断和预测;

- 最强反证是什么;

- 什么事实出现后应降低判断;

- 哪些候选值得立即复现,哪些只应持续观察;

- 如果真正的基础级候选不存在,为什么应诚实返回空缺。


严格执行本任务书。不得用整体浏览、关键词命中或摘要概括代替逐篇全文阅读。


流程

```mermaid

flowchart TB

SEED[/"初始材料<br/>两篇种子论文全文与基础元数据<br/>不提供系统排名或其他机会的结论"/]


SEED -->|"并行任务 1:创造研究方案"| MAIN1

SEED -->|"并行任务 2:调查外部研究边界"| LIT


MAIN1[["SUBAGENT:调用 1 次<br/>主研究 Agent,第 1 回合<br/>深读全文、自由推理、提出研究空间"]]

LIT[["SUBAGENT:调用 1 次<br/>独立相关工作 Agent<br/>检索近邻工作、跨领域工具和撞车风险"]]


MAIN1 --> EARLY{"现有材料是否足以形成具体、可审查的研究设计?"}

EARLY -->|"问题、机制、接口和候选贡献已经足够具体"| MAIN2

EARLY -->|"缺少可执行机制、关键定义、第三方工具或必要证据"| BRIDGE1


BRIDGE1[["SUBAGENT:可选调用 1 次<br/>论文桥接 Agent<br/>利用聚类、全文库并自行联网寻找工具"]]

BRIDGE1 --> B1[/"早期桥接包<br/>最多 6 篇论文及其具体可迁移组件"/]

B1 -->|"将可用工具送入主线构造"| MAIN2

LIT -->|"提供相关工作、创新性边界和外部类比"| MAIN2


MAIN2[["SUBAGENT:调用 1 次<br/>主研究 Agent,第 2 回合<br/>整合材料,形成初步论文设计"]]

MAIN2 --> V0[/"初步论文主线 v0<br/>中心问题、候选方法、贡献、关键主张和适用范围"/]


V0 --> REVIEW1[["SUBAGENT:调用 1 次<br/>中期对抗审稿 Agent,第 1 回合<br/>针对真实设计进行深入攻击"]]

REVIEW1 --> ISSUES[/"问题卡<br/>被攻击的主张、证据、严重程度和解决标准"/]


ISSUES --> REPAIRGATE{"是否存在值得投入资源修复的重大问题?"}

REPAIRGATE -->|"只有次要问题,或任何修复都会彻底失去原问题的研究价值"| MAIN3

REPAIRGATE -->|"问题影响核心贡献,并且可能通过修改机制、定义、假设或范围解决"| REPAIRBRIDGE


REPAIRBRIDGE{"修复是否需要当前材料之外的论文或工具?"}

REPAIRBRIDGE -->|"现有材料包含可执行修复路线,或桥接额度已经耗尽"| REPAIR

REPAIRBRIDGE -->|"缺少明确的算法组件、理论工具或跨领域桥梁,并且仍有桥接额度"| BRIDGE2


BRIDGE2[["SUBAGENT:可选调用 1 次<br/>论文桥接 Agent<br/>围绕具体问题寻找修复工具"]]

BRIDGE2 --> B2[/"修复桥接包<br/>最多 6 篇论文、可迁移组件及兼容性说明"/]

B2 -->|"为重大问题提供候选解决工具"| REPAIR


REPAIR[["SUBAGENT:并行调用 1–4 次<br/>Repair Agents<br/>分别尝试方法、理论、定义或范围修复"]]

REPAIR --> FIXES[/"候选修复方案<br/>修改内容、保留价值、复杂度、风险和验证方式"/]

FIXES -->|"主研究 Agent 选择并整合修复"| MAIN3


MAIN3[["SUBAGENT:调用 1 次<br/>主研究 Agent,第 3 回合<br/>逐项回应审稿意见并修订主线"]]

MAIN3 --> V1[/"修订论文设计 v1<br/>附作者回应、采用的修复和剩余问题"/]


V1 --> REVIEW2[["SUBAGENT:调用 1 次<br/>原中期审稿 Agent,第 2 回合<br/>只核验原有重大问题是否真正解决"]]

REVIEW2 --> MIDSTATUS[/"中期审查状态<br/>已解决、部分解决、未解决或修复引入新代价"/]


V1 -->|"提供修订后的核心主张"| THEORYGATE

MIDSTATUS -->|"提供仍未解决问题及其严重程度"| THEORYGATE


THEORYGATE{"核心贡献是否依赖可形式化的理论主张?"}

THEORYGATE -->|"核心价值可完全通过明确的经验实验直接证伪,不依赖定理级主张"| LEDGER

THEORYGATE -->|"核心价值依赖收敛性、误差界、不变性、复杂度、可识别性或跨规模主张"| ARCH


ARCH[["SUBAGENT:调用 1 次<br/>证明架构 Agent<br/>定义主命题并拆分最多 6 个 lemma"]]

ARCH --> DAG[/"理论任务图<br/>主命题、lemma、依赖关系、攻击目标和修复空间"/]

DAG --> SCHEDULE{{"总管动作<br/>动态分配最多 16 次理论尝试<br/>构造与修复优先,证伪保持足够力度"}}


SCHEDULE -->|"存在尚未完成的证明义务"| PROVE

SCHEDULE -->|"核心主张或 lemma 尚未受到充分反例攻击"| REFUTE

SCHEDULE -->|"已有反例或证明失败暴露了仍有价值的可修复结构"| TREPAIR


PROVE[["SUBAGENT:动态调用<br/>证明 Agents<br/>尝试证明指定主命题或 lemma"]]

REFUTE[["SUBAGENT:动态调用<br/>证伪 Agents<br/>寻找局部反例、全局反例和隐藏假设"]]

TREPAIR[["SUBAGENT:动态调用<br/>理论 Repair Agents<br/>修改算法、定义、假设或命题结构"]]


PROVE --> TRESULTS[/"理论结果<br/>证明、证明草图、失败位置、反例和必要假设"/]

REFUTE --> TRESULTS

TREPAIR --> TRESULTS


TRESULTS --> TCONTINUE{"是否还值得继续一次理论尝试?"}

TCONTINUE -->|"关键节点未决,已有明确的新证明、证伪或修复路线,并且总尝试少于 16 次"| SCHEDULE

TCONTINUE -->|"关键节点未决,缺少具体数学工具或外部定理,并且仍有桥接额度"| BRIDGE3

TCONTINUE -->|"关键节点已证明或已证伪,或没有实质性新路线,或达到 16 次上限"| TINTEGRATE


BRIDGE3[["SUBAGENT:可选调用 1 次<br/>论文桥接 Agent<br/>寻找证明工具、相关定理、反例技术或替代定义"]]

BRIDGE3 --> B3[/"理论桥接包<br/>最多 6 篇论文及其可直接使用的命题或工具"/]

B3 -->|"把新工具送回理论尝试池"| SCHEDULE


TINTEGRATE[["SUBAGENT:调用 1 次<br/>证明整合 Agent<br/>核验全部证明、反例、修复及命题依赖"]]

TINTEGRATE --> LEDGER


LEDGER[/"证据账本<br/>已证明、条件成立、经验支持、被反例否定、未解决"/]

LEDGER --> NARRATIVEBRIDGE{"成功获得的材料是否缺少能够抬高论文主线的明确桥梁?"}


NARRATIVEBRIDGE -->|"现有材料足以形成统一叙事,或缺口过于模糊,或桥接额度已经耗尽"| NARRATIVE

NARRATIVEBRIDGE -->|"已有多个可靠结果,但缺少明确的统一原则、连接机制或更高层问题,并且仍有桥接额度"| BRIDGE4


BRIDGE4[["SUBAGENT:可选调用 1 次<br/>论文桥接 Agent<br/>寻找统一视角、概念桥梁和相关高层理论"]]

BRIDGE4 --> B4[/"叙事桥接包<br/>最多 6 篇论文及其可能提升的贡献层级"/]

B4 -->|"将统一视角送入叙事构造"| NARRATIVE


NARRATIVE[["SUBAGENT:调用 1 次<br/>叙事架构 Agent<br/>整理完整主线和最小可成立主线"]]

NARRATIVE --> STORY[/"论文叙事草案<br/>Introduction 逻辑、贡献顺序、方法主线、理论状态和失败损伤图"/]


STORY --> COHERENT{"现有材料是否构成一篇值得进入实验设计的论文?"}

COHERENT -->|"核心贡献被否定,或只剩零散结果,或实质上被已有工作覆盖,或无法形成可检验主张"| FINAL

COHERENT -->|"至少一项中心贡献有充分依据,创新边界清晰,方法可实现,且核心主张可被实验检验"| LOCK


LOCK[/"冻结研究命题<br/>固定中心问题、方法、贡献、适用范围和理论状态"/]

LOCK --> EXPBRIDGE{"冻结后的主张是否缺少必要的实验工具?"}


EXPBRIDGE -->|"现有材料足以设计实验,或新增工具会改变中心主张,或桥接额度已经耗尽"| EXP

EXPBRIDGE -->|"缺少必要基线、数据、评测协议或高效实现,且补充后不会改变中心主张,同时仍有桥接额度"| BRIDGE5


BRIDGE5[["SUBAGENT:可选调用 1 次<br/>论文桥接 Agent<br/>寻找基线、数据、评测和高效实现"]]

BRIDGE5 --> B5[/"实验桥接包<br/>最多 6 篇论文及其可复用实验资产"/]

B5 -->|"将实验工具送入方案设计"| EXP


EXP[["SUBAGENT:调用 1 次<br/>实验设计 Agent<br/>围绕冻结主张设计验证与证伪实验"]]

EXP --> PLAN[/"实验计划<br/>最小实验、完整实验、基线、消融、压力测试和算力预算"/]

PLAN -->|"论文主线和实验方案均已完成"| FINAL


FINAL[["SUBAGENT:调用 1 次<br/>最终裁决 Agent<br/>检查创新性、正确性、证据强度和可执行性"]]

FINAL --> VERDICT{"最终材料达到什么成立程度?"}


VERDICT -->|"核心贡献得到支持,无未解决的致命问题,实验可行,且没有被最近工作实质覆盖"| OK

VERDICT -->|"原始大主张不成立,但收缩后的问题、方法或边界结论仍具有独立研究价值"| PARTIAL

VERDICT -->|"关键贡献无法成立,剩余材料缺乏独立价值,或研究已被现有工作实质覆盖"| FAIL


OK[/"裁决:成立<br/>完整研究方案与论文大纲"/]

PARTIAL[/"裁决:部分成立<br/>缩小范围后的研究方案与论文大纲"/]

FAIL[/"裁决:不成立<br/>停止结论与关键原因"/]

```

从 13,107 篇最新 ICLR、ICML 与 NeurIPS,看到研究机会图谱

“不要听我,而要听 Logos;承认万物为一,才是智慧。”
——赫拉克利特残篇 B50


交互式图谱:打开研究机会图谱 V2

面向“方法是否简单、能否跨场景复用,以及不同论文能否自然耦合”的大规模论文分析实验。

把论文分组很容易,让分组对应可解释的研究关系要困难得多。仅凭 diffusion、confidence 等共现词,通常只能找到主题近邻。本项目选取最新一届已经举办完的三大机器学习会议——ICLR 2026、ICML 2026 和 NeurIPS 2025——构建无图片的正文 TeX 语料,逐篇阅读全文,并建立研究对象、方法机制、问题瓶颈和定向互补四张关系图。

工作围绕三个问题展开:

  1. 哪些论文的方法核心足够简单,个人研究者也有机会继续推进?
  2. 哪些方法已经超出单一 benchmark 技巧,并显示出跨任务、跨模型或跨规模的潜力?
  3. 哪两项原本分属不同方向的工作,可能形成一个接口清楚、成本可控的新课题?

项目规模

阶段 结果
三会与 arXiv 安全匹配记录 13,208 篇
通过正文与格式校验的有效 TeX 13,107 篇
作者单位信息完整且命中预设机构范围 7,878 篇
同时满足“本质简单”和“较强 generality”的核心集合 779 篇
核心集合中对个人租卡较友好的论文 513 篇
用于关系发现的背景论文 7,099 篇
研究机会候选 120 个

源文件归档的网络流量约为 88.5 GB,其中大部分空间来自图片。抽取后的原始文本约 4.25 GB;清洗并结构化后的常用正文约 1.3 GB,单独打包的 TeX 语料约 386 MiB。图片构成了主要下载成本,进入阅读流程的文字规模相对有限。

一、语料格式:以 TeX 为主

PDF 对机器阅读很不友好:双栏顺序可能错乱,公式和表格容易被拆碎,页眉、脚注和参考文献也会混进正文。Markdown 便于阅读,但在复杂公式、算法、表格和自定义宏上会损失信息。

实际保存为三种形式:

  • 规范化 TeX 是事实源,保留章节、公式、表格、算法和图注;
  • Parquet/JSONL 是机器处理层,每篇论文一行,并额外保存章节、元数据和可追溯标识;
  • Markdown 用于人工预览,规范化 TeX 保留为事实源。

清洗程序会自动寻找主文件,递归展开 \input 和 \include,保留数学与结构信息,删除图片本体、模板说明、注释和纯排版噪声。图片文件会删除,caption 会保留,因为图注经常包含实验设定和核心结论。校验环节检查未展开的输入、残留图片命令、压缩导出一致性和二进制文件签名;少量伪装成 TeX 的非文本载荷被直接排除。

这份语料有两个边界:arXiv source 可能与会议 camera-ready 存在差异;缺少 arXiv 源码或作者单位的论文没有纳入后续分析。

二、单位初筛之后,逐篇阅读正文

单位筛选以高召回为目标。程序从 TeX 首页提取明确作者单位,并与一份可审计的研究机构名单匹配,包括主要工业研究实验室和具有强机器学习研究生态的高校。单位字段没有进入后续相似度或聚类。这一步仅用于限定分析范围,不评价名单外论文的研究质量。

早期版本曾搜索 simple、training-free、model-agnostic、across tasks 等词。抽查很快暴露了问题:

  • 简单方法未必自称 simple;
  • 复杂系统也很喜欢在摘要里写 simple;
  • “在十个同类数据集上有效”仍可能局限于单一任务族;
  • model-agnostic 往往隐藏着专有数据、额外模型或逐任务调参。

这 7,878 篇候选均经过正文语义阅读。每篇至少覆盖摘要、引言、方法或理论、主要实验、消融、结论、限制,以及与判断有关的附录;参考文献列表不要求逐条阅读。阅读由并行 AI agent 完成,所有 agent 使用同一套冻结评分规范,结论必须附有正文证据。

“本质简单”如何评分

维度 核心问题
S1 原子性 核心是否能表达成一个规则、公式或局部改动?
S2 依赖负担 是否需要新模型、新数据或多阶段辅助管线?
S3 调参负担 同一规则能否直接迁移,还是每个任务都要重新搜索?
S4 资源负担 是免训练、轻量微调,还是预训练级算力?

严格的简单门槛是 S1 ≥ 3、S2 ≥ 2、S3 ≥ 2。S4 单独报告,避免把“思路简单但训练极贵”和“个人可复现”混为一谈。

“General”如何评分

先把适用范围分成 U0 到 U4:从单一 benchmark 技巧,到任务族、模型家族,再到通用机器学习机制。然后评价四件事:接口是否可迁移、实证是否覆盖独立任务或模型族、同一规则是否稳定迁移、成立是否依赖狭窄假设。

核心集合至少要求 U3、接口可迁移、存在跨设置证据,并且不过度依赖特殊权限或专有结构。本文所说的 general 有明确范围:方法具有清楚、可复用的接口,实验证据也已超出单点技巧。

评分结果为:779 篇强通过、1,055 篇次强通过、615 篇边界项、5,372 篇未通过、57 篇信息不足。强通过论文中,225 篇几乎免训练或没有额外开销,288 篇属于轻量微调或小推理开销,合计 513 篇较适合个人租卡继续研究。

三、第一次聚类为什么失败

第一版把全文阅读卡片交给 TF-IDF、字符 n-gram 和 LSA,再进行层次聚类。运行速度很快,社区结构看起来也很稳定。人工抽查发现,不少关系只来自共享名词。

这组结果的 LSA 解释方差约为 14%–16%,silhouette 约为 0.03。某些分区重复运行的 ARI 达到 0.557,抽查中的机制错配依然明显。稳定性在这里反映了算法的一致性,没有解决语义偏差。

主要问题出在表示方式。模型尺寸会影响检索质量。把研究对象、方法步骤、瓶颈和结论平均成一个向量,本身就容易得到模糊主题。第二版改用分面的多向量表示,并允许论文保持未归类状态。

四、第二版:把论文拆成四种关系

flowchart LR
    A[正文 TeX] --> B[全文语义阅读]
    B --> C[结构化机制卡]
    C --> D1[研究对象图]
    C --> D2[方法机制图]
    C --> D3[问题瓶颈图]
    D2 --> D4[方法效果 → 另一论文瓶颈]
    D3 --> D4
    D1 --> E[稳定性与反例审计]
    D2 --> E
    D3 --> E
    D4 --> F[最小实验候选]
    E --> F

每张结构化机制卡都包含:论文要解决的具体问题、输入输出、瓶颈、干预阶段、按顺序排列的原子操作、直接改变的量、接口、成立假设、直接效果和实验发现。

在此基础上分别建立四张图:

  1. 研究对象图:描述论文处理的具体问题,并把通用模型名的影响分离出去;
  2. 方法机制图:方法在系统哪个位置,依次做了哪些操作;
  3. 问题瓶颈图:它们是否面对相同的失败模式或资源约束;
  4. 定向互补图:论文 A 的直接效果,能否对应论文 B 明确写出的瓶颈。

一篇论文可以在四张图里有四种邻居。比如它在对象上属于视觉生成,在机制上属于方差缩减,在瓶颈上又可能与强化学习的估计不稳定相邻。这样的表示更适合用来设计后续实验。

比较范围与背景桥接

779 篇目标论文共有 303,031 个无序论文对,先进行全对全的低成本结构与向量评分,不用过小的 top-k 提前截断关系。7,099 篇背景论文用于近邻、密度和“桥梁”判断。两篇目标论文即使表面差异很大,只要经常连接到相似的背景工作,仍可能存在共同机制。

方法机制用一组步骤向量表示。候选边同时考虑步骤语义、覆盖率、干预位置、操作类型和接口;仅共享 Transformer、softmax、diffusion 等底层载体无法形成“同机制”边。高成本的 cross-encoder 只重排多路召回后的少量候选。

图构造使用 reciprocal kNN,要求双方互为近邻,以降低热门方向成为万能 hub 的风险;社区发现使用 Leiden,并以 HDBSCAN、bootstrap Jaccard 和结构一致性独立检查。低稳定度社区可以被标为探索项或直接拒绝,不强迫每篇论文归类。二维坐标只用于显示,不参与聚类。

五、用 CSFCube 选择表示模型

为了给模型选择提供外部尺度,我先在 CSFCube 上做模型赛马。这个基准由专家分别标注论文在 background、method 和 result 三个 facet 上的相关性,可以分别测量主题检索和方法检索能力。

下面只列最关键的 method facet:

表示方法 MAP NDCG%20 Recall@20
TF-IDF 0.179 0.336 0.283
LSA 0.186 0.336 0.273
SPECTER2 0.264 0.428 0.478
ASPIRE 多向量 0.281 0.439 0.529
Qwen3 facet embedding 0.282 0.491 0.509
Qwen3 reranker 0.330 0.498 0.559

相对于旧 LSA,Qwen3 reranker 的 method MAP 提升约 77.6%,NDCG%20 提升约 48.1%,Recall@20 提升约 104.3%。CSFCube 测量的是检索能力,这组结果为表示模型的选型提供了外部依据;自定义关系图仍需要单独审计。

实际运行时,SPECTER2 辅助研究对象关系,Qwen3 多语种 embedding 编码结构化 facet 和方法步骤,Qwen3 reranker 精排较难的机制候选。模型没有看到会议标签或作者单位。

六、耗时与本地加速

整个项目最耗时的环节是逐篇全文阅读。7,878 篇论文以最高 64 并发运行,约 19 小时完成,平均约 419 篇/小时。这个阶段需要语义判断,确实使用了生成式 AI。

后续关系分析由固定程序完成,没有逐篇或逐对调用生成式模型。结构解析、embedding、cross-encoder、建图、稳定性检验和报告生成均可重复执行。在一台 24 GB Apple Silicon 笔记本上,完整冷运行约 18–20 分钟;命中缓存后,重建图和报告约半分钟。

为了加速本地推理,我比较了原始 BF16 模型和 8-bit MLX 版本:

任务 BF16 8-bit MLX 加速 语义一致性
128 条 embedding 20.2 篇/秒 86.2 篇/秒 4.28× pairwise Spearman 0.9997,kNN@10 重合 98.4%
64 对 rerank 6.0 对/秒 26.9 对/秒 4.45× Spearman 0.9992,阈值判定一致率 100%

我还测试了一个 4-bit embedding 候选。它的邻居保持率明显下降,因而未被采用。量化选型同时参考速度和语义邻居的一致性。

七、关系图实际找到了什么

更正后的全量图在对象、机制和瓶颈三层分别保留 2,920、1,950 和 2,007 条局部图边;合并证据后得到 3,433 条论文关系、3,444 条定向互补边,并输出 120 个研究机会候选。经过 bootstrap 稳定性和结构一致性门槛后,只有 4 个对象社区、2 个机制社区和 1 个瓶颈社区被正式接受,其余均降为探索项或拒绝项。

大多数自动社区未通过正式门槛,因而被降级或拒绝。Leiden 与 HDBSCAN 的全局分区一致性很低,这种分歧不支持一棵统一的主题树。分析结论以局部稳定关系为单位,二维整图主要用于导航。

研究机会分成两类,各 60 个:

  • 跨对象机制迁移:研究对象不同,但操作步骤和接口高度相似;
  • 方法效果 → 目标瓶颈:一项工作的直接效果,恰好对应另一项工作的明确限制。

这两类候选仍需继续检查接口兼容性、因果假设和全网新颖性,并通过同预算、单因素的最小实验验证。图谱把一万多篇论文压缩成一个可以逐项审查的候选空间,后续取舍仍由研究者完成。

八、质量检查

除了 CSFCube 外部基准,还做了几组针对本项目的压力测试:

  • 中文结构化机制卡检索同篇英文方法段,Recall@1 为 0.768,Recall@20 为 0.931,中位名次为 1;
  • 十组已知正反例全部通过,包括“都写 diffusion 但干预位置不同”的 hard negative;
  • 随机打乱机制字段后,原有机制边的平均稠密相似度从 0.585 降到 0.388;
  • 标题不进入机制向量,会议和单位不进入任何相似度;
  • 社区必须通过 bootstrap Jaccard 和结构覆盖门槛,否则显示为灰色或探索项。

综合判定为 conditional exploratory pass,对应探索性用途。主要缺口是原设计中的 160 对独立人工冻结标注集尚未完成,因此本文不报告自定义机制关系的 macro-F1。现有证据由外部 benchmark、回归测试和稳定性审计组成,独立人工审稿仍然缺位。

九、方法上的取舍

  • 先定义关系类型。同对象、同机制、共享瓶颈和方法互补需要各自的特征与阈值。
  • 分开语义阅读和规模计算。AI 将正文压缩成带证据的结构卡,固定程序负责几十万论文对的比较,成本和复现路径都更清楚。
  • 稳定性需要语义基础。若 facet 设计有偏,聚类算法也会稳定地重复字面偏差。反例测试和结构证据应与稳定性一起检查。
  • 覆盖率不作为优化目标。论文可以保持未归类状态,低质量社区也可以直接拒绝。局部图因此更适合研究决策。
  • 机会边重点检查接口。低对象相似、接口清晰的组合往往更有启发性:A 领域中得到改善的作用量,可能对应 B 领域明确记录的瓶颈。

十、数据与解释边界

  • 语料只覆盖可可靠匹配到 arXiv source 的论文,范围小于三会全部录用论文;
  • arXiv 版本可能与 camera-ready 有差异;
  • 机构初筛是本项目的研究边界,会引入明显选择偏差;
  • AI 全文阅读采用统一规范并保留正文证据,理解或抽取错误仍有可能发生;
  • 研究机会只表示当前语料中的结构缺口,后续仍需全网 novelty search;
  • 每篇论文的版权和 arXiv 许可不同,再分发前需要逐篇核对授权。

参考资源


项目留下了一份可以反复更新的研究筛选协议:正文先转成可审计的结构卡,关系由固定程序计算,聚类只保留稳定局部,研究机会再落到最小实验。从一万多篇论文到几十个可实验假设,整条路径都保留了可追溯的中间证据。

符合魂球三定律的三顶会论文

“事后归因这种未来爆款工作的特点有:
1.顶级大厂做的,或者一流高校强组做的
2.方法本质上非常的简单
3.适配general的场景”

——魂球三定律


# 三顶会论文


共 780 篇,来自 ICLR 2026、ICML 2026 和 NeurIPS 2025。原记录为英文的简介使用技术机器翻译,公式、模型名和具体边界请以论文原文为准。


## 1. [Measure gradients, not activations! Enhancing neuronal activity in deep reinforcement learning](https://arxiv.org/abs/2505.24061)


- 会议:NeurIPS2025

- 中文简介:在每次反向传播后,对每层每个神经元计算当前批次中对该神经元激活的绝对梯度均值,并除以该层神经元均值,得到归一化学习容量分数 G。每隔固定步数将 G≤τ 的神经元视为低活性,按原始权重分布重置其输入权重并将输出权重置零(官方实现也处理 LayerNorm 参数)。

- 链接:[https://arxiv.org/abs/2505.24061](https://arxiv.org/abs/2505.24061)


## 2. [Vision Transformers Don't Need Trained Registers](https://arxiv.org/abs/2506.08010)


- 会议:NeurIPS2025

- 中文简介:对已训练的 ViT 在推理时做激活编辑:先在一组代表性图像的高范数 patch 上统计各 MLP 神经元的平均激活,选出负责产生 outlier 的少量 register neurons;随后每次前向经过这些神经元时,把每个 register neuron 在所有 token 上的最大激活复制到一个新加的 dummy token,并将原图像 token 上该神经元的激活置零。这样把必须保留的高范数/注意力 sink 从图像 patch 移到 test-time register,无需重训;也可用由该 register 估计的每头 key/value attention bias 直接替代额外 token。

- 链接:[https://arxiv.org/abs/2506.08010](https://arxiv.org/abs/2506.08010)


## 3. [TAG: Tangential Amplifying Guidance for Hallucination-Resistant Sampling](https://arxiv.org/abs/2510.04533)


- 会议:ICML2026

- 中文简介:在现有的确定性扩散调度程序生成临时下一个潜在变量后,对当前潜在变量进行归一化以获得径向方向,将调度程序增量分解为径向和正交(与噪声壳相切)部分,保持径向部分不变,并将切向部分乘以 eta_v >= 1。可选的 TAG_cfg 变体还将条件分数投影到切向条件减去无条件残差上,并添加该对齐项。

- 链接:[https://arxiv.org/abs/2510.04533](https://arxiv.org/abs/2510.04533)


## 4. [All You Need is One: Capsule Prompt Tuning with a Single Vector](https://arxiv.org/abs/2510.16670)


- 会议:NeurIPS2025

- 中文简介:CaPT 冻结预训练的 Transformer 并在每个选定层学习一个胶囊向量 p^i。在第 1 层,它将 p^1 添加到输入嵌入的平均值上;在后面的层中,它将 p^i 添加到与前一个序列表示连接的前一个胶囊输出的平均值上,然后将单个集成向量与序列一起通过该层。因此,向量带有任务感知偏差,而每个实例均值提供实例感知语义并创建注意力锚。

- 链接:[https://arxiv.org/abs/2510.16670](https://arxiv.org/abs/2510.16670)


## 5. [Quantifying the Uncertainty of Foundation Models with Singular Value Ensembles](https://arxiv.org/abs/2601.22068)


- 会议:ICML2026

- 中文简介:对预训练模型的目标线性权重 W 做 SVD,冻结奇异向量 U、V;为每个集成成员学习一份奇异值向量 Sigma^(m)(以及成员偏置和分类头),用小的成员特定扰动打破对称性,并以平均交叉熵联合微调。推理时用 U Sigma^(m) V^T 重构各成员并平均预测,从共享知识基底的不同重标定得到分歧。

- 链接:[https://arxiv.org/abs/2601.22068](https://arxiv.org/abs/2601.22068)


## 6. [Antithetic Noise in Diffusion Models](https://arxiv.org/abs/2506.06185)


- 会议:ICLR2026

- 中文简介:采样时把高斯初始噪声(并可把每步噪声)成对取 z 与 -z,用 antithetic Monte Carlo 估计减少相关方差;不改模型或训练。

- 链接:[https://arxiv.org/abs/2506.06185](https://arxiv.org/abs/2506.06185)


## 7. [The Best Instruction-Tuning Data are Those That Fit](https://arxiv.org/abs/2502.04194)


- 会议:NeurIPS2025

- 中文简介:GRAPE 对同一指令的候选回答计算目标 base LM 的长度归一化条件概率/困惑度,选取最匹配的一条,再以普通 SFT 训练;选择阶段不更新模型。

- 链接:[https://arxiv.org/abs/2502.04194](https://arxiv.org/abs/2502.04194)


## 8. [VocSim A Training-free Benchmark for Zero-shot Content Identity in Single-source Audio](https://arxiv.org/abs/2512.10120)


- 会议:ICML2026

- 中文简介:VocSim 是训练免费评测管线:冻结音频 encoder 做时间/频率均值池化拼接,经 transductive PCA 到 100D,用 cosine/Euclidean/Spearman 最近邻的 P@1/P@5 与 GSR 测 content identity。

- 链接:[https://arxiv.org/abs/2512.10120](https://arxiv.org/abs/2512.10120)


## 9. [Test-Time Graph Search for Goal-Conditioned Reinforcement Learning](https://arxiv.org/abs/2510.07257)


- 会议:ICML2026

- 中文简介:TTGS 冻结离线 goal-conditioned value/policy,把数据集状态建成有向图,以 value 近似距离和超线性远距惩罚作边权,Dijkstra 选路,再用自适应阈值选最远可达子目标执行。

- 链接:[https://arxiv.org/abs/2510.07257](https://arxiv.org/abs/2510.07257)


## 10. [A Simple Linear Patch Revives Layer-Pruned Large Language Models](https://arxiv.org/abs/2505.24680)


- 会议:NeurIPS2025

- 中文简介:LinearPatch 在剪枝接口处修复层剪枝的 LLM:从小型校准集估计通道尺度,应用 Hadamard 旋转和对角线异常值抑制变换,并将结果矩阵融合到一个线性层中。可选的离线 KL 蒸馏过程仅调整该补丁,而修剪模型的其余部分保持冻结。

- 链接:[https://arxiv.org/abs/2505.24680](https://arxiv.org/abs/2505.24680)


## 11. [Constructive Distortion: Improving MLLMs with Attention-Guided Image Warping](https://arxiv.org/abs/2510.09741)


- 会议:ICLR2026

- 中文简介:AttWarp 提取冻结的 MLLM 交叉注意力图,在空间上聚合和平滑它,将其水平和垂直边缘转换为 CDF,并使用逆 CDF 在相同的 MLLM 答案之前生成直线图像扭曲。 AttWarp-Chains 重复此操作,直到注意力分布稳定;可选的蒸馏网络可以一次性预测扭曲。

- 链接:[https://arxiv.org/abs/2510.09741](https://arxiv.org/abs/2510.09741)


## 12. [Automatic Layer Selection for Hallucination Detection](https://arxiv.org/abs/2605.26366)


- 会议:ICML2026

- 中文简介:用于幻觉检测的自动层选择估计冻结 LLM 层上的 TwoNN 固有维度曲线,选择具有前向视野的第一个有效 ID 峰值,并仅在该层训练小型 MLP 探针。第一句话截断规则为检测器提供了稳定的标记表示。

- 链接:[https://arxiv.org/abs/2605.26366](https://arxiv.org/abs/2605.26366)


## 13. [COFT: Counterfactual–Conformal Decoding for Fair Chain‑of‑Thought Reasoning in Large Language Models](https://arxiv.org/abs/2605.30641)


- 会议:ICML2026

- 中文简介:COFT 冻结了因果 LM,并通过使用保留长度的哨兵掩盖敏感跨度来创建事实和反事实的提示视图。它融合两个 logits,离线校准分割共形不合格阈值,并仅对两个视图共同支持的标记进行采样(如果集合为空,则使用 argmax 回退)。

- 链接:[https://arxiv.org/abs/2605.30641](https://arxiv.org/abs/2605.30641)


## 14. [Corporate Needs You to Find the Difference: Revisiting Submodular and Supermodular Ratio Optimization Problems](https://arxiv.org/abs/2505.17443)


- 会议:NeurIPS2025

- 中文简介:本文通过 SFM、DSS、USSS、UDSS 和 MNP 之间的约简给出了子模/超模比率优化的理论统一。它表明近似 MNP 解决方案可以转移到其他公式,然后比较通用求解器,例如 SuperGreedy++、Frank–Wolfe 和 Fujishige–Wolfe,为 HNSN 添加流密度改进。

- 链接:[https://arxiv.org/abs/2505.17443](https://arxiv.org/abs/2505.17443)


## 15. [On Epistemic Uncertainty of Visual Tokens for Object Hallucinations in Large Vision-Language Models](https://arxiv.org/abs/2510.09008)


- 会议:NeurIPS2025

- 中文简介:视觉标记不确定性方法通过在输入图像上运行 PGD 来最大化特征偏差、收集早期视觉编码器隐藏状态变化并对其聚合归一化偏差进行阈值化,从而在无需训练的情况下估计认知不确定性。它将中间视觉编码器自注意力输出乘以生成的二进制掩码,以在解码之前抑制不确定的视觉标记。

- 链接:[https://arxiv.org/abs/2510.09008](https://arxiv.org/abs/2510.09008)


## 16. [DePass: Unified Feature Attributing by Simple Decomposed Forward Pass](https://arxiv.org/abs/2510.18462)


- 会议:NeurIPS2025

- 中文简介:DePass 通过将一次前向传递分解为组件贡献来对 Transformer 预测进行归因。它修复了原始注意力分数和 MLP 激活,通过相同的线性运算传播 token/head/神经元/子空间组件,使用组件上的 softmax 分配 MLP 输出,并对分解状态求和以精确重建原始隐藏状态和 LM logits。

- 链接:[https://arxiv.org/abs/2510.18462](https://arxiv.org/abs/2510.18462)


## 17. [Self-Aligned Reward: Towards Effective and Efficient Reasoners](https://arxiv.org/abs/2509.05489)


- 会议:ICLR2026

- 中文简介:自对齐奖励 (SAR) 对答案的标记可能性取决于查询的程度进行评分:比较有或没有以问题为条件的答案困惑度,剪裁它们的相对差异,并将其添加到 PPO/GRPO 中的可验证奖励中。令牌级似然比版本为查询信息令牌提供更高的奖励。

- 链接:[https://arxiv.org/abs/2509.05489](https://arxiv.org/abs/2509.05489)


## 18. [CriticalKV: Optimizing KV Cache Eviction from an Output Perturbation Perspective](https://arxiv.org/abs/2502.03805)


- 会议:ICML2026

- 中文简介:CriticalKV 用注意力输出的扰动界限取代了仅注意力缓存排名。它的两阶段贪婪选择器首先分配预算,然后使用注意力权重乘以价值状态范数对条目进行排名,选择最小化最坏情况输出扰动的条目;它插入现有的缓存逐出方法。

- 链接:[https://arxiv.org/abs/2502.03805](https://arxiv.org/abs/2502.03805)


## 19. [Spatial Priors via Space Filling Curves for Small and Limited Data Vision Transformers](https://arxiv.org/abs/2606.14757)


- 会议:ICML2026

- 中文简介:VIOLIN 通过扫描具有多个空间填充曲线的补丁,构建特定于曲线的衰减掩模,将它们组合起来,并将结果与​​注意力矩阵相乘,将空间归纳偏差注入 ViT 注意力中。它是一个轻量级的架构模块,添加的参数可以忽略不计,并且没有辅助推理模型。

- 链接:[https://arxiv.org/abs/2606.14757](https://arxiv.org/abs/2606.14757)


## 20. [Improving Diffusion-based Inverse Algorithms under Few-Step Constraint via Linear Extrapolation](https://arxiv.org/abs/2503.10103)


- 会议:NeurIPS2025

- 中文简介:把任意扩散逆问题算法分解为 Sampler、Corrector、Noiser 三个模块,在每个少步迭代中用一个可学习线性组合替换当前 corrected estimate 与此前各步 estimate;系数只用少量带观测的参考样本和 MSE+LPIPS 目标逐时间步优化,线性观测任务再把系数按 range/null space 解耦。

- 链接:[https://arxiv.org/abs/2503.10103](https://arxiv.org/abs/2503.10103)


## 21. [Verbalized Sampling: How to Mitigate Mode Collapse and Unlock LLM Diversity](https://arxiv.org/abs/2510.01171)


- 会议:ICML2026

- 中文简介:在一次提示中要求 LLM 先生成一组候选响应及其概率分布,再按该分布采样/选择,而不是直接生成一个最典型答案;这是通过改变输出接口缓解偏好数据 typicality bias 的 training-free 推理策略。

- 链接:[https://arxiv.org/abs/2510.01171](https://arxiv.org/abs/2510.01171)


## 22. [Jacobian Aligned Random Forests](https://arxiv.org/abs/2512.08306)


- 会议:ICLR2026

- 中文简介:先用可微/可近似梯度的概率代理模型估计输出关于输入的 Jacobian 外积均值 EJOP/EGOP,把它正则化成一个全局线性预条件器并变换所有特征,再在变换特征上训练原封不动的轴对齐随机森林。

- 链接:[https://arxiv.org/abs/2512.08306](https://arxiv.org/abs/2512.08306)


## 23. [FlowCast: Trajectory Forecasting for Scalable Zero-Cost Speculative Flow Matching](https://arxiv.org/abs/2602.01329)


- 会议:ICLR2026

- 中文简介:利用 flow matching 在局部近似恒定速度的性质,用当前 velocity 外推未来一步/多步状态,并用速度预测的 MSE 阈值验证;通过则跳过冗余 ODE 步,否则回退精确计算。

- 链接:[https://arxiv.org/abs/2602.01329](https://arxiv.org/abs/2602.01329)


## 24. [When Distance Distracts: Representation Distance Bias in BT-Loss for Reward Models](https://arxiv.org/abs/2512.06343)


- 会议:ICML2026

- 中文简介:根据 Bradley--Terry pairwise 梯度范数中 representation distance 对更新幅度的乘性影响,对每个 chosen/rejected pair 的距离相关项做归一化,使更新主要由 prediction error 决定。

- 链接:[https://arxiv.org/abs/2512.06343](https://arxiv.org/abs/2512.06343)


## 25. [Model Merging Scaling Laws in Large Language Models](https://arxiv.org/abs/2509.24244)


- 会议:ICML2026

- 中文简介:用一个含模型容量 floor 与专家数量 tail 的幂律拟合合并后 cross-entropy,tail 近似 1/k;用少量曲线点预测达到目标 loss 所需专家数,从而规划加专家还是扩大 base model。

- 链接:[https://arxiv.org/abs/2509.24244](https://arxiv.org/abs/2509.24244)


## 26. [TADA: Improved Diffusion Sampling with Training-free Augmented DynAmics](https://arxiv.org/abs/2506.21757)


- 会议:NeurIPS2025

- 中文简介:TADA 增强了具有 N 维状态的预训练扩散/流采样器。在每个求解器时间,它将状态投影到原始模型输入,从模型预测和泰勒项形成高阶力,并集成增强动力学;额外的状态提供伪随机性/多样性,无需重新训练。

- 链接:[https://arxiv.org/abs/2506.21757](https://arxiv.org/abs/2506.21757)


## 27. [Generation then Reconstruction: Accelerating Masked Autoregressive Models via Two-Stage Sampling](https://arxiv.org/abs/2510.17171)


- 会议:ICLR2026

- 中文简介:GtR 通过棋盘/模块化空间集对图像标记进行分层划分:稀疏的早期阶段建立全局语义,最终的重建阶段并行生成相邻标记。 FTS为高频代币能量分配额外的扩散步骤;两者都无需接受 MAR 培训。

- 链接:[https://arxiv.org/abs/2510.17171](https://arxiv.org/abs/2510.17171)


## 28. [FreqKV: Key-Value Compression in Frequency Domain for Context Window Extension](https://arxiv.org/abs/2505.00570)


- 会议:ICLR2026

- 中文简介:FreqKV 沿 KV 缓存序列维度应用 DCT,保留低频分量,使用 sqrt(L/N) 重新缩放、逆变换,并在缓存填满时迭代重复;一些注意力接收器令牌保持未压缩状态,并且密钥仅在压缩后才接收 RoPE。

- 链接:[https://arxiv.org/abs/2505.00570](https://arxiv.org/abs/2505.00570)


## 29. [ABBA-Adapters: Efficient and Expressive Fine-Tuning of Foundation Models](https://arxiv.org/abs/2505.14238)


- 会议:ICLR2026

- 中文简介:将 LoRA 的单个低秩更新替换为两个彼此独立学习的低秩矩阵乘积的逐元素 Hadamard 乘积:Delta W = s(B1A1)⊙(B2A2)。用截断 SVD 初始化一对、LoRA 初始化另一对,并用 Khatri–Rao 等价式把它实现成 LoRA 风格的低秩矩阵乘向量,因而在相同参数预算下获得更高有效秩。

- 链接:[https://arxiv.org/abs/2505.14238](https://arxiv.org/abs/2505.14238)


## 30. [LookaheadKV: Fast and Accurate KV Cache Eviction by Glimpsing into the Future without Generation](https://arxiv.org/abs/2603.10899)


- 会议:ICLR2026

- 中文简介:LookaheadKV 在冻结的 decoder LLM 上追加一段可学习 lookahead soft token,并只对这些 token 激活的低秩 Lookahead LoRA;训练它们用模型真实响应产生的 cross-attention importance 分布做 KL/ListNet 蒸馏,prefill 时直接以 lookahead token 的 attention 排序保留 Top-K KV,从而省掉 draft response generation。

- 链接:[https://arxiv.org/abs/2603.10899](https://arxiv.org/abs/2603.10899)


## 31. [Bridging the Knowledge-Prediction Gap in LLMs on Multiple-Choice Questions](https://arxiv.org/abs/2509.23782)


- 会议:ICML2026

- 中文简介:KAPPA 先在模型残差流每层训练 knowledge probe(真实答案)和 prediction probe(模型贪心答案),把两者权重视为子空间;推理时用一个闭式最小二乘 affine projection,把当前 hidden state 的 prediction coordinates 对齐到 knowledge coordinates,再在选定中间层逐 token 施加,可用 α/β 控制强度。

- 链接:[https://arxiv.org/abs/2509.23782](https://arxiv.org/abs/2509.23782)


## 32. [Backdoor Cleaning without External Guidance in MLLM Fine-tuning](https://arxiv.org/abs/2505.16916)


- 会议:NeurIPS2025

- 中文简介:BYE 在含毒下游数据上先运行目标 MLLM,提取首个解码 token 到图像 token 的跨模态 attention;逐层算 Shannon entropy,用两分量 GMM 的 Bimodal Separation Index 选敏感层,跨层平均后再用 GMM 找低熵 cluster,过滤疑似 poison,再在剩余数据上重新微调。

- 链接:[https://arxiv.org/abs/2505.16916](https://arxiv.org/abs/2505.16916)


## 33. [Activation-Informed Merging of Large Language Models](https://arxiv.org/abs/2502.02421)


- 会议:NeurIPS2025

- 中文简介:先用无任务校准集统计基础模型每层输入 activation magnitude,归一化成 saliency A_pre;对任意已有模型 merge 的参数增量 Δ_merged,按 θ_AIM=θ_pre+(1−A_pre(1−ω))Δ_merged 缩小高激活通道的偏离,从而保留基础模型关键权重。

- 链接:[https://arxiv.org/abs/2502.02421](https://arxiv.org/abs/2502.02421)


## 34. [Temporal Score Rescaling for Temperature Sampling in Diffusion and Flow Models](https://arxiv.org/abs/2510.01184)


- 会议:ICML2026

- 中文简介:在扩散/flow 采样的每个时间点对 score 乘以解析的时间相关 rescaling 因子,使局部温度可控;不微调、不增加 score 网络评估,确定性和随机采样器均可直接使用。

- 链接:[https://arxiv.org/abs/2510.01184](https://arxiv.org/abs/2510.01184)


## 35. [Majority of the Bests: Improving Best-of-N via Bootstrapping](https://arxiv.org/abs/2511.18630)


- 会议:NeurIPS2025

- 中文简介:生成 N 个候选的固定池,重复引导较小的替换子集,在每个子集中选取奖励最大化的候选,并对生成的 Best-of-N 答案进行多数投票,以估计 BoN 分布的模式。

- 链接:[https://arxiv.org/abs/2511.18630](https://arxiv.org/abs/2511.18630)


## 36. [Fine-Tuning Masked Diffusion for Provable Self-Correction](https://arxiv.org/abs/2510.01384)


- 会议:ICML2026

- 中文简介:将轻量级的每个令牌质量头附加到任何预训练的屏蔽扩散模型,使用目标是屏蔽令牌后验的二元 PRISM 损失对其进行微调,并在推理过程中重新屏蔽低质量令牌。

- 链接:[https://arxiv.org/abs/2510.01384](https://arxiv.org/abs/2510.01384)


## 37. [Context Tuning for In-Context Optimization](https://arxiv.org/abs/2507.04221)


- 会议:ICML2026

- 中文简介:把 few-shot demonstrations 经过 ICL 得到的 soft prompt 或 KV cache 当作初始化,只优化该上下文表示而不更新基础模型;可在 TTT 后再做 refinement。

- 链接:[https://arxiv.org/abs/2507.04221](https://arxiv.org/abs/2507.04221)


## 38. [Breaking the Lock-in: Diversifying Text-to-Image Generation via Representation Modulation](https://arxiv.org/abs/2606.06813)


- 会议:ICML2026

- 中文简介:观察 flow Transformer 隐表示的 DC(空间零频)分量在早期跨 seed 锁定,只在早期步骤和选定 block 对该分量做衰减,扩大后续生成轨迹。

- 链接:[https://arxiv.org/abs/2606.06813](https://arxiv.org/abs/2606.06813)


## 39. [Radial Attention: $\\mathcal{O}(n\\log n)$ Sparse Attention with Energy Decay for Long Video Generation](https://arxiv.org/abs/2506.19852)


- 会议:NeurIPS2025

- 中文简介:根据 video diffusion attention 随时空距离衰减的经验规律,构造静态 radial mask:近帧保留较宽空间对角带,远帧按指数降低密度,并用 LoRA 微调扩展视频长度。

- 链接:[https://arxiv.org/abs/2506.19852](https://arxiv.org/abs/2506.19852)


## 40. [ZeroTuning: Unlocking the Initial Token's Power to Enhance Large Language Models Without Training](https://arxiv.org/abs/2505.11739)


- 会议:ICLR2026

- 中文简介:不识别任务 token,只在 attention logits 中对初始/BOS token 做 head-specific scaling;监督版用小验证集校准,非监督版最小化输出 entropy。

- 链接:[https://arxiv.org/abs/2505.11739](https://arxiv.org/abs/2505.11739)


## 41. [On the Predictive Power of Representation Dispersion in Language Models](https://arxiv.org/abs/2506.24106)


- 会议:ICLR2026

- 中文简介:计算模型 token/hidden representation 的平均 pairwise dispersion 和 domain-to-generic dispersion gap,把它作为无标签的例子难度、模型选择、kNN-LM layer 选择及训练 regularizer 信号。

- 链接:[https://arxiv.org/abs/2506.24106](https://arxiv.org/abs/2506.24106)


## 42. [Deep Think with Confidence](https://arxiv.org/abs/2508.15260)


- 会议:ICLR2026

- 中文简介:DeepConf 用模型 token 分布的局部置信度给并行推理轨迹加权/过滤;离线按底部窗口置信度投票,在线 warmup 估阈值并在低置信时提前终止。

- 链接:[https://arxiv.org/abs/2508.15260](https://arxiv.org/abs/2508.15260)


## 43. [Missingness Bias Calibration in Feature Attribution Explanations](https://arxiv.org/abs/2603.04831)


- 会议:ICLR2026

- 中文简介:MCal 在冻结模型产生的 clean/ablated logits 上训练一个简单线性 calibrator,把缺失输入导致的输出空间偏移校正后再计算特征归因。

- 链接:[https://arxiv.org/abs/2603.04831](https://arxiv.org/abs/2603.04831)


## 44. [How Many Different Outputs Can a Transformer Generate?](https://arxiv.org/abs/2605.22223)


- 会议:ICML2026

- 中文简介:论文用 embedding-space 的 packing/partition 几何分析 transformer 可访问序列:按 prompt 长度上界可访问输出数量,并证明最大可访问长度线性增长、临界后比例指数衰减。

- 链接:[https://arxiv.org/abs/2605.22223](https://arxiv.org/abs/2605.22223)


## 45. [``Noisier'’ Noise Contrastive Estimation is (Almost) Maximum Likelihood](https://arxiv.org/abs/2405.16730)


- 会议:ICLR2026

- 中文简介:N2CE 通过将噪声分布贡献乘以幅度 M 来改变 NCE 目标;随着 M 的增长,其梯度接近 MLE,并具有有限样本偏差/方差分析和可选的比率正则化或多级估计。

- 链接:[https://arxiv.org/abs/2405.16730](https://arxiv.org/abs/2405.16730)


## 46. [MAMBO-G: Magnitude-Aware Mitigation for Boosted Guidance](https://arxiv.org/abs/2508.03442)


- 会议:ICML2026

- 中文简介:MAMBO-G 测量条件与无条件扩散速度的相对大小,并用每个样本的调度 w(r)=1+(wmax-1)exp(-alpha r) 取代固定的 CFG 尺度,​​从而减少早期零 SNR 步骤的过度指导,而无需重新训练。

- 链接:[https://arxiv.org/abs/2508.03442](https://arxiv.org/abs/2508.03442)


## 47. [Thicker and Quicker: The Jumbo Token for Fast Plain Vision Transformers](https://arxiv.org/abs/2502.15021)


- 会议:ICLR2026

- 中文简介:Jumbo Token 用一个更宽的 token 替换了许多普通的 patch token,其内容被分成 J 个注意力 token,而共享的每层前馈块则处理更广泛的表示并重新组装它。

- 链接:[https://arxiv.org/abs/2502.15021](https://arxiv.org/abs/2502.15021)


## 48. [The Curse of Depth in Large Language Models](https://arxiv.org/abs/2502.05795)


- 会议:NeurIPS2025

- 中文简介:该论文将深度 l 处的每个 Pre-LN LayerNorm 输出缩放为 1/sqrt(l),控制深度网络方差并保留身份路径,而无需添加参数或学习的超参数。

- 链接:[https://arxiv.org/abs/2502.05795](https://arxiv.org/abs/2502.05795)


## 49. [TokenSwap: A Lightweight Method to Disrupt Memorized Sequences in LLMs](https://arxiv.org/abs/2502.05159)


- 会议:NeurIPS2025

- 中文简介:TokenSwap 是一种事后 Logit 干预:对于一组固定的频繁语法标记,用较小的辅助 LM 的归一化概率替换大型模型的概率,同时保持所有其他标记不变。

- 链接:[https://arxiv.org/abs/2502.05159](https://arxiv.org/abs/2502.05159)


## 50. [Teaching Metric Distance to Discrete Autoregressive Language Models](https://arxiv.org/abs/2503.02379)


- 会议:ICLR2026

- 中文简介:用 token 间预定义 metric distance 构造 reward-weighted soft target(离目标近的 token 获得更高概率),以该分布替代离散自回归模型的一热交叉熵目标。

- 链接:[https://arxiv.org/abs/2503.02379](https://arxiv.org/abs/2503.02379)


## 51. [Parallel Sampling from Masked Diffusion Models via Conditional Independence Testing](https://arxiv.org/abs/2510.21961)


- 会议:ICLR2026

- 中文简介:PUNT 在 masked diffusion 每步按置信度排序 masked tokens,用 KL 变化测试上下文条件独立性,递归/二进制划分删除依赖 token,只并行 unmask 通过测试的集合。

- 链接:[https://arxiv.org/abs/2510.21961](https://arxiv.org/abs/2510.21961)


## 52. [MergeTune: Continued Fine-Tuning of Vision-Language Models](https://arxiv.org/abs/2601.10497)


- 会议:ICLR2026

- 中文简介:MergeTune 对已有 VLM fine-tuned checkpoint 做 continued fine-tuning:以 zero-shot 与 adapted 权重的线性 mode connectivity 为约束,用 second-order surrogate 代替预训练数据 replay,寻找同时连接两端的模型。

- 链接:[https://arxiv.org/abs/2601.10497](https://arxiv.org/abs/2601.10497)


## 53. [What Matters in Data for DPO?](https://arxiv.org/abs/2508.18312)


- 会议:NeurIPS2025

- 中文简介:由理论和对照实验支持的 DPO 数据质量原则:选择响应质量主导拒绝响应质量;分配精力改进所选答案并相应地使用偏好数据。

- 链接:[https://arxiv.org/abs/2508.18312](https://arxiv.org/abs/2508.18312)


## 54. [Reinforcement Learning Fine-Tuning Enhances Activation Intensity and Diversity in the Internal Circuitry of LLMs](https://arxiv.org/abs/2509.21044)


- 会议:ICLR2026

- 中文简介:采用边缘归因修补来比较 RL 微调之前/之后基于梯度的边缘重要性和内部激活统计数据,测量强度、熵/多样性和峰度;温度干预测试因果关系。

- 链接:[https://arxiv.org/abs/2509.21044](https://arxiv.org/abs/2509.21044)


## 55. [NeUQI: Near-Optimal Uniform Quantization Parameter Initialization for Low-Bit LLMs](https://arxiv.org/abs/2505.17595)


- 会议:ICML2026

- 中文简介:对于每个量化权重行,通过分段二次优化在固定尺度上导出接近最优的浮动零点,然后使用从粗到细的尺度搜索来有效地初始化均匀的低位量化。

- 链接:[https://arxiv.org/abs/2505.17595](https://arxiv.org/abs/2505.17595)


## 56. [scDataset: Scalable Data Loading for Deep Learning on Large-Scale Single-Cell Omics](https://arxiv.org/abs/2506.01883)


- 会议:ICML2026

- 中文简介:PyTorch IterableDataset 将连续块采样与批量获取和内存中重新洗牌相结合,通过可调块大小 b 和获取因子 f 平衡磁盘 I/O 吞吐量与小批量多样性。

- 链接:[https://arxiv.org/abs/2506.01883](https://arxiv.org/abs/2506.01883)


## 57. [Interpreting and Steering State-Space Models via Activation Subspace Bottlenecks](https://arxiv.org/abs/2602.22719)


- 会议:ICML2026

- 中文简介:使用机械探针识别 Mamba 模型中的低维激活瓶颈子空间,然后在测试时将这些激活乘以标量以引导行为; Stable-Mamba 是经过重新训练的架构后续版本。

- 链接:[https://arxiv.org/abs/2602.22719](https://arxiv.org/abs/2602.22719)


## 58. [Reinforcement Learning for Reasoning in Large Language Models with One Training Example](https://arxiv.org/abs/2504.20571)


- 会议:NeurIPS2025

- 中文简介:在一个精心选择的正确数学示例(或两个)上运行标准的可验证奖励策略梯度强化学习,然后利用诱导泛化,而不是添加大型训练集。

- 链接:[https://arxiv.org/abs/2504.20571](https://arxiv.org/abs/2504.20571)


## 59. [KnapSpec: Self-Speculative Decoding via Adaptive Layer Selection as a Knapsack Problem](https://arxiv.org/abs/2602.20217)


- 会议:ICML2026

- 中文简介:KnapSpec 在单一 LLM 内把 Attention/MLP 层分别视为可跳过的 knapsack item,以硬件和上下文长度相关的延迟作 weight、草稿/目标隐藏状态 cosine similarity 作 value;DP 找出不同延迟预算的候选子网络,再用实际 acceptance rate 和 Tokens-per-Time (TPT) 选择 draft layer set 与 draft length,并周期性随上下文重优化。

- 链接:[https://arxiv.org/abs/2602.20217](https://arxiv.org/abs/2602.20217)


## 60. [MoNE: Replacing Redundant Experts with Lightweight Novices for Structured Pruning of MoE](https://arxiv.org/abs/2507.00390)


- 会议:ICLR2026

- 中文简介:MoNE在少量校准样本上统计每个MoE expert的路由访问频率和输出方差,将两者乘积作为冗余分数;剪掉低冗余分数expert,并以其校准输出均值构造不依赖输入的轻量novice向量替换。

- 链接:[https://arxiv.org/abs/2507.00390](https://arxiv.org/abs/2507.00390)


## 61. [Gradient-Sign Masking for Task Vector Transport Across Pre-Trained Models](https://arxiv.org/abs/2510.09658)


- 会议:ICLR2026

- 中文简介:GradFix计算目标预训练模型在少量标注样本上的anti-gradient sign,用其与源模型task vector逐坐标比对,仅保留符号一致的更新并按alpha加入目标模型;不更新目标参数,可用多数投票估计符号。

- 链接:[https://arxiv.org/abs/2510.09658](https://arxiv.org/abs/2510.09658)


## 62. [Enhancing Multi-Image Understanding through Delimiter Token Scaling](https://arxiv.org/abs/2602.01984)


- 会议:ICLR2026

- 中文简介:Delimiter Token Scaling在每层将多图输入中图像分隔符位置的隐藏状态乘以固定λ>1,强化图像边界表示,减少跨图像注意力而保持图内注意力;不改参数、不增加推理层。

- 链接:[https://arxiv.org/abs/2602.01984](https://arxiv.org/abs/2602.01984)


## 63. [GradPower: Powering Gradients for Faster Language Model Pre-Training](https://arxiv.org/abs/2505.24275)


- 会议:ICML2026

- 中文简介:GradPower在任意基础优化器更新前对梯度逐元素施加sign(g)|g|^p的幂变换(默认p=1.2),以放大大梯度、压低小梯度;保持优化器其余状态与实现不变。

- 链接:[https://arxiv.org/abs/2505.24275](https://arxiv.org/abs/2505.24275)


## 64. [Optimal Self-Consistency for Efficient Reasoning with Large Language Models](https://arxiv.org/abs/2511.12309)


- 会议:ICML2026

- 中文简介:Blend-ASC把自洽性样本预算动态分配给两种置信度:前期偏向标准ASC多数答案置信度,后期线性转向PPR-1v1 pairwise置信度;每一步选择当前最不确定问题采样,固定预算下减少无效样本。

- 链接:[https://arxiv.org/abs/2511.12309](https://arxiv.org/abs/2511.12309)


## 65. [Diversity Matters: Revisiting Test-Time Compute in Vision-Language Models](https://arxiv.org/abs/2605.30713)


- 会议:ICML2026

- 中文简介:ETTC研究VLM测试时计算中的相关性与投票,提出按多模型预测分布的归一化熵选择最低不确定模型;单模型时退化为标准投票,避免在高度相关模型上盲目增加样本。

- 链接:[https://arxiv.org/abs/2605.30713](https://arxiv.org/abs/2605.30713)


## 66. [Uncertainty Estimation via Hyperspherical Confidence Mapping](https://arxiv.org/abs/2605.05964)


- 会议:ICLR2026

- 中文简介:Hyperspherical Confidence Mapping将输出分解为幅度R与方向d,分别训练并加范数约束;确定性不确定度为u=R|‖d‖−1|,可用于分类、回归和OOD/深度预测而无需额外ensemble。

- 链接:[https://arxiv.org/abs/2605.05964](https://arxiv.org/abs/2605.05964)


## 67. [On the Interaction of Compressibility and Adversarial Robustness](https://arxiv.org/abs/2507.17725)


- 会议:ICLR2026

- 中文简介:用神经元稀疏度与谱低秩压缩度刻画表示敏感方向,再由压缩度推导 Lipschitz/算子范数相关的对抗鲁棒性界;对网络施加压缩或正则化并测量攻击下的性能。

- 链接:[https://arxiv.org/abs/2507.17725](https://arxiv.org/abs/2507.17725)


## 68. [LayerSync: Self-aligning Intermediate Layers](https://arxiv.org/abs/2510.12581)


- 会议:ICLR2026

- 中文简介:将较浅 block 的 patch 表示与 stop-gradient 的较深 block 表示做 cosine 对齐,并把该 LayerSync 损失加到扩散 velocity/denoising loss;按启发式选择中间层对。

- 链接:[https://arxiv.org/abs/2510.12581](https://arxiv.org/abs/2510.12581)


## 69. [JAPAN: Joint Adaptive Prediction Areas with Normalising Flow](https://arxiv.org/abs/2505.23196)


- 会议:ICLR2026

- 中文简介:用 normalizing flow 估计条件/预测密度,把 log density 作为 conformal conformity score,在 calibration quantile 处阈值化得到 geometry-free、可断开的 prediction area;面积可在 latent space Monte Carlo 估计。

- 链接:[https://arxiv.org/abs/2505.23196](https://arxiv.org/abs/2505.23196)


## 70. [Quantization Error Propagation: Revisiting Layer-Wise Post-Training Quantization](https://arxiv.org/abs/2504.09629)


- 会议:NeurIPS2025

- 中文简介:QEP 在逐层 PTQ 中维护量化误差,并把累计误差通过 Hessian/线性传播估计成下一层权重修正;用可调 propagation strength/damping 控制误差补偿和开销。

- 链接:[https://arxiv.org/abs/2504.09629](https://arxiv.org/abs/2504.09629)


## 71. [Misaligned Roles, Misplaced Images: Structural Input Perturbations Expose Multimodal Alignment Blind Spots](https://arxiv.org/abs/2504.03735)


- 会议:ICLR2026

- 中文简介:Role-Modality Attack 将多模态输入中 user/assistant/system 角色与图像/文本模态的归属结构交换或扰动,构造 role confusion 与 modality manipulation;再分析拒答方向并可用对抗训练缓解。

- 链接:[https://arxiv.org/abs/2504.03735](https://arxiv.org/abs/2504.03735)


## 72. [PPE: Positional Preservation Embedding for Token Compression in Multimodal Large Language Models](https://arxiv.org/abs/2510.22936)


- 会议:ICLR2026

- 中文简介:PPE 在聚类合并视觉 token 时,不给合并 token 一个位置 ID,而是把 cluster 中 top-K 原位置按 RoPE/M-RoPE 维度分组写入同一 token;可在 Transformer 多层级联压缩。

- 链接:[https://arxiv.org/abs/2510.22936](https://arxiv.org/abs/2510.22936)


## 73. [CapBencher: Give Your LLM Benchmark a Built-in Alarm for Test-Set Overfitting](https://arxiv.org/abs/2505.18102)


- 会议:ICML2026

- 中文简介:CapBencher 通过把每题真实答案随机映射到多个逻辑正确的 realized answers 降低 Bayes accuracy;用 capped score 与 Bayes 上界的单侧二项检验检测测试集过拟合,并给出从 capped score 无偏恢复原始准确率的估计器。

- 链接:[https://arxiv.org/abs/2505.18102](https://arxiv.org/abs/2505.18102)


## 74. [From Memorization to Parameter Interference: How Overtraining Experts Harms Model Merging](https://arxiv.org/abs/2506.14126)


- 会议:ICML2026

- 中文简介:研究发现 expert 过度 fine-tuning 会记忆少量困难样本,使不同专家 checkpoint 在 merge 时产生负参数干扰;提出按任务验证曲线提前停止(视觉线性 warm-up/decay,语言验证平台期)以改善 merging。

- 链接:[https://arxiv.org/abs/2506.14126](https://arxiv.org/abs/2506.14126)


## 75. [Subliminal Effects in Your Data: A General Mechanism via Log-Linearity](https://arxiv.org/abs/2602.04863)


- 会议:ICML2026

- 中文简介:计算 system prompt 相对无提示的 teacher logit preference shift,按长度归一化保留正向高分偏好样本,再用标准 DPO 微调 student。

- 链接:[https://arxiv.org/abs/2602.04863](https://arxiv.org/abs/2602.04863)


## 76. [GPO: Learning from Critical Steps to Improve LLM Reasoning](https://arxiv.org/abs/2509.16456)


- 会议:NeurIPS2025

- 中文简介:按 newline 将 reasoning trajectory 切成步骤,用 Monte Carlo 估计 step advantage,选最大 critical step 重置/续写;改进轨迹用于 PPO 或 DPO/SimPO/KTO/ORPO。

- 链接:[https://arxiv.org/abs/2509.16456](https://arxiv.org/abs/2509.16456)


## 77. [Dynamic Early Exit in Reasoning Models](https://arxiv.org/abs/2504.15895)


- 会议:ICLR2026

- 中文简介:在 reasoning transition 点诱导 trial answer,以 token confidence 判断 pearl reasoning 并提前停止;DEER-Pro 用多提示 MAD,branch-parallel 解码降延迟。

- 链接:[https://arxiv.org/abs/2504.15895](https://arxiv.org/abs/2504.15895)


## 78. [Expected Return Causes Outcome-Level Mode Collapse in Reinforcement Learning and How to Fix It with Inverse Probability Scaling](https://arxiv.org/abs/2601.21669)


- 会议:ICML2026

- 中文简介:把终端 outcome reward 按同组经验出现频率的倒数缩放:r~=r/max(p_hat,epsilon),再直接执行标准 GRPO;该 popularity correction 使 outcome 分布趋向与 reward 成正比,缓解 expected-return 的 outcome-level mode collapse。

- 链接:[https://arxiv.org/abs/2601.21669](https://arxiv.org/abs/2601.21669)


## 79. [Dyslexify: A Mechanistic Defense Against Typographic Attacks in CLIP](https://arxiv.org/abs/2508.20570)


- 会议:ICLR2026

- 中文简介:用带有局部 typography 标注的合成数据计算每个 CLIP attention head 的 Typographic Attention Score,按得分排序逐头 ablate cls residual,同时监控非 typo 精度不降超 epsilon,得到无需微调的 dyslexic CLIP。

- 链接:[https://arxiv.org/abs/2508.20570](https://arxiv.org/abs/2508.20570)


## 80. [Spatial-Aware Reduction Framework: Towards Efficient and Faithful Visual State Space Models](https://arxiv.org/abs/2606.19932)


- 会议:ICML2026

- 中文简介:把任意 token reducer 从展平序列改为 feature grid 内先逐行、后逐列的结构化 reduction,并在每行/列的局部非重叠窗口内执行,从而保持 VMamba SS2D 所需规则子网格和邻域连续性。

- 链接:[https://arxiv.org/abs/2606.19932](https://arxiv.org/abs/2606.19932)


## 81. [Latent Denoising Makes Good Tokenizers](https://arxiv.org/abs/2507.15856)


- 会议:ICLR2026

- 中文简介:训练 tokenizer 时不只做像素重建,而先把 latent embedding 施加 interpolative noise 或随机 masking,再要求 decoder 从 corrupted latent 重建 clean image,使 tokenizer latent 与下游 diffusion/AR denoising 目标对齐。

- 链接:[https://arxiv.org/abs/2507.15856](https://arxiv.org/abs/2507.15856)


## 82. [GuidedSampling: Steering LLMs Towards Diverse Candidate Solutions at Inference-Time](https://arxiv.org/abs/2510.03777)


- 会议:ICLR2026

- 中文简介:将推理拆为 exploration 和 generation:先让 LLM 显式提出多个可用 theorem/concept,再把每个 concept 注入 prompt 生成候选解;以概念覆盖替代直接 repeated sampling 的单一模式复用。

- 链接:[https://arxiv.org/abs/2510.03777](https://arxiv.org/abs/2510.03777)


## 83. [Causal-JEPA: Learning World Models through Object-Level Latent Masking](https://arxiv.org/abs/2602.11389)


- 会议:ICML2026

- 中文简介:在冻结 object-centric encoder 的 latent history 中随机 mask 对象槽位,要求 predictor 从其余对象/历史和未来 latent 恢复 masked slots 并做 forward prediction;该部分可观测性约束迫使学习交互动态而非只学对象自运动。

- 链接:[https://arxiv.org/abs/2602.11389](https://arxiv.org/abs/2602.11389)


## 84. [Dropout Universality: Scaling Laws and Optimal Scheduling at the Edge-of-Chaos](https://arxiv.org/abs/2605.21648)


- 会议:ICML2026

- 中文简介:Dropout Universality 用均场相关图和 Landau 临界分析确定固定 dropout 预算下的最优深度分配:把 dropout 前置到网络早期,使正则化作用达到临界传播区。

- 链接:[https://arxiv.org/abs/2605.21648](https://arxiv.org/abs/2605.21648)


## 85. [SSR-Merge: Subspace Signal Routing for Training-Free LoRA Merging in Diffusion Models](https://arxiv.org/abs/2606.10617)


- 会议:ICML2026

- 中文简介:SSR-Merge 把多个 LoRA 的 A/B 投影到统一子空间,用校准输入的激活协方差 G 和目标交叉协方差 Q 求闭式路由 R=QG^{-1},再把 R 吸收到 B 中实现训练-free 合并。

- 链接:[https://arxiv.org/abs/2606.10617](https://arxiv.org/abs/2606.10617)


## 86. [DiffusionBlocks: Block-wise Neural Network Training via Diffusion Interpretation](https://arxiv.org/abs/2506.14202)


- 会议:ICLR2026

- 中文简介:DiffusionBlocks 把同维残差网络分成 B 个 block,为每个 block 分配等概率噪声区间并加入噪声条件;每个 block 独立用 denoising score loss 训练,推理时按 Euler 噪声步顺序调用。

- 链接:[https://arxiv.org/abs/2506.14202](https://arxiv.org/abs/2506.14202)


## 87. [Bound by semanticity: universal laws governing the generalization-identification tradeoff](https://arxiv.org/abs/2506.14797)


- 会议:ICLR2026

- 中文简介:在度量概率空间中用有限分辨率和噪声定义相似度,推导相似性与识别概率的Pareto曲线,并用多项目标实验检验识别随项目数衰减的规律

- 链接:[https://arxiv.org/abs/2506.14797](https://arxiv.org/abs/2506.14797)


## 88. [Investigating Redundancy in Multimodal Large Language Models with Multiple Vision Encoders](https://arxiv.org/abs/2507.03262)


- 会议:ICLR2026

- 中文简介:用遮蔽一个视觉编码器前后的性能差计算贡献率,用多编码器遮蔽差异量化冗余,并结合注意力KL与规模分析诊断多模态模型的视觉编码器使用

- 链接:[https://arxiv.org/abs/2507.03262](https://arxiv.org/abs/2507.03262)


## 89. [ZeroSiam: An Efficient Asymmetry for Test-Time Entropy Optimization without Collapse](https://arxiv.org/abs/2509.23183)


- 会议:ICLR2026

- 中文简介:在测试时以原始logits分支作为停止梯度目标、以可学习线性预测器作为在线分支,最小化熵并用对称KL避免熵优化塌缩

- 链接:[https://arxiv.org/abs/2509.23183](https://arxiv.org/abs/2509.23183)


## 90. [Adaptive Preconditioners Trigger Loss Spikes in Adam](https://arxiv.org/abs/2506.04805)


- 会议:ICML2026

- 中文简介:分析Adam中二阶矩预条件器与当前平方梯度脱钩导致预条件Hessian越过稳定阈值,并用梯度方向曲率预警、降低beta2缓解

- 链接:[https://arxiv.org/abs/2506.04805](https://arxiv.org/abs/2506.04805)


## 91. [Alignment-Aware Decoding](https://arxiv.org/abs/2509.26169)


- 会议:ICML2026

- 中文简介:在DPO模型每一步只保留高概率候选,并按对齐模型相对SFT参考模型的token log-ratio作为隐式奖励贪心解码

- 链接:[https://arxiv.org/abs/2509.26169](https://arxiv.org/abs/2509.26169)


## 92. [Conformal Thinking: Risk Control for Reasoning on a Compute Budget](https://arxiv.org/abs/2602.03814)


- 会议:ICML2026

- 中文简介:以校准集上的分布无关风险控制确定reasoning停止的上阈值和提前终止难解样本的参数化下阈值,并可组合ensemble停止

- 链接:[https://arxiv.org/abs/2602.03814](https://arxiv.org/abs/2602.03814)


## 93. [Hyperparameter Transfer Laws for Non-Recurrent Multi-Path Neural Networks](https://arxiv.org/abs/2602.07494)


- 会议:ICML2026

- 中文简介:以effective depth计数串行更新单元,在最大更新准则下固定初始化的典型表示更新能量,推导学习率随深度按L^{-3/2}缩放

- 链接:[https://arxiv.org/abs/2602.07494](https://arxiv.org/abs/2602.07494)


## 94. [Detached Skip-Links and $R$-Probe: Decoupling Feature Aggregation from Gradient Propagation for MLLM OCR](https://arxiv.org/abs/2603.20020)


- 会议:ICML2026

- 中文简介:在MLLM多层融合的skip branch上停止梯度而保留前向浅层特征,隔离高层语义损失对低层视觉特征的破坏

- 链接:[https://arxiv.org/abs/2603.20020](https://arxiv.org/abs/2603.20020)


## 95. [MidSteer: Optimal Affine Framework for Steering Generative Models](https://arxiv.org/abs/2605.05220)


- 会议:ICML2026

- 中文简介:把表示空间的概念切换/擦除写成最小扰动仿射变换:用LEACE约束去除概念相关协方差,MidSteer再按目标方向求解

- 链接:[https://arxiv.org/abs/2605.05220](https://arxiv.org/abs/2605.05220)


## 96. [Localizing Knowledge in Diffusion Transformers](https://arxiv.org/abs/2505.18832)


- 会议:NeurIPS2025

- 中文简介:构造知识探针集并用 cross-attention 的 text-token 到 image-token 贡献定位知识块,随后只在 top-K DiT blocks 做个性化微调或概念遗忘。

- 链接:[https://arxiv.org/abs/2505.18832](https://arxiv.org/abs/2505.18832)


## 97. [Scaling Language-centric Omnimodal Representation Learning](https://arxiv.org/abs/2510.11693)


- 会议:NeurIPS2025

- 中文简介:LCO 只用 text-only contrastive learning 对预训练 MLLM 的语言 decoder 做 LoRA 轻量适配,保留 modality encoders/projector,研究由生成能力驱动表示能力的 scaling law。

- 链接:[https://arxiv.org/abs/2510.11693](https://arxiv.org/abs/2510.11693)


## 98. [GradientStabilizer: Fix the Norm, Not the Gradient](https://arxiv.org/abs/2502.17055)


- 会议:ICML2026

- 中文简介:GradientStabilizer 将原始梯度替换为单位方向乘以根据最近梯度范数的指数移动平均值估计的标量大小。然后将变换后的梯度原封不动地传递给任何基础优化器。

- 链接:[https://arxiv.org/abs/2502.17055](https://arxiv.org/abs/2502.17055)


## 99. [Cautious Optimizers: Improving Training with One Line of Code](https://arxiv.org/abs/2411.16085)


- 会议:ICLR2026

- 中文简介:谨慎优化器将动量优化器建议的更新乘以符号一致掩码:仅应用动量/更新方向与当前梯度一致的坐标,并通过其平均掩码重新归一化活动坐标。

- 链接:[https://arxiv.org/abs/2411.16085](https://arxiv.org/abs/2411.16085)


## 100. [Improving Classifier-Free Guidance in Masked Diffusion: Low-Dim Theoretical Insights with High-Dim Impact](https://arxiv.org/abs/2507.08965)


- 会议:ICLR2026

- 中文简介:该论文通过在采样前对引导揭露率矩阵进行列归一化来修复屏蔽/离散扩散的无分类器指导。这种单行归一化保留了相对指导,同时防止速率归一化器抑制或爆炸所有转换率,并具有可选的时变指导时间表。

- 链接:[https://arxiv.org/abs/2507.08965](https://arxiv.org/abs/2507.08965)


## 101. [Gradient Descent with Large Step Sizes: Chaos and Fractal Convergence Region](https://arxiv.org/abs/2509.25351)


- 会议:ICLR2026

- 中文简介:该论文分析了异常大步长的标准梯度下降。精确的标量/向量/矩阵分解动力学识别正则化下的关键步骤、近临界混沌图和分形收敛边界,然后将该机制扩展到多项式/深度矩阵分解和ReLU网络。

- 链接:[https://arxiv.org/abs/2509.25351](https://arxiv.org/abs/2509.25351)


## 102. [OBS-Diff: Accurate Pruning For Diffusion Models in One-Shot](https://arxiv.org/abs/2510.06751)


- 会议:ICLR2026

- 中文简介:OBS-Diff 使用时间步加权 Hessian 显着性和顺序分组模块包,使 Optimal Brain Surgeon 适应扩散修剪,使用小型校准集而无需重新训练。

- 链接:[https://arxiv.org/abs/2510.06751](https://arxiv.org/abs/2510.06751)


## 103. [Diffusion Models as Dataset Distillation Priors](https://arxiv.org/abs/2510.17421)


- 会议:ICLR2026

- 中文简介:DAP 使用预训练扩散模型的中间特征作为先验代表性:在反向扩散期间,它添加生成的训练示例和真实训练示例之间的内核距离的梯度,可以选择提前停止引导。

- 链接:[https://arxiv.org/abs/2510.17421](https://arxiv.org/abs/2510.17421)


## 104. [Seeing but Not Believing: Probing the Disconnect Between Visual Attention and Answer Correctness in VLMs](https://arxiv.org/abs/2510.17771)


- 会议:ICLR2026

- 中文简介:VEA 对注意力最好的属性证据进行分析,然后在推理时对小空间图中的异常注意力进行去噪,将保留的证据覆盖在图像上,然后重新运行 VLM 答案。

- 链接:[https://arxiv.org/abs/2510.17771](https://arxiv.org/abs/2510.17771)


## 105. [KL-Regularized Reinforcement Learning for Generative Modelling is Designed to Mode Collapse](https://arxiv.org/abs/2510.20817)


- 会议:ICLR2026

- 中文简介:MARA 修改了 KL 正则化 RL 使用的奖励:对于高奖励样本,它添加了相对于锚点的参考对数概率校正,均衡它们的质量并在没有外部多样性模型的情况下保留多样性。

- 链接:[https://arxiv.org/abs/2510.20817](https://arxiv.org/abs/2510.20817)


## 106. [Multi-Agent Debate with Memory Masking](https://arxiv.org/abs/2603.20215)


- 会议:ICLR2026

- 中文简介:MAD-MM 为每轮多智能体辩论添加了一个记忆掩模:智能体在生成下一轮辩论和投票之前,判断先前的记忆并通过主观置信度或客观最低困惑度保留或删除它们。

- 链接:[https://arxiv.org/abs/2603.20215](https://arxiv.org/abs/2603.20215)


## 107. [Stop Training for the Worst: Progressive Unmasking Accelerates Masked Diffusion Training](https://arxiv.org/abs/2602.10314)


- 会议:ICML2026

- 中文简介:训练时不再按固定全mask目标学习,而是让teacher-forced目标token按推理一致的渐进unmask策略显露;结合置信度fast-forward、Top-K/边际规则和随训练变化的K日程,使训练与采样遮罩分布一致。

- 链接:[https://arxiv.org/abs/2602.10314](https://arxiv.org/abs/2602.10314)


## 108. [RMNP: Row-Momentum Normalized Preconditioning for Scalable Matrix-Based Optimization](https://arxiv.org/abs/2603.20527)


- 会议:ICML2026

- 中文简介:保留矩阵梯度的动量V,但不做Muon的Newton–Schulz正交化;只按行的L2范数归一化,令D=diag(VVᵀ)^(-1/2)V,再用D做参数更新。

- 链接:[https://arxiv.org/abs/2603.20527](https://arxiv.org/abs/2603.20527)


## 109. [Infinite Mask Diffusion for Few-Step Distillation](https://arxiv.org/abs/2605.10518)


- 会议:ICML2026

- 中文简介:把MDM中有限/确定的mask状态替换成等价于无限随机mask状态:用mask embedding加零初始化的噪声MLP表示连续随机mask,仍训练标准MDM损失,从而消除有限mask因子分解误差并兼容少步蒸馏。

- 链接:[https://arxiv.org/abs/2605.10518](https://arxiv.org/abs/2605.10518)


## 110. [Sparse MeZO: Less Parameters for Better Performance in Zeroth-Order LLM Fine-Tuning](https://arxiv.org/abs/2402.15751)


- 会议:NeurIPS2025

- 中文简介:在MeZO的对称零阶扰动中只更新动态选出的低幅值参数:每层按百分位产生mask,前向时在线重算mask以避免保存全量梯度,再用两次扰动损失差估计稀疏梯度。

- 链接:[https://arxiv.org/abs/2402.15751](https://arxiv.org/abs/2402.15751)


## 111. [RePO: Understanding Preference Learning Through ReLU-Based Optimization](https://arxiv.org/abs/2503.07426)


- 会议:NeurIPS2025

- 中文简介:把SimPO的log-sigmoid偏好损失替换为ReLU(-\[长度归一化隐式奖励差−γ\]),只更新margin低于γ的偏好对;论文进一步证明该ReLU在有界区间上是0-1偏好损失的凸包络。

- 链接:[https://arxiv.org/abs/2503.07426](https://arxiv.org/abs/2503.07426)


## 112. [Unleashing Diffusion Transformers for Visual Correspondence by Modulating Massive Activations](https://arxiv.org/abs/2505.18584)


- 会议:NeurIPS2025

- 中文简介:DiTF 是一种用于扩散 Transformer 的免训练特征提取器。它读取 DiT 中已经存在的 AdaLN 通道调制,识别一些大量的激活维度,使用它们学习的尺度/偏移来调制补丁特征,并丢弃弱/异常值通道。由此产生的中间特征可以服务于通信和其他密集视觉任务,而无需修改或重新训练生成器。

- 链接:[https://arxiv.org/abs/2505.18584](https://arxiv.org/abs/2505.18584)


## 113. [Normalize Filters! Classical Wisdom for Deep Vision](https://arxiv.org/abs/2506.04401)


- 会议:NeurIPS2025

- 中文简介:归一化滤波器通过分别按正负权重的绝对和对其正权重和负权重进行归一化来替换普通的卷积滤波器,然后应用可学习的缩放和移位。这使得每个滤波器响应相对对比度/差异模式,并在不改变周围网络的情况下为全局增益和偏差变化提供不变性/等方差性。

- 链接:[https://arxiv.org/abs/2506.04401](https://arxiv.org/abs/2506.04401)


## 114. [On the Thinking-Language Modeling Gap in Large Language Models](https://arxiv.org/abs/2505.12896)


- 会议:ICLR2026

- 中文简介:用 SCM 把潜在 thought 与外显语言的隐含度形式化,再用固定的 observe/expand/echo 提示干预:补充相关信息、展开隐式内容并回声复述,以降低 thought-language implicitness;训练无需改模型。

- 链接:[https://arxiv.org/abs/2505.12896](https://arxiv.org/abs/2505.12896)


## 115. [Uncovering Competency Gaps in Large Language Models and Their Benchmarks](https://arxiv.org/abs/2512.20638)


- 会议:ICML2026

- 中文简介:该论文使用稀疏自动编码器激活来量化能力覆盖范围和差距。对于每个基准,它对令牌级概念激活进行平均,规范整个套件的概念覆盖范围,并将覆盖范围与模型加权激活进行比较,以识别缺失、代表性不足或代表性过高的功能。

- 链接:[https://arxiv.org/abs/2512.20638](https://arxiv.org/abs/2512.20638)


## 116. [LatentLens: Revealing Highly Interpretable Visual Tokens in LLMs](https://arxiv.org/abs/2602.00462)


- 会议:ICML2026

- 中文简介:LatentLens 通过上下文化语言模型标记表示的语料库中的最近邻检索来解释视觉标记。它预先计算多个 LLM 层的许多标题标记的隐藏状态,并将每个视觉标记映射到最近的上下文单词/短语。

- 链接:[https://arxiv.org/abs/2602.00462](https://arxiv.org/abs/2602.00462)


## 117. [Possibilistic Predictive Uncertainty for Deep Learning](https://arxiv.org/abs/2605.00600)


- 会议:ICML2026

- 中文简介:DAPPr 用狄利克雷近似的可能性后验目标取代了交叉熵。它通过上确界将参数可能性投影到预测空间之后,在交叉熵下导出封闭式狄利克雷最大化器,并添加一个小的错误类证据正则化器来训练单个二阶预测器。

- 链接:[https://arxiv.org/abs/2605.00600](https://arxiv.org/abs/2605.00600)


## 118. [Training-Free Safe Denoisers for Safe Use of Diffusion Models](https://arxiv.org/abs/2502.08011)


- 会议:NeurIPS2025

- 中文简介:安全降噪器将普通数据降噪器与数据降噪器和不安全降噪器之间的比例差异相结合。不安全项是根据 RBF 核设置的不安全参考图像估计的,并且仅在选定的关键扩散时间步长处应用校正;它可以插入现有的 CFG、SAFREE 或 SLD 采样器,无需重新训练。

- 链接:[https://arxiv.org/abs/2502.08011](https://arxiv.org/abs/2502.08011)


## 119. [The Indra Representation Hypothesis for Multimodal Alignment](https://arxiv.org/abs/2604.04496)


- 会议:NeurIPS2025

- 中文简介:Indra 用其关系轮廓替换每个预训练的嵌入向量:从该样本到同一模态中每个其他样本的角距离。然后,线性探针或配对索引检索对这些配置文件进行操作,提供无需训练、与模态无关的表示,从而保留关系结构。

- 链接:[https://arxiv.org/abs/2604.04496](https://arxiv.org/abs/2604.04496)


## 120. [Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference](https://arxiv.org/abs/2407.11550)


- 会议:NeurIPS2025

- 中文简介:Ada-KV 在 Top-k KV 驱逐后得出注意力输出损失的上限,然后通过选择全局最大的注意力权重在各个头之间分配固定的每层缓存预算。稀疏头接收的条目较少,分散头接收的条目较多;保障措施将分配与统一预算混合在一起,并将该策略插入 SnapKV/Pyramid。

- 链接:[https://arxiv.org/abs/2407.11550](https://arxiv.org/abs/2407.11550)


## 121. [Enhancing Graph Classification Robustness with Singular Pooling](https://arxiv.org/abs/2510.22643)


- 会议:NeurIPS2025

- 中文简介:在 GCN/GIN 节点表示矩阵上用少量 power iterations 近似主右奇异向量,以其投影和缩放作为图级 pooling,从而抑制对抗扰动造成的表示漂移。

- 链接:[https://arxiv.org/abs/2510.22643](https://arxiv.org/abs/2510.22643)


## 122. [Towards Minimizing Feature Drift in Model Merging: Layer-wise Task Vector Fusion for Adaptive Knowledge Integration](https://arxiv.org/abs/2505.23859)


- 会议:NeurIPS2025

- 中文简介:对每一层最小化各任务 expert 与 merged model 的 feature drift;在线性、归一化缩放和 bias 三类操作上分别解凸二次问题的闭式 task-vector 解,最后将所得向量按 lambda 加回共享预训练模型。

- 链接:[https://arxiv.org/abs/2505.23859](https://arxiv.org/abs/2505.23859)


## 123. [Krause Synchronization Transformers](https://arxiv.org/abs/2602.11534)


- 会议:ICML2026

- 中文简介:将二次点积注意力替换为欧几里德查询键距离、RBF 亲和性、局部邻域标准化和自适应 top-k 选择,同时保留标准转换器聚合。

- 链接:[https://arxiv.org/abs/2602.11534](https://arxiv.org/abs/2602.11534)


## 124. [Scalable Best-of-N Selection for Large Language Models via Self-Certainty](https://arxiv.org/abs/2502.18581)


- 会议:NeurIPS2025

- 中文简介:根据其令牌分布与均匀(自确定性)的平均 KL 散度对每个生成的响应进行评分,并可选择将置信度排名与答案频率 Borda 投票结合起来。

- 链接:[https://arxiv.org/abs/2502.18581](https://arxiv.org/abs/2502.18581)


## 125. [Variational Deep Learning via Implicit Regularization](https://arxiv.org/abs/2505.20235)


- 会议:ICLR2026

- 中文简介:用高斯变分分布表示选定的网络权重,在先验处对其进行初始化,并使用 SGD 仅优化预期损失,以便优化器/参数化隐式偏差提供类似 Wasserstein 的正则化器,而不是显式 KL 项。

- 链接:[https://arxiv.org/abs/2505.20235](https://arxiv.org/abs/2505.20235)


## 126. [Each Complexity Deserves a Pruning Policy](https://arxiv.org/abs/2509.23931)


- 会议:NeurIPS2025

- 中文简介:从 VLM 早层视觉-文本 cross-attention 估计互信息作为样本/问题复杂度,将该标量映射到 logistic token-retention 曲线;对曲线积分并缩放以满足指定 token/FLOPs 预算,再逐层保留高价值视觉 token。

- 链接:[https://arxiv.org/abs/2509.23931](https://arxiv.org/abs/2509.23931)


## 127. [Are First-Order Diffusion Samplers Really Slower? A Fast Forward-Value Approach](https://arxiv.org/abs/2512.24927)


- 会议:ICML2026

- 中文简介:采样器在进行扩散模型评估时发生变化:首先使用因果单步预测器(实验使用 DDIM 前瞻)来估计下一个状态,评估该前瞻中的预训练数据/噪声预测器,并在通常的一阶更新中使用该前向值预测。该方法免训练,保留一阶收敛性;它的前导误差与 DDIM 的符号相反。

- 链接:[https://arxiv.org/abs/2512.24927](https://arxiv.org/abs/2512.24927)


## 128. [Mitigating Mismatch within Reference-based Preference Optimization](https://arxiv.org/abs/2602.11902)


- 会议:ICLR2026

- 中文简介:Hybrid-DPO (HyPO) 通过将参考偏好裕度替换为 max(参考裕度, gamma) 来更改 DPO logit,默认情况下使用 gamma=0。因此,非悲观参考保留了 DPO 的近端相对信号,而悲观参考被视为中性,并且策略根据其绝对选择与拒绝裕度进行训练;可选的 softplus 提供流畅的版本。

- 链接:[https://arxiv.org/abs/2602.11902](https://arxiv.org/abs/2602.11902)


## 129. [LoRA vs Full Fine-tuning: An Illusion of Equivalence](https://arxiv.org/abs/2410.21228)


- 会议:NeurIPS2025

- 中文简介:该论文介绍了一种光谱诊断方法,用于将预训练矩阵与其 LoRA 或完全微调版本进行比较。它对两个矩阵进行 SVD,计算与任何预训练奇异向量的最大余弦相似度低于 epsilon 的顶部微调奇异向量作为入侵者维度,然后按因果关系缩放入侵者奇异分量以测试其对下游拟合和预训练遗忘的影响。

- 链接:[https://arxiv.org/abs/2410.21228](https://arxiv.org/abs/2410.21228)


## 130. [Loopholing Discrete Diffusion: Deterministic Bypass of the Sampling Wall](https://arxiv.org/abs/2510.19304)


- 会议:ICLR2026

- 中文简介:漏洞为离散扩散添加了一条确定性的循环潜在路径:每个去噪步骤都会发出采样的标记以及作为下一步条件的连续隐藏状态;两遍自调节训练无需完全展开。

- 链接:[https://arxiv.org/abs/2510.19304](https://arxiv.org/abs/2510.19304)


## 131. [Steering Language Models with Weight Arithmetic](https://arxiv.org/abs/2511.05408)


- 会议:ICLR2026

- 中文简介:对比权重引导在成对的正面和负面行为示例上微调相同的 LLM,减去两个权重增量以获得行为向量,并将缩放向量添加到基本或任务微调权重。

- 链接:[https://arxiv.org/abs/2511.05408](https://arxiv.org/abs/2511.05408)


## 132. [ContrastiveCFG: Guiding Diffusion Sampling by Contrasting Positive and Negative Concepts](https://arxiv.org/abs/2411.17077)


- 会议:ICML2026

- 中文简介:ContrastiveCFG 用对比损失导出的、距离选通的正/负去噪校正取代了朴素的负 CFG:当样本已经远离条件时,逻辑权重会减弱指导,并且在 DDIM 和流量匹配采样中使用相同的规则。

- 链接:[https://arxiv.org/abs/2411.17077](https://arxiv.org/abs/2411.17077)


## 133. [LFQ: Logit-aware Final-block Quantization for Boosting the Generation Quality of Low-Bit Quantized LLMs](https://arxiv.org/abs/2605.29756)


- 会议:ICML2026

- 中文简介:LFQ 在训练后量化期间仅更改最终 Transformer 块的目标。早期的块使用通常的块式 MSE 重建;最后一个块使用全精度和量化 LM-head logits 之间的交叉熵。该方法与现有的 PTQ 量化器兼容,并使用小型校准集。

- 链接:[https://arxiv.org/abs/2605.29756](https://arxiv.org/abs/2605.29756)


## 134. [KL Penalty Control via Perturbation for Direct Preference Optimization](https://arxiv.org/abs/2502.13177)


- 会议:NeurIPS2025

- 中文简介:Epsilon-DPO 在普通 DPO 的基础上添加了实例级 KL 惩罚控制。它通过混合当前/参考 logits 向上和向下扰动 beta,检查选择/拒绝的对数似然比的单调性,并在平均批量更新之前调整每个示例的 beta。扰动估计不需要额外的模型传递。

- 链接:[https://arxiv.org/abs/2502.13177](https://arxiv.org/abs/2502.13177)


## 135. [Token Perturbation Guidance for Diffusion Models](https://arxiv.org/abs/2506.10036)


- 会议:NeurIPS2025

- 中文简介:令牌扰动指导(TPG)是仅限推理的扩散指导。除了正常的降噪器通道之外,它还使用保留范数的排列/混合矩阵对选定的中间标记表示进行洗牌以产生负分数,然后在正分数和负分数之间添加类似 CFG 的残差。没有培训或架构变化。

- 链接:[https://arxiv.org/abs/2506.10036](https://arxiv.org/abs/2506.10036)


## 136. [Measuring the Intrinsic Dimension of Earth Representations](https://arxiv.org/abs/2511.02101)


- 会议:ICLR2026

- 中文简介:内在维度论文测量几何形状,而不是提出新的预测器。对于冻结位置/图像编码器,它对 100,000 个地球坐标进行采样,计算基于 Fisher 的全局 ID 估计器和邻域 ID 估计器(MLE、MOM、TLE),构建本地 ID 地图,并在冻结嵌入上训练浅头,以将表示 ID 与下游地理空间任务相关联。

- 链接:[https://arxiv.org/abs/2511.02101](https://arxiv.org/abs/2511.02101)


## 137. [Reasoning Models Better Express Their Confidence](https://arxiv.org/abs/2505.14489)


- 会议:NeurIPS2025

- 中文简介:该论文通过分离解决方案推理、置信推理和最终的语言化置信箱来评估推理模型的置信度启发。它还截断了早期的思维链,以测试推理长度如何影响校准,并将普通模型与少量慢速思维提示进行比较。

- 链接:[https://arxiv.org/abs/2505.14489](https://arxiv.org/abs/2505.14489)


## 138. [Adaptive Divergence Regularized Policy Optimization for Fine-tuning Generative Models](https://arxiv.org/abs/2510.18053)


- 会议:NeurIPS2025

- 中文简介:ADRPO 使散度系数样本自适应:beta 等于基本系数减去截断优势(相对于批次基线的奖励)。由此产生的正则化策略目标通过用于语言模型的 KL 和用于基于流的图像/音频生成的 Wasserstein-2 进行实例化。

- 链接:[https://arxiv.org/abs/2510.18053](https://arxiv.org/abs/2510.18053)


## 139. [Contrastive Spectral Rectification: Test-Time Defense towards Zero-shot Adversarial Robustness of CLIP](https://arxiv.org/abs/2601.19210)


- 会议:ICML2026

- 中文简介:CSR 是针对冻结的 CLIP/VLM 的免培训测试时间适应。输入的高斯低通版本提供了干净的锚点;余弦一致性门检测对抗性输入,然后有界 PGD 优化扰动输入,将其特征吸引到锚点,同时排斥原始对抗性特征,保留最佳迭代。

- 链接:[https://arxiv.org/abs/2601.19210](https://arxiv.org/abs/2601.19210)


## 140. [Priority-Aware Shapley Value](https://arxiv.org/abs/2602.09326)


- 会议:ICML2026

- 中文简介:优先级感知 Shapley 值 (PASV) 平均优先级 DAG 线性扩展的边际效用,并通过积极的玩家优先级重新加权。该论文使用相邻交换 Metropolis-Hastings 对不可比较的元素对约束分布进行采样,并通过蒙特卡罗估计值,并带有可选的优先级扫描变体。

- 链接:[https://arxiv.org/abs/2602.09326](https://arxiv.org/abs/2602.09326)


## 141. [MaskInversion: Localized Embeddings via Optimization of Explainability Maps](https://arxiv.org/abs/2407.20034)


- 会议:ICLR2026

- 中文简介:MaskInversion 优化了冻结 CLIP/视觉编码器的本地化嵌入标记。该令牌是从分离的 CLS 嵌入初始化的,其可微分可解释性图与具有 Dice 损失的二进制区域掩码相匹配,并且可选的余弦正则化器保留全局上下文;梯度分解加速多个掩模。

- 链接:[https://arxiv.org/abs/2407.20034](https://arxiv.org/abs/2407.20034)


## 142. [On Predictability of Reinforcement Learning Dynamics for Large Language Models](https://arxiv.org/abs/2510.00553)


- 会议:ICLR2026

- 中文简介:该论文研究了 LLM 权重中的低阶 RL 动态。对于每个检查点,它采用 RL-base 更新的顶级 1 SVD 组件,跟踪其规模和方向,并拟合该组件与基准精度之间的偏最小二乘关系。 AlphaRL 以目标精度反转该轨迹以预测未来的更新并将其注入基础模型中。

- 链接:[https://arxiv.org/abs/2510.00553](https://arxiv.org/abs/2510.00553)


## 143. [FairDD: Fair Dataset Distillation](https://arxiv.org/abs/2411.19623)


- 会议:NeurIPS2025

- 中文简介:FairDD 将数据集蒸馏匹配从不平衡的标签方式目标更改为同步的受保护属性匹配:对于每个标签 y,最小化蒸馏集 S_y 和每个受保护组子集 T_y^a 之间的等权距离。相同的目标可以包装分布匹配或梯度匹配蒸馏器,而无需新参数。

- 链接:[https://arxiv.org/abs/2411.19623](https://arxiv.org/abs/2411.19623)


## 144. [Physics of Language Models: Part 4.1, Architecture Design and the Magic of Canon Layers](https://arxiv.org/abs/2512.17351)


- 会议:NeurIPS2025

- 中文简介:Canon Layers 在相邻令牌状态上添加轻量级因果一维卷积,作为每个序列块中选定位置的水平残差链接,允许 Transformer、GLA、Mamba2 和 GDN 堆栈交换本地信息。

- 链接:[https://arxiv.org/abs/2512.17351](https://arxiv.org/abs/2512.17351)


## 145. [Weak-to-Strong Diffusion with Reflection](https://arxiv.org/abs/2502.00473)


- 会议:ICLR2026

- 中文简介:弱到强扩散(W2SD)利用弱去噪器和强去噪器之间的差异作为强到理想校正的估计,反复去噪并通过反演反映来引导强模型。

- 链接:[https://arxiv.org/abs/2502.00473](https://arxiv.org/abs/2502.00473)


## 146. [InftyThink: Breaking the Length Limits of Long-Context Reasoning in Large Language Models](https://arxiv.org/abs/2503.06692)


- 会议:ICLR2026

- 中文简介:InftyThink 执行有界推理段,然后进行全局摘要;下一段以该摘要为条件,允许超出上下文窗口的迭代推理并以答案段结束。

- 链接:[https://arxiv.org/abs/2503.06692](https://arxiv.org/abs/2503.06692)


## 147. [AdaRank: Adaptive Rank Pruning for Enhanced Model Merging](https://arxiv.org/abs/2503.22178)


- 会议:ICLR2026

- 中文简介:AdaRank 使用 SVD 分解任务更新向量,并通过对未标记测试数据进行熵最小化来学习每个奇异组件的二进制掩码,从而在模型合并期间为每个任务和层生成自适应排名。

- 链接:[https://arxiv.org/abs/2503.22178](https://arxiv.org/abs/2503.22178)


## 148. [ActiveDPO: Active Direct Preference Optimization for Sample-Efficient Alignment](https://arxiv.org/abs/2505.19241)


- 会议:ICLR2026

- 中文简介:ActiveDPO 使用 DPO 模型隐式非线性奖励的不确定性来选择偏好查询。响应梯度差异上的神经决斗老虎机协方差对候选三元组进行评分,这些三元组被批量再生、标记和训练。

- 链接:[https://arxiv.org/abs/2505.19241](https://arxiv.org/abs/2505.19241)


## 149. [Characterizing Pattern Matching and Its Limits on Compositional Task Structures](https://arxiv.org/abs/2505.20278)


- 会议:ICLR2026

- 中文简介:该论文将模式匹配形式化为共享上下文下的功能等价,构建替换图和 k 覆盖标准,并测试 Transformer/Mamba 模型是否在受控 2 跳/3 跳任务下学习组合规则。

- 链接:[https://arxiv.org/abs/2505.20278](https://arxiv.org/abs/2505.20278)


## 150. [Embedding Trust: Semantic Isotropy Predicts Nonfactuality in Long-Form Text Generation](https://arxiv.org/abs/2510.21891)


- 会议:ICML2026

- 中文简介:语义各向同性根据模型的采样响应估计真实性:使用现成的编码器嵌入归一化响应向量,计算余弦内核冯诺依曼熵/log-N 分数,并可选择从一次预言机调用中获取分段分数标签。

- 链接:[https://arxiv.org/abs/2510.21891](https://arxiv.org/abs/2510.21891)


## 151. [Hyperbolic Fine-Tuning for LLMs](https://arxiv.org/abs/2410.04010)


- 会议:NeurIPS2025

- 中文简介:HypLoRA 将 token 嵌入映射到洛伦兹流形,对空间坐标应用直接低秩 BA 变换,同时保留流形约束,并映射回冻结的 LLM;曲率可调。

- 链接:[https://arxiv.org/abs/2410.04010](https://arxiv.org/abs/2410.04010)


## 152. [Model Provenance Testing: A Statistical Framework for Black-Box Lineage Detection](https://arxiv.org/abs/2502.00706)


- 会议:NeurIPS2025

- 中文简介:在给定随机提示的情况下,模型来源测试会比较候选子模型和候选父母/控制模型之间的第一个标记一致性,使用带有 Holm-Bonferroni FWER 控制的 z 测试,并声明最相似的重要父模型;拒绝采样和最佳臂查询缩减是可选的扩展。

- 链接:[https://arxiv.org/abs/2502.00706](https://arxiv.org/abs/2502.00706)


## 153. [Gatekeeper: Correctness-Aware Loss for Small-to-Large Model Cascades](https://arxiv.org/abs/2502.19335)


- 会议:NeurIPS2025

- 中文简介:Gatekeeper 使用一种混合损失来训练小型级联模型:在正确回答的示例上进行交叉熵,在不正确的示例上进行 KL 统一,仅在正确时鼓励信心;标准置信度/熵门将低置信度案例推迟到更强的模型。

- 链接:[https://arxiv.org/abs/2502.19335](https://arxiv.org/abs/2502.19335)


## 154. [Causal Head Gating: A Framework for Interpreting Roles of Attention Heads in Transformers](https://arxiv.org/abs/2505.13737)


- 会议:NeurIPS2025

- 中文简介:CHG 冻结 Transformer,并在具有正负限幅 L1 压力的下一个令牌 NLL 下优化每个注意力头的一个软门。比较装有保留压力和去除压力的闸门,将水头分类为促进、干扰或无关;对比 CHG 共同忘记了一种任务格式,同时保留了另一种任务格式。

- 链接:[https://arxiv.org/abs/2505.13737](https://arxiv.org/abs/2505.13737)


## 155. [Improving Model Representation and Reducing KV Cache via Skip Connections with First Value Heads](https://arxiv.org/abs/2510.16807)


- 会议:NeurIPS2025

- 中文简介:SkipV1Former 从第二层起让每层一半 Value heads 复用第一层 Value,另一半照常计算;因此减少 Value 投影和 KV cache,同时把未压缩的第一层信息传给深层。

- 链接:[https://arxiv.org/abs/2510.16807](https://arxiv.org/abs/2510.16807)


## 156. [Reasoning Models Can be Accurately Pruned Via Chain-of-Thought Reconstruction](https://arxiv.org/abs/2509.12464)


- 会议:ICLR2026

- 中文简介:RAC 只改变离线剪枝校准数据:除了 prompt activation,还用被压缩模型自身生成的 on-policy chain-of-thought 激活重构解码阶段;该校准可直接套 SparseGPT、ALPS、WANDA 等剪枝器。

- 链接:[https://arxiv.org/abs/2509.12464](https://arxiv.org/abs/2509.12464)


## 157. [Reasoning on the Manifold: Bidirectional Consistency for Self-Verification in Diffusion Language Models](https://arxiv.org/abs/2604.16565)


- 会议:ICML2026

- 中文简介:BMC 对 dLLM 生成序列做 forward masking 后 backward reconstruction,再比较双向重建一致性作为无需答案的正确性指标;它可用于筛选/拒绝重采样,也可作为逐 token 几何 reward。

- 链接:[https://arxiv.org/abs/2604.16565](https://arxiv.org/abs/2604.16565)


## 158. [Capacity-Aware Inference: Mitigating the Straggler Effect in Mixture of Experts](https://arxiv.org/abs/2503.05066)


- 会议:ICLR2026

- 中文简介:Capacity-Aware Inference 先给每个专家设 capacity,丢弃超载专家的 excess tokens;Expanded Drop 则让 token 在本地候选专家中扩展选择,优先利用低负载专家后再执行容量截断。

- 链接:[https://arxiv.org/abs/2503.05066](https://arxiv.org/abs/2503.05066)


## 159. [Steer Away From Mode Collisions: Improving Composition In Diffusion Models](https://arxiv.org/abs/2509.25940)


- 会议:ICLR2026

- 中文简介:Co3 在扩散采样中用组合/单概念 Tweedie 均值的对比校正削弱 mode collision,可先高噪声 resampling、后低噪声 correcting。

- 链接:[https://arxiv.org/abs/2509.25940](https://arxiv.org/abs/2509.25940)


## 160. [THE END OF MANUAL DECODING: TOWARDS TRULY END-TO-END LANGUAGE MODELS](https://arxiv.org/abs/2510.26697)


- 会议:ICLR2026

- 中文简介:AutoDeco 在冻结 LLM hidden state 上加两个轻量 heads 预测 temperature/top-p,用可微 soft top-p mask 在 reject-sampling 轨迹上训练并动态调节解码。

- 链接:[https://arxiv.org/abs/2510.26697](https://arxiv.org/abs/2510.26697)


## 161. [NerVE: Nonlinear Eigenspectrum Dynamics in LLM Feed-Forward Networks](https://arxiv.org/abs/2603.06922)


- 会议:ICLR2026

- 中文简介:收集 FFN 前后 token activation,求协方差特征谱,用 Spectral Entropy、Participation Ratio、EEE、Jensen–Shannon 诊断非线性表示几何变化。

- 链接:[https://arxiv.org/abs/2603.06922](https://arxiv.org/abs/2603.06922)


## 162. [Test-Time Spectrum-Aware Latent Steering for Zero-Shot Generalization in Vision-Language Models](https://arxiv.org/abs/2511.09809)


- 会议:NeurIPS2025

- 中文简介:对文本类原型矩阵进行 SVD 处理,保留由 Gavish-Donoho 阈值选择的奇异子空间,并使用增强视图上的熵来优化每个测试图像的一个共享低维潜在系数。

- 链接:[https://arxiv.org/abs/2511.09809](https://arxiv.org/abs/2511.09809)


## 163. [Per-example Gradients: a New Frontier for Understanding and Improving Optimizers](https://arxiv.org/abs/2510.00236)


- 会议:ICML2026

- 中文简介:通过在 JAX 差异化计算图中批量缩减之前进行干预,使用图手术/因式分解操作而不是存储所有单独的梯度,公开每个示例的非线性梯度统计数据。

- 链接:[https://arxiv.org/abs/2510.00236](https://arxiv.org/abs/2510.00236)


## 164. [Universal Sequence Preconditioning](https://arxiv.org/abs/2502.06545)


- 会议:NeurIPS2025

- 中文简介:用固定的单项 Chebyshev(或 Legendre)多项式系数对目标序列做短卷积;训练/预测时先学习卷积后的目标,再用同一卷积恢复原目标,从而把隐藏转移矩阵替换为多项式并缩小可学习域。

- 链接:[https://arxiv.org/abs/2502.06545](https://arxiv.org/abs/2502.06545)


## 165. [Activation-Guided Consensus Merging for Large Language Models](https://arxiv.org/abs/2505.14009)


- 会议:NeurIPS2025

- 中文简介:在共享校准语料上比较预训练模型和各微调模型每一层激活的 mutual information,将 MI 归一化为层/任务特定 task-vector 系数,再套用 Task Arithmetic 或 TIES 做参数合并。

- 链接:[https://arxiv.org/abs/2505.14009](https://arxiv.org/abs/2505.14009)


## 166. [Flex-Judge: Text-Only Reasoning Unleashes Zero-Shot Multimodal Evaluators](https://arxiv.org/abs/2505.18601)


- 会议:NeurIPS2025

- 中文简介:从 JudgeLRM 过滤出约 1K 条高质量文本偏好解释,只用这些 think/answer 推理标注微调原本具备多模态编码能力的 Qwen2.5-VL/Omni;推理时不做模态专训,直接评判图像、视频、音频和分子输出。

- 链接:[https://arxiv.org/abs/2505.18601](https://arxiv.org/abs/2505.18601)


## 167. [Beyond DAGs: A Latent Partial Causal Model for Multimodal Learning](https://arxiv.org/abs/2402.06223)


- 会议:ICLR2026

- 中文简介:用带模态特异变量和无向耦合边的 latent partial causal model 描述多模态生成过程;在球面或凸体表示空间中证明 MMCL 可识别耦合潜变量,再对预训练 CLIP 表示做 PCA/FastICA 以获得可解耦表示并用于下游任务。

- 链接:[https://arxiv.org/abs/2402.06223](https://arxiv.org/abs/2402.06223)


## 168. [Unveiling Downstream Performance Scaling of LLMs: A Clustering-Based Perspective](https://arxiv.org/abs/2502.17262)


- 会议:ICLR2026

- 中文简介:COD 先用多个小模型的逐样本 pass-rate 向量表示任务难度,用改进 MeanShift 聚类降低簇内方差;对可外推簇拟合含随机猜测、幂律和饱和项的性能-计算曲线,再用平滑样条把可预测子集映射回完整评测集。

- 链接:[https://arxiv.org/abs/2502.17262](https://arxiv.org/abs/2502.17262)


## 169. [Robust Multi-Objective Controlled Decoding of Large Language Models](https://arxiv.org/abs/2503.08796)


- 会议:ICLR2026

- 中文简介:将多目标控制解码写成策略与对抗目标权重的 KL 正则 maximin 游戏;给定每个目标的 value functions,用凸的 log-sum-exp 优化求最坏权重,在每个 block 从参考模型采样 K 个候选并选加权 value 最大者。

- 链接:[https://arxiv.org/abs/2503.08796](https://arxiv.org/abs/2503.08796)


## 170. [Let's Think in Two Steps: Mitigating Agreement Bias in MLLMs with Self-Grounded Verification](https://arxiv.org/abs/2507.11662)


- 会议:ICLR2026

- 中文简介:SGV 先让 MLLM 基于部分轨迹独立采样关于期望行为的 self-priors,再将这些先验作为上下文验证候选轨迹,避免直接被候选答案的表面一致性带偏。

- 链接:[https://arxiv.org/abs/2507.11662](https://arxiv.org/abs/2507.11662)


## 171. [Steering MoE LLMs via Expert (De)Activation](https://arxiv.org/abs/2509.09660)


- 会议:ICLR2026

- 中文简介:从行为相反的成对输入统计每层专家激活率差,按risk difference挑选行为相关专家;推理时把选中专家的router logit置为最大/最小以激活或停用,不改权重。

- 链接:[https://arxiv.org/abs/2509.09660](https://arxiv.org/abs/2509.09660)


## 172. [Can LLMs Refuse Questions They Do Not Know? Measuring Knowledge-Aware Refusal in Factual Tasks](https://arxiv.org/abs/2510.01782)


- 会议:ICLR2026

- 中文简介:定义Refusal Index为拒答概率与错误概率的Spearman秩相关,并用两遍评估:第一遍允许拒答,第二遍仅对拒答问题强制回答以获得其潜在正确性。

- 链接:[https://arxiv.org/abs/2510.01782](https://arxiv.org/abs/2510.01782)


## 173. [Not-a-Bandit: Provably No-Regret Drafter Selection in Speculative Decoding](https://arxiv.org/abs/2510.20064)


- 会议:ICLR2026

- 中文简介:HedgeSpec 将推测起草者选择视为全信息在线学习问题:在验证选定的草稿块后,相同的目标轨迹为每个其他起草者提供反事实的接受反馈,NormalHedge 在其中进行选择而无需额外的目标模型查询。

- 链接:[https://arxiv.org/abs/2510.20064](https://arxiv.org/abs/2510.20064)


## 174. [AIRE-Prune: Asymptotic Impulse-Response Energy for State Pruning in State Space Models](https://arxiv.org/abs/2602.00534)


- 会议:ICLR2026

- 中文简介:对于每个稳定对角 SSM 模式,计算其封闭式无限水平脉冲响应能量 ||C_i||²||B_i||²/(1-|lambda_i|²),对每一层内的模式进行排名,对排名进行前缀归一化,并应用一个全局阈值来保留前缀并物理删除跨层的低能量状态尾部。

- 链接:[https://arxiv.org/abs/2602.00534](https://arxiv.org/abs/2602.00534)


## 175. [When LLMs get significantly worse: A statistical approach to detect model degradations](https://arxiv.org/abs/2602.10144)


- 会议:ICLR2026

- 中文简介:比较每个基准示例的基线和优化模型结果,形成 2x2 不一致计数,并对条件退化概率应用精确的单边 McNemar/二项式检验;使用合并的、最大下降蒙特卡罗或 Fisher 测试聚合任务级别的 p 值,并使用连续分数的排列变体。

- 链接:[https://arxiv.org/abs/2602.10144](https://arxiv.org/abs/2602.10144)


## 176. [Distribution-Calibrated Inference Time Compute for Thinking LLM-as-a-Judge](https://arxiv.org/abs/2512.03019)


- 会议:ICML2026

- 中文简介:将多次LLM评审输出的A/B/平局计数拟合Bradley--Terry--Davidson三类分布,在校准集上最小化分布式Ranked Probability Score,再用MAE Bayes规则输出最终偏好。

- 链接:[https://arxiv.org/abs/2512.03019](https://arxiv.org/abs/2512.03019)


## 177. [Hair-Trigger Alignment: Black-Box Evaluation Cannot Guarantee Post-Update Alignment](https://arxiv.org/abs/2601.22313)


- 会议:ICML2026

- 中文简介:形式化静态黑盒对齐与单次梯度更新后的对齐,证明在过参数化网络中静态输入输出探测无法保证任意更新集后的鲁棒对齐,并构造能在一次良性更新后暴露隐藏恶意行为的模型。

- 链接:[https://arxiv.org/abs/2601.22313](https://arxiv.org/abs/2601.22313)


## 178. [Joint Model and Data Sparsification via the Marginal Likelihood](https://arxiv.org/abs/2605.29908)


- 会议:ICML2026

- 中文简介:把经典ARD的单一同方差噪声替换为每样本lambda_i,同时学习每特征精度gamma_j;在同一个高斯边缘似然上交替更新两组参数,从而同时收缩无关特征并下权离群样本。

- 链接:[https://arxiv.org/abs/2605.29908](https://arxiv.org/abs/2605.29908)


## 179. [Training Prompt Matters: State-Adaptive Optimization for Robust Fine-Tuning](https://arxiv.org/abs/2606.01967)


- 会议:ICML2026

- 中文简介:每个新任务开始前由paraphraser生成语义等价prompt池,在当前模型上对候选做小子集pre-update loss前向评估,选最低loss提示再进行正常微调,以减少跨任务梯度冲突、遗忘并提升泛化。

- 链接:[https://arxiv.org/abs/2606.01967](https://arxiv.org/abs/2606.01967)


## 180. [Cutting LLM Evaluation Costs with SySRs: A Bandit Algorithm That Provably Exploits Model Similarity](https://arxiv.org/abs/2606.07726)


- 会议:ICML2026

- 中文简介:把模型选择作为best-arm identification:每个Successive Rejects阶段让所有仍存模型在同一批测试题上评测,利用配对差异抵消题目难度并按阶段淘汰最差模型;无需相关性先验或调参。

- 链接:[https://arxiv.org/abs/2606.07726](https://arxiv.org/abs/2606.07726)


## 181. [Parameter Efficient Fine-tuning via Explained Variance Adaptation](https://arxiv.org/abs/2410.07170)


- 会议:NeurIPS2025

- 中文简介:EVA先对下游数据激活做增量SVD,把高解释方差的右奇异向量初始化LoRA的A矩阵;再将所有层的奇异方向按解释方差全局排序,在固定rank预算下自适应分配各层rank,随后进行标准LoRA微调。

- 链接:[https://arxiv.org/abs/2410.07170](https://arxiv.org/abs/2410.07170)


## 182. [Sloth: scaling laws for LLM skills to predict multi-benchmark performance across families](https://arxiv.org/abs/2412.06540)


- 会议:NeurIPS2025

- 中文简介:把多个benchmark分数表示为低维latent skills的loadings与偏置,通过每个模型族的skill截距及共享的log参数量、log训练token和交互项拟合scaling law;用Huber损失和可选单调神经link预测新家族/大模型表现,并可做下游与compute-optimal预测。

- 链接:[https://arxiv.org/abs/2412.06540](https://arxiv.org/abs/2412.06540)


## 183. [Shape it Up! Restoring LLM Safety during Finetuning](https://arxiv.org/abs/2505.17196)


- 会议:NeurIPS2025

- 中文简介:STAR-DSS 使用护栏评估每个生成的前缀的安全性,并动态地将 CE 应用于安全前缀,而不是将 KL 引用丢失应用于不安全的前缀,从而在没有安全数据访问的情况下引导微调远离有害的延续。

- 链接:[https://arxiv.org/abs/2505.17196](https://arxiv.org/abs/2505.17196)


## 184. [Think or Not? Exploring Thinking Efficiency in Large Reasoning Models via an Information-Theoretic Lens](https://arxiv.org/abs/2505.18237)


- 会议:NeurIPS2025

- 中文简介:InfoBias 衡量生成原理与理想原理之间的不匹配,InfoGain 衡量熵减少;当熵/置信度表明进一步思考价值较低时,自适应思考会停止或跳过推理。

- 链接:[https://arxiv.org/abs/2505.18237](https://arxiv.org/abs/2505.18237)


## 185. [Stepsize anything: A unified learning rate schedule for budgeted-iteration training](https://arxiv.org/abs/2505.24452)


- 会议:NeurIPS2025

- 中文简介:从有限迭代预算下的min-max曲率优化推导统一预算感知学习率:给定ηmin、ηmax、预算和单一φ,按阶段使用闭式余弦样调度;不改模型、数据或优化器。

- 链接:[https://arxiv.org/abs/2505.24452](https://arxiv.org/abs/2505.24452)


## 186. [MagCache: Fast Video Generation with Magnitude-Aware Cache](https://arxiv.org/abs/2506.09045)


- 会议:NeurIPS2025

- 中文简介:观察扩散残差r_t=vθ(x_t,t)-x_t的幅值比γ_t跨prompt近似单调且方向稳定;仅用一个校准样本估计γ,按累计误差阈值δ或最大跳步K跳过并缓存中间特征。

- 链接:[https://arxiv.org/abs/2506.09045](https://arxiv.org/abs/2506.09045)


## 187. [Deep Value Benchmark: Measuring Whether Models Generalize Deep Values or Shallow Preferences](https://arxiv.org/abs/2511.02109)


- 会议:NeurIPS2025

- 中文简介:构造confound-then-deconfound基准:训练示例把深层价值与浅层偏好完全相关,测试时交换浅层属性;用模型选择价值对齐选项的DVGR衡量其是否学到深值而非表面偏好。

- 链接:[https://arxiv.org/abs/2511.02109](https://arxiv.org/abs/2511.02109)


## 188. [Hyperparameter Transfer Enables Consistent Gains of Matrix-Preconditioned Optimizers Across Scales](https://arxiv.org/abs/2512.05620)


- 会议:NeurIPS2025

- 中文简介:用最大更新参数化(µP)推导Shampoo、SOAP、Muon、AdaMuon及grafting/blocking等矩阵预条件优化器的宽度、深度和权重衰减缩放规则,从而把小模型调好的学习率迁移到不同规模并稳定获得优化收益。

- 链接:[https://arxiv.org/abs/2512.05620](https://arxiv.org/abs/2512.05620)


## 189. [Sequential Parallel Duality in Prefix Scannable Models](https://arxiv.org/abs/2506.10918)


- 会议:ICLR2026

- 中文简介:定义Prefix-Scannable Model及Sequential-Parallel Duality:将块编码器输出交给任意聚合器,用Blelloch并行prefix scan实现块级并行训练和chunk推理;证明仿射递归层可用结合的仿射单子达到线性并行复杂度,并给出Transformer-PSM。

- 链接:[https://arxiv.org/abs/2506.10918](https://arxiv.org/abs/2506.10918)


## 190. [GPLQ: A General, Practical, and Lightning QAT Method for Vision Transformers](https://arxiv.org/abs/2506.11784)


- 会议:NeurIPS2025

- 中文简介:提出activation-first、weights-later的两阶段量化:先保持权重FP32,仅用一 epoch的4-bit激活QAT和PCA feature-mimicking维持原优化盆地,再用RepQ-ViT/QwT等PTQ快速量化权重到4-bit。

- 链接:[https://arxiv.org/abs/2506.11784](https://arxiv.org/abs/2506.11784)


## 191. [A unified framework for establishing the universal approximation of transformer-type architectures](https://arxiv.org/abs/2506.23551)


- 会议:NeurIPS2025

- 中文简介:把 Transformer 抽象为 token-mixing map 与逐 token 的非线性仿射不变 FFN 交替残差组合;若 mixing 能在有限样本上产生 token distinguishability,则给出 permutation-equivariant UAP。对解析 attention,将验证简化为两样本条件。

- 链接:[https://arxiv.org/abs/2506.23551](https://arxiv.org/abs/2506.23551)


## 192. [Angular Steering: Behavior Control via Rotation in Activation Space](https://arxiv.org/abs/2510.26243)


- 会议:NeurIPS2025

- 中文简介:从 contrastive activation 得到行为方向与互补轴,在其张成的固定二维平面中对每个 normalization 前 activation 做角度旋转;自适应版本只旋转正向投影样本,以连续角度控制行为并减少无关损伤。

- 链接:[https://arxiv.org/abs/2510.26243](https://arxiv.org/abs/2510.26243)


## 193. [CyclicReflex: Improving Reasoning Models via Cyclical Reflection Token Scheduling](https://arxiv.org/abs/2506.11077)


- 会议:ICLR2026

- 中文简介:在解码时识别 reflection token 集合,对这些 token 的 logits 加周期性三角波:前半周期提升探索/反思,后半周期抑制以收敛;仅改 logits,不训练模型,并可与 BoN/beam search 结合。

- 链接:[https://arxiv.org/abs/2506.11077](https://arxiv.org/abs/2506.11077)


## 194. [On the Theoretical Limitations of Embedding-Based Retrieval](https://arxiv.org/abs/2508.21038)


- 会议:ICLR2026

- 中文简介:以单位向量的球面 packing 论证:若 n 个文档的每个 k-subset 都要由查询以 margin γ 实现为 top-k,则需 d ≥ log(binomial(n,k))/log(1+1/γ);再用 free-embedding 优化与真实检索数据验证该下界。

- 链接:[https://arxiv.org/abs/2508.21038](https://arxiv.org/abs/2508.21038)


## 195. [Contrastive Predictive Coding Done Right for Mutual Information Estimation](https://arxiv.org/abs/2510.25983)


- 会议:ICLR2026

- 中文简介:指出 vanilla InfoNCE 只将 density ratio 学到任意 C(y) 倍且对应 K-way JSD;在分类样本中加入 anchor 类(权重 ν>0)消除尺度歧义,得到 Fisher-consistent InfoNCE-anchor,可直接 plug-in 估计 MI,并推广到 proper scoring rules。

- 链接:[https://arxiv.org/abs/2510.25983](https://arxiv.org/abs/2510.25983)


## 196. [What matters for Representation Alignment: Global Information or Spatial Structure?](https://arxiv.org/abs/2512.10794)


- 会议:ICLR2026

- 中文简介:iREPA 通过两个小方式修改了 REPA:用 3x3 Conv2d 投影替换投影 MLP,并在对齐之前对编码器特征进行空间归一化。使用该空间感知目标将扩散表示与外部视觉编码器对齐。

- 链接:[https://arxiv.org/abs/2512.10794](https://arxiv.org/abs/2512.10794)


## 197. [Ubiquity of Emergent Hebbian Dynamics in Regularized Learning](https://arxiv.org/abs/2505.18069)


- 会议:ICML2026

- 中文简介:用 L2 权重衰减解释从平稳性中出现的赫布动力学:在总体平稳性下,梯度平衡给出 G(W)=gamma W,而梯度信号与赫布更新 Wh_a h_a^T 一致。该论文推导了正则化何时产生赫布行为与反赫布行为,并进行了实证检验。

- 链接:[https://arxiv.org/abs/2505.18069](https://arxiv.org/abs/2505.18069)


## 198. [One-shot Conditional Sampling: MMD meets Nearest Neighbors](https://arxiv.org/abs/2509.25507)


- 会议:ICML2026

- 中文简介:使用经验条件 MMD 训练条件生成器 g(meta,x),使用最近邻条件样本来估计目标条件分布。训练后直接生成一个样本,无需迭代MCMC/归一化流采样;理论给出了非渐近和经验收敛界限。

- 链接:[https://arxiv.org/abs/2509.25507](https://arxiv.org/abs/2509.25507)


## 199. [Procedural Pretraining: Warming Up Language Models with Abstract Data](https://arxiv.org/abs/2601.21725)


- 会议:ICML2026

- 中文简介:在程序生成的结构化数据(序列转换、堆栈操作、Dyck 语言、元胞自动机)上简要预训练仅解码器的语言模型,然后继续标准语义预训练。程序阶段可以添加或替换部分语义数据,并具有可选的选择性注意/MLP 转移和混合。

- 链接:[https://arxiv.org/abs/2601.21725](https://arxiv.org/abs/2601.21725)


## 200. [Error Amplification Limits ANN-to-SNN Conversion in Continuous Control](https://arxiv.org/abs/2601.21778)


- 会议:ICML2026

- 中文简介:分析 ANN 到 SNN 转换在连续控制中失败的原因:小的动作错误与步骤和转移状态轨迹相关。跨步残余电位初始化 (CRPI) 在决策步骤之间携带经过修剪、缩放的残余膜电位,以抑制这种相关性,无需训练。

- 链接:[https://arxiv.org/abs/2601.21778](https://arxiv.org/abs/2601.21778)


## 201. [CLAA: Cross-Layer Attention Aggregation for Accelerating LLM Prefill](https://arxiv.org/abs/2602.16054)


- 会议:ICML2026

- 中文简介:用答案相关的oracle注意力估计提示token重要性,在预填充时延后前m层,并对前n层注意力取max进行跨层聚合,再按排名裁剪KV;无需训练。

- 链接:[https://arxiv.org/abs/2602.16054](https://arxiv.org/abs/2602.16054)


## 202. [One Bias After Another: Mechanistic Reward Shaping and Persistent Biases in Language Reward Models](https://arxiv.org/abs/2603.03291)


- 会议:ICML2026

- 中文简介:从奖励模型最终隐藏状态按正负样本均值差学习偏差方向,正交化后将推理激活投影到偏差方向的零空间;以单一干预同时削弱长度、不确定性、位置等proxy偏差。

- 链接:[https://arxiv.org/abs/2603.03291](https://arxiv.org/abs/2603.03291)


## 203. [Distance Adaptive Beam Search for Provably Accurate Graph-Based Nearest Neighbor Search](https://arxiv.org/abs/2505.15636)


- 会议:NeurIPS2025

- 中文简介:在通用图遍历顺序不变的情况下,把固定 beam width 停止规则改为距离规则:当当前待扩展点比已发现的第 k 近点远至少 (1+α) 倍时停止并返回 k 点;α 控制精度/距离计算权衡。

- 链接:[https://arxiv.org/abs/2505.15636](https://arxiv.org/abs/2505.15636)


## 204. [SSG: Scaled Spatial Guidance for Multi-Scale Visual Autoregressive Generation](https://arxiv.org/abs/2602.05534)


- 会议:ICLR2026

- 中文简介:对 VAR 每尺度 logits 做无训练空间引导:由前一尺度 logits 的 DCT 低频与当前 logits 插值高频构造 prior,取当前 logits 与 prior 残差并做闭式 MAP 更新 ell'=ell+beta residual。

- 链接:[https://arxiv.org/abs/2602.05534](https://arxiv.org/abs/2602.05534)


## 205. [Cost-aware Stopping for Bayesian Optimization](https://arxiv.org/abs/2507.12453)


- 会议:ICML2026

- 中文简介:把 Pandora's Box Gittins Index 条件推广到相关 GP BO:后验更新后,若所有未评估点 PBGI 都不优于当前最优值(等价于最大 EI/cost≤1 或 LogEIPC≤0)便停止;高维时加稳定期/moving average。

- 链接:[https://arxiv.org/abs/2507.12453](https://arxiv.org/abs/2507.12453)


## 206. [Expand Neurons, Not Parameters](https://arxiv.org/abs/2510.04500)


- 会议:ICML2026

- 中文简介:Fixed Parameter Expansion 在保持非零参数数目不变时复制神经元,把输入边分配到互不重叠子神经元,并对输出层重新稀疏化;用固定 mask 的宽化降低 feature collisions/superposition。

- 链接:[https://arxiv.org/abs/2510.04500](https://arxiv.org/abs/2510.04500)


## 207. [ManifoldKV: Training-Free KV Cache Compression via Euclidean Outlier Detection](https://arxiv.org/abs/2602.08343)


- 会议:ICML2026

- 中文简介:按 key 到上下文 centroid 的原始 L2 距离给 token 打分并保留 top-K;长上下文时改为滑动窗口局部 centroid,避免全局 centroid dilution。

- 链接:[https://arxiv.org/abs/2602.08343](https://arxiv.org/abs/2602.08343)


## 208. [Stable Deep Reinforcement Learning via Isotropic Gaussian Representations](https://arxiv.org/abs/2602.19373)


- 会议:ICML2026

- 中文简介:在深 RL 表征上加入 SIGReg:投影 embedding 到少量随机方向,匹配每个一维投影到零均值高斯,同时约束协方差各向同性和尾部形状。

- 链接:[https://arxiv.org/abs/2602.19373](https://arxiv.org/abs/2602.19373)


## 209. [Many-Shot CoT-ICL: Making In-Context Learning Truly Learn](https://arxiv.org/abs/2605.13511)


- 会议:ICML2026

- 中文简介:把 many-shot CoT 视作 context 内 test-time learning,用完整 demonstration embedding 的局部曲率定义知识转移平滑度;用 distance+curvature 的 TSP 图和 2-opt 找低曲率顺序。

- 链接:[https://arxiv.org/abs/2605.13511](https://arxiv.org/abs/2605.13511)


## 210. [Reasoning Can Be Restored by Correcting a Few Decision Tokens](https://arxiv.org/abs/2605.16874)


- 会议:ICML2026

- 中文简介:沿 base rollout 计算与 reasoning model 的 token-level CE/reverse-KL disagreement,在高 disagreement(通常早期 planning)位置仅让强模型接管一个 token,随后切回 base;滑窗平滑并按目标 spike ratio 校准预算。

- 链接:[https://arxiv.org/abs/2605.16874](https://arxiv.org/abs/2605.16874)


## 211. [When Softmax Fails at the Top: Extreme‑Value Corrections for InfoNCE](https://arxiv.org/abs/2606.00262)


- 会议:ICML2026

- 中文简介:将 InfoNCE 解释为 top-1 Plackett–Luce/Gumbel 似然;对有界余弦相似度的 hard-negative shortfall 做 anchor-wise Weibull 尾部拟合,并把 Weibull logits 与普通 softmax logits 混合为 WEINCE。每个 batch 估计尾部参数并 stop-gradient,不引入可训练参数。

- 链接:[https://arxiv.org/abs/2606.00262](https://arxiv.org/abs/2606.00262)


## 212. [Geometric and Stochastic Analysis of Discontinuities in Sparse Mixture-of-Experts](https://arxiv.org/abs/2606.19036)


- 会议:ICML2026

- 中文简介:SmoothSMoE 保留 top-k 路由,但对距离第 k 个 logit 不超过 ε 的近边界专家加入平滑的 log-smoothstep soft boost,然后仍取 top-k;边界损失 αε(K−k*) 自适应 ε 以控制平均激活专家数。

- 链接:[https://arxiv.org/abs/2606.19036](https://arxiv.org/abs/2606.19036)


## 213. [List-Level Distribution Coupling with Applications to Speculative Decoding and Lossy Compression](https://arxiv.org/abs/2506.05632)


- 会议:NeurIPS2025

- 中文简介:GLS 用指数随机变量构造 list-level 分布耦合:每个 draft 分布 p 生成 argmin_i S_i/p_i,target 分布 q 在 K 个候选中取全局最小的 argmin_i min_k S_i^k/q_i,从而保持目标边际并提高 list 匹配概率;同一耦合用于多 draft speculative decoding 和有损压缩。

- 链接:[https://arxiv.org/abs/2506.05632](https://arxiv.org/abs/2506.05632)


## 214. [Revisiting Orbital Minimization Method for Neural Operator Decomposition](https://arxiv.org/abs/2510.21952)


- 会议:NeurIPS2025

- 中文简介:OMM 以 tr((I−VVᵀ)^{2p}A)−tr(A) 的多项式目标学习 PSD 矩阵/算子的 top-k eigensubspace,无需显式正交约束;可用 Nested/Sanger 联合或顺序抽取,未有界算子用 inverse-operator trick。

- 链接:[https://arxiv.org/abs/2510.21952](https://arxiv.org/abs/2510.21952)


## 215. [Attributing Response to Context: A Jensen–Shannon Divergence Driven Mechanistic Study of Context Attribution in Retrieval-Augmented Generation](https://arxiv.org/abs/2505.16415)


- 会议:ICLR2026

- 中文简介:ARC-JSD 对 RAG 回答逐句做 context ablation,计算完整上下文与删去该句后每个回答 token 的 Jensen–Shannon divergence 并求和,最高者作为最有影响上下文;可选地用 logit lens 对 attention head/MLP 做相同消融排序和 top-5 gating。

- 链接:[https://arxiv.org/abs/2505.16415](https://arxiv.org/abs/2505.16415)


## 216. [Model Already Knows the Best Noise: Bayesian Active Noise Selection via Attention in Video Diffusion Model](https://arxiv.org/abs/2505.17561)


- 会议:ICLR2026

- 中文简介:BANSA 用多噪声在早期扩散步的 attention 不确定性选 seed:对 M=10 个噪声及 K=10 个 Bernoulli mask 估计 BANSA=熵(平均随机 attention)−平均熵,取最小分数;再按与全层分数的 Pearson 相关选模型层深 d*,其余步骤按普通视频扩散生成。

- 链接:[https://arxiv.org/abs/2505.17561](https://arxiv.org/abs/2505.17561)


## 217. [SFT Doesn’t Always Hurt General Capabilities: Revisiting Domain-Specific Fine-Tuning in LLMs](https://arxiv.org/abs/2509.20758)


- 会议:ICLR2026

- 中文简介:指出小学习率的领域 SFT 可保留通用能力,并提出 TALR:按 token NLL 计算 stop-gradient 权重 w∝exp(-ℓ/τ)=p^(1/τ),用批次中位数动态调 τ 后重加权 SFT 损失。

- 链接:[https://arxiv.org/abs/2509.20758](https://arxiv.org/abs/2509.20758)


## 218. [Beyond Value Functions: Single-Loop Bilevel Optimization under Flatness Conditions](https://arxiv.org/abs/2507.20400)


- 会议:NeurIPS2025

- 中文简介:PBGD-Free 以 penalty formulation 的一个下层梯度步得到 $y^\\gamma$,再用 $ abla_x f(x,y^\\gamma)$ 更新 x;它完全绕过 value-function gradient/内层求解,并在 $(\\delta,lpha)$-flatness 下证明收敛。

- 链接:[https://arxiv.org/abs/2507.20400](https://arxiv.org/abs/2507.20400)


## 219. [Auditing Black-Box LLM APIs with a Rank-Based Uniformity Test](https://arxiv.org/abs/2506.06975)


- 会议:ICLR2026

- 中文简介:RUT 审核黑盒 LLM API,方法是为同一提示绘制一个目标完成和 m 个参考完成,使用选定的本地评分模型对所有响应进行评分,并使用目标的随机排名作为均匀性样本。对等级的 Cramer-von Mises 检验拒绝目标输出和参考输出具有相同分布的零值。

- 链接:[https://arxiv.org/abs/2506.06975](https://arxiv.org/abs/2506.06975)


## 220. [PrefixMemory-Tuning: Modernizing Prefix-Tuning by Decoupling the Prefix from Attention](https://arxiv.org/abs/2506.13674)


- 会议:ICLR2026

- 中文简介:PrefixMemory-Tuning 将学习到的前缀存储为外部矩阵 M,而不是键/值向量序列。对于输入查询 q,特征图 phi(q) 产生偏差 phi(q)^T M,该偏差被添加到注意力 logits 或相应的上下文计算中;仅训练 M 和特征图,保持基本 LLM 不变。

- 链接:[https://arxiv.org/abs/2506.13674](https://arxiv.org/abs/2506.13674)


## 221. [Constrained Decoding of Diffusion LLMs with Context-Free Grammars](https://arxiv.org/abs/2508.10111)


- 会议:ICLR2026

- 中文简介:对于每个自回归或扩散 LM 令牌提案,解码器将上下文无关语法与一组可能的完成相交,并且仅当交集非空时才接受该提案;然后它可以对有效的完成进行采样。这为多区域填充和扩散解码提供了语法约束,而无需重新训练模型。

- 链接:[https://arxiv.org/abs/2508.10111](https://arxiv.org/abs/2508.10111)


## 222. [Variation in Verification: Understanding Verification Dynamics in Large Language Models](https://arxiv.org/abs/2509.17995)


- 会议:ICLR2026

- 中文简介:验证的变化是一种测量协议,而不是新的学习模型:对每个问题的一组固定响应进行采样,估计生成器通过率和问题难度,然后随着难度和生成器/验证器能力的变化,测量验证器的真阳性/真阴性率和测试时间缩放保留率。

- 链接:[https://arxiv.org/abs/2509.17995](https://arxiv.org/abs/2509.17995)


## 223. [Multi-modal Data Spectrum: Multi-modal Datasets are Multi-dimensional](https://arxiv.org/abs/2509.23499)


- 会议:ICLR2026

- 中文简介:对成对图文输入分别执行正常配对、打乱文本、打乱图像、同时打乱四种条件,用同一 MLLM 的输出多数票估计图像/文本单模态捷径与真正的跨模态依赖。

- 链接:[https://arxiv.org/abs/2509.23499](https://arxiv.org/abs/2509.23499)


## 224. [ARMOR: High-Performance Semi-Structured Pruning via Adaptive Matrix Factorization](https://arxiv.org/abs/2510.05528)


- 会议:ICLR2026

- 中文简介:将每层权重近似为块对角低秩因子 A·(W'⊙M)·B,固定 2:4 mask;交替优化因子和用 NoWag 数据感知代理损失贪心更新 mask,实现一次性半结构化剪枝。

- 链接:[https://arxiv.org/abs/2510.05528](https://arxiv.org/abs/2510.05528)


## 225. [Dynamics-Predictive Sampling for Active RL Finetuning of Large Reasoning Models](https://arxiv.org/abs/2603.10887)


- 会议:ICLR2026

- 中文简介:把每道题在 rollout 中的进展抽象为 all-wrong、mixed、all-correct 三态 HMM,在线用带衰减的 Dirichlet 转移后验估计进展,并优先采样预测会进入 mixed 的题目。

- 链接:[https://arxiv.org/abs/2603.10887](https://arxiv.org/abs/2603.10887)


## 226. [IGU-LoRA: Adaptive Rank Allocation via Integrated Gradients and Uncertainty-Aware Scoring](https://arxiv.org/abs/2603.13792)


- 会议:ICLR2026

- 中文简介:在 LoRA 中沿零权重到当前权重的路径用随机积分梯度估计参数重要性,按 epoch 聚合并用均值/不确定性 EMA 得到 SNR 分数,再用奇异值排名决定各模块保留的 rank。

- 链接:[https://arxiv.org/abs/2603.13792](https://arxiv.org/abs/2603.13792)


## 227. [Learning to Adapt: In-Context Learning Beyond Stationarity](https://arxiv.org/abs/2604.10946)


- 会议:ICLR2026

- 中文简介:在 Gated Linear Attention 的递归状态中加入随位置衰减的 forgetting factor,令 S_i=lambda S_{i-1}+v_i k_i^T,使 in-context learner 能跟踪随时间变化的线性回归参数。

- 链接:[https://arxiv.org/abs/2604.10946](https://arxiv.org/abs/2604.10946)


## 228. [Adaptive Conformal Anomaly Detection with Time Series Foundation Models for Signal Monitoring.](https://arxiv.org/abs/2604.20122)


- 会议:ICLR2026

- 中文简介:把预训练时间序列模型的多步预测误差作为 nonconformity score,以 conformal p-value 做检测;用过去分数与目标均匀分布的 W1 距离学习自适应权重并计算加权分位数。

- 链接:[https://arxiv.org/abs/2604.20122](https://arxiv.org/abs/2604.20122)


## 229. [Dirichlet-Prior Shaping: Guiding Expert Specialization in Upcycled MoEs](https://arxiv.org/abs/2510.01185)


- 会议:ICML2026

- 中文简介:对 batch 中每个 MoE router 概率 p_k 的经验 CDF 与目标 Beta(alpha_k,A-alpha_k) CDF 做 Cramér–von Mises 距离,作为 Dirichlet-Prior Shaping Loss 正则,使专家分工遵循对称或非对称 Dirichlet 先验。

- 链接:[https://arxiv.org/abs/2510.01185](https://arxiv.org/abs/2510.01185)


## 230. [SpatialJB: How Text Distribution Art Becomes The "Jailbreak Key" for LLM Guardrails](https://arxiv.org/abs/2601.09321)


- 会议:ICML2026

- 中文简介:SpatialJB 是一种推理时越狱表示形式,它将有害的指令或答案放入二维空间模板(离合诗、遥画、中心、楼梯、角落或多语言随机化)中。该布局保留了人类可读性,同时打破了护栏使用的序列化令牌邻接;可选的积极/思考指导可增加攻击强度。 SpatialD 反转安全分类器之前的布局作为防御。

- 链接:[https://arxiv.org/abs/2601.09321](https://arxiv.org/abs/2601.09321)


## 231. [FAN: Fourier Analysis Networks](https://arxiv.org/abs/2410.02675)


- 会议:NeurIPS2025

- 中文简介:FAN 用插入层替换了 MLP 模块,该插入层将学习的傅里叶特征(余弦/正弦投影)与非线性残差分支一起应用,保留线性输出并使用可调傅里叶特征分数。

- 链接:[https://arxiv.org/abs/2410.02675](https://arxiv.org/abs/2410.02675)


## 232. [EUGens: Efficient, Unified and General Dense Layers](https://arxiv.org/abs/2410.09771)


- 会议:NeurIPS2025

- 中文简介:EUGen 解开权重行并输入到随机特征图中,将 Hadamard 乘积连接到 k 度(以及可选的输入范数),并获取它们的点积;固定随机特征给出无偏多项式 FFL 近似,而学习投影则改进拟合替换。

- 链接:[https://arxiv.org/abs/2410.09771](https://arxiv.org/abs/2410.09771)


## 233. [Revisiting Residual Connections: Orthogonal Updates for Stable and Efficient Deep Networks](https://arxiv.org/abs/2505.11881)


- 会议:NeurIPS2025

- 中文简介:对每个残差模块输出,减去其沿当前残差流x_n的投影,只把正交分量加入主流:s=<x_n,f(x_n)>/(||x_n||²+ε),x_{n+1}=x_n+f(x_n)-s x_n。这样直接阻止更新改变当前特征范数方向。

- 链接:[https://arxiv.org/abs/2505.11881](https://arxiv.org/abs/2505.11881)


## 234. [Extrapolation by Association: Length Generalization Transfer In Transformers](https://arxiv.org/abs/2506.09251)


- 会议:NeurIPS2025

- 中文简介:论文发现并验证一种相关任务多任务训练机制:让目标任务只见短长度、结构相近的辅助任务见更长长度,共享Transformer参数训练;辅助任务的长度外推能力会迁移到目标任务,并可由共享attention head与预训练进度解释。

- 链接:[https://arxiv.org/abs/2506.09251](https://arxiv.org/abs/2506.09251)


## 235. [Visual Anagrams Reveal Hidden Differences in Holistic Shape Processing Across Vision Models](https://arxiv.org/abs/2507.00493)


- 会议:NeurIPS2025

- 中文简介:生成具有相同局部扩散补丁但形成对象字谜的空间排列的两个图像,然后测试分类器是否共同保留两个对象标签。

- 链接:[https://arxiv.org/abs/2507.00493](https://arxiv.org/abs/2507.00493)


## 236. [Pool Me Wisely: On the Effect of Pooling in Transformer-Based Models](https://arxiv.org/abs/2510.03339)


- 会议:NeurIPS2025

- 中文简介:通过表达信息损失/表现力界限来分析和选择池算子,然后在现有表示之上使用固定或轻度学习的池化头。

- 链接:[https://arxiv.org/abs/2510.03339](https://arxiv.org/abs/2510.03339)


## 237. [Geometry of Decision Making in Language Models](https://arxiv.org/abs/2511.20315)


- 会议:NeurIPS2025

- 中文简介:对于冻结解码器 LM,收集每层后的最后一个令牌隐藏状态,使用邻域估计器估计内在维度,并将生成的分层几何与 logit-lens MCQA 精度进行比较。

- 链接:[https://arxiv.org/abs/2511.20315](https://arxiv.org/abs/2511.20315)


## 238. [Shrinking the Variance: Shrinkage Baselines for Reinforcement Learning with Verifiable Rewards](https://arxiv.org/abs/2511.03710)


- 会议:ICML2026

- 中文简介:把每 prompt 的 leave-one-out reward 均值向 batch 级 leave-one-out 均值做 James–Stein 式收缩,系数由批内估计的 prompt 间方差与 rollout 方差闭式计算;该 baseline 与被估计 reward 独立,故保持 policy gradient 无偏,同时降低低 rollout 场景的估计 MSE/方差。

- 链接:[https://arxiv.org/abs/2511.03710](https://arxiv.org/abs/2511.03710)


## 239. [Differentiation Through Black-Box Quadratic Programming Solvers](https://arxiv.org/abs/2410.06324)


- 会议:NeurIPS2025

- 中文简介:dQP 对任意黑盒 QP solver 的解计算活动约束,用残差阈值识别 active set,分解缩减的等式约束 KKT 系统,并复用该因子化显式求解解对参数的导数。

- 链接:[https://arxiv.org/abs/2410.06324](https://arxiv.org/abs/2410.06324)


## 240. [Plug-and-Play Context Feature Reuse for Efficient Masked Generation](https://arxiv.org/abs/2505.19089)


- 会议:NeurIPS2025

- 中文简介:ReCAP 将 masked generative model 的迭代解码交替分成 Full-FE 和 Local-FE:Full-FE 计算全部 attention/KV,Local-FE 只为新解码 token 重算 QKV 并复用未改变上下文的 cached K/V,以较低成本增加解码步数。

- 链接:[https://arxiv.org/abs/2505.19089](https://arxiv.org/abs/2505.19089)


## 241. [STORK: Faster Diffusion and Flow Matching Sampling by Resolving both Stiffness and Structure-Dependence](https://arxiv.org/abs/2505.24210)


- 会议:ICLR2026

- 中文简介:STORK是训练免费的扩散/流匹配ODE采样器:用稳定化Runge–Kutta处理刚性,用过去速度的Taylor/有限差分生成虚拟函数评估,从而在较少真实NFE下保持高阶精度和结构独立性。

- 链接:[https://arxiv.org/abs/2505.24210](https://arxiv.org/abs/2505.24210)


## 242. [Query-Level Uncertainty in Large Language Models](https://arxiv.org/abs/2506.09669)


- 会议:ICLR2026

- 中文简介:Internal Confidence在不生成答案也不训练的情况下,对每个查询直接读取模型各层各token的Yes/No unembedding概率,并用衰减的局部性权重聚合为查询级不确定度。

- 链接:[https://arxiv.org/abs/2506.09669](https://arxiv.org/abs/2506.09669)


## 243. [ProxyAttn: Guided Sparse Attention via Representative Heads](https://arxiv.org/abs/2509.24745)


- 会议:ICLR2026

- 中文简介:ProxyAttn在长上下文prefill中沿attention-head维压缩:每组用代表proxy head计算token/block重要性并max-pool共享分数,再依据每头累计概率在线分配不同block预算,生成细粒度稀疏mask。

- 链接:[https://arxiv.org/abs/2509.24745](https://arxiv.org/abs/2509.24745)


## 244. [Diverse Text-to-Image Generation via Contrastive Noise Optimization](https://arxiv.org/abs/2510.03813)


- 会议:ICLR2026

- 中文简介:Contrastive Noise Optimization在扩散采样前优化一批初始高斯噪声:用初始Tweedie clean-latent作固定正样本,在Tweedie空间以InfoNCE同时吸引自身、排斥同批其他样本;用gamma调吸引力、adaptive pooling和stop-gradient降低开销,随后照常采样。

- 链接:[https://arxiv.org/abs/2510.03813](https://arxiv.org/abs/2510.03813)


## 245. [AWM: Accurate Weight-Matrix Fingerprint for Large Language Models](https://arxiv.org/abs/2510.06738)


- 会议:ICLR2026

- 中文简介:从两个模型共享词表的 embedding 余弦相似矩阵用线性分配/Hungarian 算法恢复词序与符号签名,再对跨模型对齐后的 Q/K 权重逐层计算 unbiased linear CKA 并聚合为指纹相似度。

- 链接:[https://arxiv.org/abs/2510.06738](https://arxiv.org/abs/2510.06738)


## 246. [Optimal Aggregation of LLM and PRM Signals for Efficient Test-Time Scaling](https://arxiv.org/abs/2510.13918)


- 会议:ICLR2026

- 中文简介:将 LLM 的题目可靠性与 PRM 分数的正确/错误似然比相加,得到 response vote 的最优 log-weight;实践中用 KDE 或参数化函数从小规模标注 calibration 集估计该权重,再做加权多数投票。

- 链接:[https://arxiv.org/abs/2510.13918](https://arxiv.org/abs/2510.13918)


## 247. [Beyond Pairwise: Empowering LLM Alignment With (Ranked) Choice Modeling](https://arxiv.org/abs/2510.23631)


- 会议:ICLR2026

- 中文简介:将 preference optimization 统一为 ranked-choice maximum likelihood:用 Plackett-Luce/MNL 或 Mallows-RMJ 对完整排序、top-k、single-best 与 pairwise 选择建模,再以熵正则/平滑和标准 LM likelihood 做对齐。

- 链接:[https://arxiv.org/abs/2510.23631](https://arxiv.org/abs/2510.23631)


## 248. [From Curiosity to Caution: Mitigating Reward Hacking for Best-of-$N$ with Pessimism](https://arxiv.org/abs/2604.04648)


- 会议:ICLR2026

- 中文简介:冻结 reward model 的中间 hidden feature 作为 target,训练轻量 predictor 在 base-model 典型 prompt-response 上拟合该 feature;以 prediction error 作为 OOD uncertainty,从 reward score 中减去 lambda 倍 uncertainty 后进行 Best-of-N 选择。

- 链接:[https://arxiv.org/abs/2604.04648](https://arxiv.org/abs/2604.04648)


## 249. [Calibrating Decision Robustness via Inverse Conformal Risk Control](https://arxiv.org/abs/2510.07750)


- 会议:ICML2026

- 中文简介:CREME 使用逆共形风险控制:决策不确定性集的嵌套族通过有限样本修正的经验风险上限进行校准,然后在决策者选择后进行帕累托剪枝;分割重新校准处理选择。

- 链接:[https://arxiv.org/abs/2510.07750](https://arxiv.org/abs/2510.07750)


## 250. [InfoFlow KV: Information-Flow-Aware KV Recomputation for Long Context](https://arxiv.org/abs/2603.05353)


- 会议:ICML2026

- 中文简介:InfoFlow KV 对提示进行分块,使用本地 RoPE 计算每个块的注意力密度分数,然后在完整的全局 RoPE 定位上下文中重新计算最高比率标记的键和值,并替换它们的缓存条目。可选的基于密度的块重新排序之后是重新选择。

- 链接:[https://arxiv.org/abs/2603.05353](https://arxiv.org/abs/2603.05353)


## 251. [From Backward Spreading to Forward Replay: Revisiting Target Construction in LLM Parameter Editing](https://arxiv.org/abs/2605.00358)


- 会议:ICML2026

- 中文简介:前向重放取代了 LTE/MEMIT 式编辑中的后向传播目标插值:优化第一个决定性层的目标隐藏状态,通过干预 Transformer 块向前传播它,并使用相同的封闭式权重更新在后面的决定性层重放传播的目标。

- 链接:[https://arxiv.org/abs/2605.00358](https://arxiv.org/abs/2605.00358)


## 252. [Revisiting Parameter-Based Knowledge Editing in Large Language Models: Theoretical Limits and Empirical Evidence](https://arxiv.org/abs/2606.00570)


- 会议:ICML2026

- 中文简介:论文给出了参数编辑的几何失效机制:维度崩溃使得低方差隐藏方向变得脆弱,因此局部权重更新在那里相对放大;连续编辑会导致表征失真并与能力崩溃相关。然后它对编辑方法和外部存储器比较器进行基准测试。

- 链接:[https://arxiv.org/abs/2606.00570](https://arxiv.org/abs/2606.00570)


## 253. [Simplicity Prevails: Rethinking Negative Preference Optimization for LLM Unlearning](https://arxiv.org/abs/2410.07163)


- 会议:NeurIPS2025

- 中文简介:SimNPO 删除了 NPO 的参考模型似然比,并使用无参考、长度归一化的偏好损失和忘记完成的 sigmoid 梯度权重,保留了保留集的正则化项。

- 链接:[https://arxiv.org/abs/2410.07163](https://arxiv.org/abs/2410.07163)


## 254. [A Partition Cover Approach to Tokenization](https://arxiv.org/abs/2501.06246)


- 会议:NeurIPS2025

- 中文简介:该论文将标记化表述为分区覆盖问题,并提出了 GreedTok:在混合整数公式下重复选择具有最佳有效非重叠相邻覆盖范围的子串标记,然后根据学习到的优先级进行编码。它还提供 NP 硬度和宽松的加权最大覆盖视图。

- 链接:[https://arxiv.org/abs/2501.06246](https://arxiv.org/abs/2501.06246)


## 255. [Twilight: Adaptive Attention Sparsity with Hierarchical Top-$p$ Pruning](https://arxiv.org/abs/2502.02770)


- 会议:NeurIPS2025

- 中文简介:Twilight 分层修剪注意力:保守的 top-k 选择器首先保留候选令牌,然后 INT4 键缓存估计注意力,累积的 top-p 阈值保留最小的足够令牌集,并具有负载平衡的稀疏内核和对 GQA 的分组支持。

- 链接:[https://arxiv.org/abs/2502.02770](https://arxiv.org/abs/2502.02770)


## 256. [Rethinking Fine-Tuning when Scaling Test-Time Compute: Limiting Confidence Improves Mathematical Reasoning](https://arxiv.org/abs/2502.07154)


- 会议:NeurIPS2025

- 中文简介:直接覆盖优化(DCO)用 pass@N 对齐目标取代了普通的 CE 微调,其置信正则化器降低了已经有信心的答案的权重; DCO 步骤应用每个定理的有效通过预算策略,DCOa 通过采样估计思想链覆盖范围。

- 链接:[https://arxiv.org/abs/2502.07154](https://arxiv.org/abs/2502.07154)


## 257. [The Unreasonable Effectiveness of Entropy Minimization in LLM Reasoning](https://arxiv.org/abs/2505.15134)


- 会议:NeurIPS2025

- 中文简介:以 token-level entropy minimization 为统一原则:EM-FT 在无标注采样输出上微调,EM-RL 将负熵作为轨迹奖励,EM-INF 对每步 logits 做少量熵梯度下降而不更新参数。

- 链接:[https://arxiv.org/abs/2505.15134](https://arxiv.org/abs/2505.15134)


## 258. [Preference Optimization by Estimating the Ratio of the Data Distribution](https://arxiv.org/abs/2505.19601)


- 会议:NeurIPS2025

- 中文简介:把 preference likelihood ratio matching 写成一般 Bregman divergence 损失;DPO 是 logistic 特例,并用 Basu power/BPO 及缩放梯度对高置信偏好进行可控加权。

- 链接:[https://arxiv.org/abs/2505.19601](https://arxiv.org/abs/2505.19601)


## 259. [VLMs have Tunnel Vision: Evaluating Nonlocal Visual Reasoning in Leading VLMs](https://arxiv.org/abs/2507.13361)


- 会议:NeurIPS2025

- 中文简介:用程序生成的几何对象/网格/电路图及严格变体构成三类可控 nonlocal visual reasoning 任务,按 exact accuracy、链长、距离/交叉效应和人类基线评估 VLM,并破坏颜色/连通性 shortcut。

- 链接:[https://arxiv.org/abs/2507.13361](https://arxiv.org/abs/2507.13361)


## 260. [Bridging Human and LLM Judgments: Understanding and Narrowing the Gap](https://arxiv.org/abs/2508.12792)


- 会议:NeurIPS2025

- 中文简介:从黑盒 LLM 对每个 prompt/output 的 ordinal 概率(token logprob 或多次 CoT sampling)反解潜在 LLM score/cutoffs,再以少量 human ordinal labels 拟合 Z^l=βZ^h+γᵀX 的 ordered-logit;输出校准 human probabilities、bias 检验和 FDR。

- 链接:[https://arxiv.org/abs/2508.12792](https://arxiv.org/abs/2508.12792)


## 261. [Breaking the Gradient Barrier: Unveiling Large Language Models for Strategic Classification](https://arxiv.org/abs/2511.06979)


- 会议:NeurIPS2025

- 中文简介:GLIM 用预训练 LLM 的 in-context learning 以 forward-only attention 隐式模拟 strategic classification 的双层优化:前缀示例中的 self-attention 改写 agent feature 表示执行 strategic manipulation,再在同一 prompt 中更新 decision-rule 预测;理论把线性 self-attention update 对齐梯度步。

- 链接:[https://arxiv.org/abs/2511.06979](https://arxiv.org/abs/2511.06979)


## 262. [Dynamical Properties of Tokens in Self-Attention and Effects of Positional Encoding](https://arxiv.org/abs/2512.03058)


- 会议:NeurIPS2025

- 中文简介:把 self-attention 的深层迭代写成 continuous-time token ODE,以 A=W(Vᵀ)⁻¹ 与 W 的对称部分定理判定 token 收敛/发散;据此在 RoPE 的 query-key 矩阵加入可学习 λI 或 λA 正则,抑制 convergence 并提升语言/视觉 Transformer 表现。

- 链接:[https://arxiv.org/abs/2512.03058](https://arxiv.org/abs/2512.03058)


## 263. [Discretization-free Multicalibration through Loss Minimization over Tree Ensembles](https://arxiv.org/abs/2505.17435)


- 会议:NeurIPS2025

- 中文简介:冻结任意黑盒预测器 f0,把其预测值阈值与群组指示拼成特征,用深度二的决策树集成最小化平方损失,从而直接得到离散化无关的 multicalibrated 后处理器;理论在 loss-saturation 条件下给出校准保证。

- 链接:[https://arxiv.org/abs/2505.17435](https://arxiv.org/abs/2505.17435)


## 264. [Beyond the Surface: Enhancing LLM-as-a-Judge Alignment with Human via Internal Representations](https://arxiv.org/abs/2508.03550)


- 会议:NeurIPS2025

- 中文简介:LAGER 不只读取最终 score token,而是聚合 LLM embedding 层和所有 decoder 层的 score-token logits:按可学习层权重合成分布,softmax 后取期望作为后处理 judge 分数;骨干冻结,可选用每个 backbone 的 1,000 条 HelpSteer 验证集轻量调层权重。

- 链接:[https://arxiv.org/abs/2508.03550](https://arxiv.org/abs/2508.03550)


## 265. [Why Masking Diffusion Works: Condition on the Jump Schedule for Improved Discrete Diffusion](https://arxiv.org/abs/2506.08316)


- 会议:NeurIPS2025

- 中文简介:提出 SCUD:为离散扩散显式引入常速率 jump-event schedule,令 schedule 的先验与后验一致,只让 denoiser 学习给定事件计数下的前一状态;用 schedule-conditioned ELBO/KL 替代普通 masking 目标,并可插入结构化图/替换矩阵扩散。

- 链接:[https://arxiv.org/abs/2506.08316](https://arxiv.org/abs/2506.08316)


## 266. [Balanced LoRA: Removing Parameter Invariance to Accelerate Convergence](https://arxiv.org/abs/2605.31484)


- 会议:ICML2026

- 中文简介:在每次 Adam/optimizer 更新后对 LoRA 因子做 balancing projection:对 AB 的 reduced SVD 重新写成 U S^{1/2} 与 S^{1/2} V^T,保持产品不变并满足 A^T A=B B^T;理论表明 balanced minimizer 改善 Hessian 条件数/渐近收敛。

- 链接:[https://arxiv.org/abs/2605.31484](https://arxiv.org/abs/2605.31484)


## 267. [PLD: A Choice-Theoretic List-Wise Knowledge Distillation](https://arxiv.org/abs/2506.12542)


- 会议:NeurIPS2025

- 中文简介:将教师 logits 按真实标签优先再按教师置信度排序,形成教师最优 permutation;以教师 softmax 置信度对每个位置的 Plackett–Luce 负对数似然加权,作为唯一的知识蒸馏损失训练学生。

- 链接:[https://arxiv.org/abs/2506.12542](https://arxiv.org/abs/2506.12542)


## 268. [Navigating the Accuracy-Size Trade-Off with Flexible Model Merging](https://arxiv.org/abs/2505.23209)


- 会议:ICLR2026

- 中文简介:按同一预训练基座的 task-vector cosine 相似度,把已微调模型拆成层级 block;每轮选择与当前组最小 cosine 最大的模型/块并用 DSU/SLINK 合并,随后在 block 级调用任意 data-free merger(TA/TIES/PCB/TSVM/EMR 等)以得到指定大小。

- 链接:[https://arxiv.org/abs/2505.23209](https://arxiv.org/abs/2505.23209)


## 269. [ImagenWorld: Stress-Testing Image Generation Models with Explainable Human Evaluation on Open-ended Real-World Tasks](https://arxiv.org/abs/2603.27862)


- 会议:ICLR2026

- 中文简介:建立 ImagenWorld 开放真实任务图像生成/编辑 benchmark:用统一的六类任务、六类主题、条件集合和四项 1–5 人类标准,结合三人标注、SoM 对象问题标签、Gemini VLM 评分及 CLIP/LPIPS 辅助,比较 14 个模型。

- 链接:[https://arxiv.org/abs/2603.27862](https://arxiv.org/abs/2603.27862)


## 270. [Bridging Critical Gaps in Convergent Learning: How Representational Alignment Evolves Across Layers, Training, and Distribution Shifts](https://arxiv.org/abs/2502.18710)


- 会议:NeurIPS2025

- 中文简介:用固定的表示相似性分析流程比较网络各层:对层表示做线性回归、正交 Procrustes、排列/soft matching(卷积特征先处理中心像素),以层深、训练时间和 OOD 分布追踪代表空间的对齐演化。

- 链接:[https://arxiv.org/abs/2502.18710](https://arxiv.org/abs/2502.18710)


## 271. [Language in the Flow of Time: Time-Series-Paired Texts Weaved into a Unified Temporal Narrative](https://arxiv.org/abs/2502.08942)


- 会议:ICLR2026

- 中文简介:用预训练 LLM 将每个时间戳的配对文本嵌入映射为低维辅助时间序列变量(TaTS),拼接到任意时间序列 backbone 并联合训练 MLP;另用 lag-similarity FFT 与 TT-Wasserstein 做 temporal-text alignment 诊断。

- 链接:[https://arxiv.org/abs/2502.08942](https://arxiv.org/abs/2502.08942)


## 272. [Stability Analysis of Sharpness-Aware Minimization](https://arxiv.org/abs/2301.06308)


- 会议:ICML2026

- 中文简介:围绕既有 SAM 梯度在鞍点附近的动力学做统一稳定性分析:推导 SAM 将 saddle 变为 attractor 的 rho 条件,比较随机 SAM/SGD 扩散与逃逸速度,并分析 momentum、batch 对扩散的影响。

- 链接:[https://arxiv.org/abs/2301.06308](https://arxiv.org/abs/2301.06308)


## 273. [Diving into Kronecker Adapters: Component Design Matters](https://arxiv.org/abs/2602.01267)


- 会议:ICML2026

- 中文简介:把 LoRA 的低秩更新改成多项 Kronecker 因子之和 W=W0+Σ B^(i)⊗A^(i),并通过 Kronecker-SVD 对齐;用 r1、r2 和项数 r 的组件设计与 α/√(r r2) 缩放在固定参数预算下提升适配能力。

- 链接:[https://arxiv.org/abs/2602.01267](https://arxiv.org/abs/2602.01267)


## 274. [On Vanishing Gradients, Over-Smoothing, and Over-Squashing in GNNs: Bridging Recurrent and Graph Learning](https://arxiv.org/abs/2502.10818)


- 会议:NeurIPS2025

- 中文简介:把消息传递层改写为状态空间递推 H^(k+1,T)=ΛH^(k,T)+B Fθ(H^k,k)^T;固定/调节 Λ 的谱控制梯度和过平滑,B 对消息注入做门控,可包裹 GCN/GAT。

- 链接:[https://arxiv.org/abs/2502.10818](https://arxiv.org/abs/2502.10818)


## 275. [CTC-DRO: Robust Optimization for Reducing Language Disparities in Speech Recognition](https://arxiv.org/abs/2502.01777)


- 会议:ICLR2026

- 中文简介:将 CTC 的可变时长 group loss 按总音频时长匹配成批,再用平滑 group-DRO 更新 qg∝qg exp(ηq Lg/(qg+α)),以少量标量组权重压低最差语言错误率。

- 链接:[https://arxiv.org/abs/2502.01777](https://arxiv.org/abs/2502.01777)


## 276. [vCache: Verified Semantic Prompt Caching](https://arxiv.org/abs/2502.03771)


- 会议:ICLR2026

- 中文简介:对 embedding 相似度做在线 logistic sigmoid 校准,用置信度保守的下界与 δ 阈值决定命中,并随机 explore/exploit;查询近邻缓存,仅在验证风险可接受时复用响应。

- 链接:[https://arxiv.org/abs/2502.03771](https://arxiv.org/abs/2502.03771)


## 277. [Quantile Advantage Estimation: Stabilizing RLVR for LLM Reasoning](https://arxiv.org/abs/2509.22611)


- 会议:ICLR2026

- 中文简介:把 GRPO/DAPO 的 group mean reward baseline 换成 group K-quantile baseline;二值奖励下 hard query 只更新稀有成功,easy query 更新残余失败,并证明两种 regime 的熵安全性。

- 链接:[https://arxiv.org/abs/2509.22611](https://arxiv.org/abs/2509.22611)


## 278. [Rethinking Calibration for Early-Exit Neural Networks](https://arxiv.org/abs/2508.21495)


- 会议:ICML2026

- 中文简介:EEFP 将退出目标定义为当前预测是否正确或所有未来退出都将是错误的,然后根据保留的预测训练轻量级事后 MLP 校正器,以便置信阈值可以安全地提前停止。

- 链接:[https://arxiv.org/abs/2508.21495](https://arxiv.org/abs/2508.21495)


## 279. [On the Provable Suboptimality of Momentum SGD in Nonstationary Stochastic Optimization](https://arxiv.org/abs/2601.12238)


- 会议:ICML2026

- 中文简介:本文分析了标准 SGD、Polyak Heavy-Ball 和 Nesterov 更新,以跟踪可预测的漂移强凸最优值,导出瞬态/噪声/漂移界限和暴露动量陈旧梯度滞后的极小极大下限。

- 链接:[https://arxiv.org/abs/2601.12238](https://arxiv.org/abs/2601.12238)


## 280. [Trajectory Consistency for One-Step Generation on Euler Mean Flows](https://arxiv.org/abs/2602.02571)


- 会议:ICML2026

- 中文简介:欧拉平均流局部线性化半群轨迹一致性方程,用数据监督流匹配代替瞬时场,并以速度或 x1 预测形式训练无 JVP 的远程流图。

- 链接:[https://arxiv.org/abs/2602.02571](https://arxiv.org/abs/2602.02571)


## 281. [Gradient Preconditioning for Efficient and Reliable Reward-Guided Generation](https://arxiv.org/abs/2602.08646)


- 会议:ICML2026

- 中文简介:该方法在 Adam 更新之前将每个奖励梯度(以及可选的潜在变量本身)投影到具有块式 l1 和 l2 约束的紧凑傅立叶域白高斯可行集上。

- 链接:[https://arxiv.org/abs/2602.08646](https://arxiv.org/abs/2602.08646)


## 282. [RCCDA: Adaptive Model Updates in the Presence of Concept Drift under a Constrained Resource Budget](https://arxiv.org/abs/2505.24149)


- 会议:NeurIPS2025

- 中文简介:RCCDA 将模型更新频率视为约束控制策略。 虚拟预算队列根据实际资源使用情况进行更新,李亚普诺夫漂移加惩罚目标导出阈值更新;实际因果估计器使用比例/导数损失信号(Kp 当前减去最佳和 Kd 当前减去先前),决策开销为 O(1)。

- 链接:[https://arxiv.org/abs/2505.24149](https://arxiv.org/abs/2505.24149)


## 283. [Neon: Negative Extrapolation From Self-Training Improves Image Generation](https://arxiv.org/abs/2510.03597)


- 会议:ICLR2026

- 中文简介:Neon 从参考生成器中自行生成一个小型合成集,对该集进行简短的微调,并从参数空间中的副本进行推断:theta_Neon=(1+w)theta_ref-w theta_synthetic。

- 链接:[https://arxiv.org/abs/2510.03597](https://arxiv.org/abs/2510.03597)


## 284. [Split Gibbs Discrete Diffusion Posterior Sampling](https://arxiv.org/abs/2503.01161)


- 会议:NeurIPS2025

- 中文简介:Split Gibbs 引入了辅助分类变量,在汉明距离势下将似然 Metropolis-Hastings 步骤与预训练的离散扩散先验步骤交替,并将正则化水平退火为零。

- 链接:[https://arxiv.org/abs/2503.01161](https://arxiv.org/abs/2503.01161)


## 285. [Cost-of-Pass: An Economic Framework for Evaluating Language Models](https://arxiv.org/abs/2504.13359)


- 会议:ICLR2026

- 中文简介:Cost-of-Pass 定义模型在问题上的单位正确答案成本 v(m,p)=C_m(p)/R_m(p),再取不同推理策略/模型的成本前沿并与人类专家成本比较;它是一个评估指标和选择框架,不改变被评测模型。

- 链接:[https://arxiv.org/abs/2504.13359](https://arxiv.org/abs/2504.13359)


## 286. [BézierFlow: Learning Bézier Stochastic Interpolant Schedulers for Few-Step Generation](https://arxiv.org/abs/2512.13255)


- 会议:ICLR2026

- 中文简介:BézierFlow 只学习预训练扩散/flow 模型的少步采样 scheduler:用满足端点约束的单调累积 softmax 控制点参数化 Bézier 随机插值路径,在 teacher-forced 高 NFE 轨迹上用 LPIPS/MSE 优化少步轨迹。

- 链接:[https://arxiv.org/abs/2512.13255](https://arxiv.org/abs/2512.13255)


## 287. [Cross-Modal Redundancy and the Geometry of Vision–Language Embeddings](https://arxiv.org/abs/2602.06218)


- 会议:ICLR2026

- 中文简介:在 shared concepts 的等能量假设下,Aligned Matching Pursuit SAE 在普通稀疏自编码损失外加入跨模态 code cosine 对齐;由 bimodal/unimodal atoms 分解语义表示,移除 unimodal atoms 以缩小视觉—语言模态差距并支持语义向量运算。

- 链接:[https://arxiv.org/abs/2602.06218](https://arxiv.org/abs/2602.06218)


## 288. [LoRA-DA: Data-Aware Initialization for Low-Rank Adaptation via Asymptotic Analysis](https://arxiv.org/abs/2510.24561)


- 会议:ICML2026

- 中文简介:LoRA-DA 用渐近期望参数误差分解出的 Fisher variance 与 Fisher-gradient bias 构造 Initialization Guidance Matrix;从 256 个目标样本用 K-FAC 估计 Fisher,再用 LOBPCG 求最小特征向量初始化 LoRA 的 A(B 投影),保持标准 LoRA/LoRA-FA 微调。

- 链接:[https://arxiv.org/abs/2510.24561](https://arxiv.org/abs/2510.24561)


## 289. [CONCUR: High-Throughput Agentic Batch Inference of LLM via Congestion-Based Concurrency Control](https://arxiv.org/abs/2601.22705)


- 会议:ICML2026

- 中文简介:CONCUR 是 serving middleware 的状态型 AIMD admission controller:依据 GPU 利用率、KV cache 使用和 cache hit 的拥塞状态增加/降低并发窗口,暂停/恢复 agent,从而避免 agentic batch inference 的中段 thrashing。

- 链接:[https://arxiv.org/abs/2601.22705](https://arxiv.org/abs/2601.22705)


## 290. [Robust AI Evaluation through Maximal Lotteries](https://arxiv.org/abs/2602.21297)


- 会议:ICML2026

- 中文简介:把模型两两偏好转为 skew-symmetric majority-margin game,用 maximal lottery 求 maximin 混合模型;为应对用户/任务群体漂移,在 subpopulation mixture weights 的 TV 球上做 distributionally robust lottery,利用对偶 LP 高效求解并给 finite-sample regret bound。

- 链接:[https://arxiv.org/abs/2602.21297](https://arxiv.org/abs/2602.21297)


## 291. [LoSA: Locality Aware Sparse Attention in Diffusion Language Models](https://arxiv.org/abs/2604.12056)


- 会议:ICML2026

- 中文简介:LoSA 利用块式扩散语言模型中的局部性:它在每个去噪步骤中识别活动令牌,重用稳定令牌的缓存注意力输出,并将 top-k/QUEST 稀疏注意力仅应用于块内的活动令牌。

- 链接:[https://arxiv.org/abs/2604.12056](https://arxiv.org/abs/2604.12056)


## 292. [MIRA: A Score for Conditional Distribution Accuracy and Model Comparison](https://arxiv.org/abs/2605.02014)


- 会议:ICML2026

- 中文简介:MIRA(随机区域中的质量)使用真实联合样本和候选抽签对候选条件分布进行评分:测试候选样本周围的随机区域的真实样本占用率,并通过蒙特卡罗试验平均封闭式平滑占用概率。

- 链接:[https://arxiv.org/abs/2605.02014](https://arxiv.org/abs/2605.02014)


## 293. [On the Salience of Low-Probability Tokens for AI-Generated Text Detection: A Multiscale Uncertainty Perspective](https://arxiv.org/abs/2606.02158)


- 会议:ICML2026

- 中文简介:检测器使用局部对数概率统计和全局 Renyi 熵统计对文本序列的 Bottom-rho 标记概率进行评分; Uncertainty++ 用条件独立的蒙特卡洛归一化差异替换局部统计量,无需训练。

- 链接:[https://arxiv.org/abs/2606.02158](https://arxiv.org/abs/2606.02158)


## 294. [Broken Tokens? Your Language Model can Secretly Handle Non-Canonical Tokenizations](https://arxiv.org/abs/2506.19004)


- 会议:NeurIPS2025

- 中文简介:损坏的令牌是一种推理时间标记化干预:保持字符串固定,但使用递归加权均匀算法对替代有效分段进行采样,或使用右对齐数字分组,并平均/保留模型输出。权重或训练数据没有改变。

- 链接:[https://arxiv.org/abs/2506.19004](https://arxiv.org/abs/2506.19004)


## 295. [MMTok: Multimodal Coverage Maximization for Efficient Inference of VLMs](https://arxiv.org/abs/2508.18264)


- 会议:ICLR2026

- 中文简介:MMTok 把视觉 token 子集选择写成最大覆盖:用投影后的 text--vision 相似度 M^{tv} 和投影前的 vision--vision 相似度 M^{vv},逐行 softmax 校准后定义 f(S)=f(S;M^{tv'})+alpha f(S;M^{vv'}),从全部视觉 token 中贪心加入使覆盖增益最大的 token。该子模目标有 (1-1/e) 近似保证,结果作为 VLM 的压缩视觉 token 输入,无需训练。

- 链接:[https://arxiv.org/abs/2508.18264](https://arxiv.org/abs/2508.18264)


## 296. [A3: an Analytical Low-Rank Approximation Framework for Attention](https://arxiv.org/abs/2505.12942)


- 会议:ICML2026

- 中文简介:A3 用校准激活的函数误差而非权重误差做训练后低秩压缩:QK/OV 用 activation-aware SVD,MLP 用 CUR,另给出 GQA/RoPE 的联合扩展。

- 链接:[https://arxiv.org/abs/2505.12942](https://arxiv.org/abs/2505.12942)


## 297. [Universal Learning of Nonlinear Dynamics](https://arxiv.org/abs/2508.11990)


- 会议:ICML2026

- 中文简介:Observation Spectral Filtering (OSF) 预先计算 Hankel 矩阵谱滤波器,把历史观测的滤波特征与回归项送入在线凸优化;Luenberger observer/离散 lifting 只用于证明其可学习非线性动力系统。

- 链接:[https://arxiv.org/abs/2508.11990](https://arxiv.org/abs/2508.11990)


## 298. [Efficient Parallel Samplers for Recurrent-Depth Models and Their Connection to Diffusion Language Models](https://arxiv.org/abs/2510.14961)


- 会议:ICML2026

- 中文简介:Diffusion-forcing sampler 在每次 recurrent-depth forward 中推进一个新 token,同时并行 refine wavefront 中旧 token;以 KV cache sharing、latent-difference adaptive freezing 和可选 noise/momentum 控制稳定性与显存。

- 链接:[https://arxiv.org/abs/2510.14961](https://arxiv.org/abs/2510.14961)


## 299. [Universal One-third Time Scaling in Learning Peaked Distributions](https://arxiv.org/abs/2602.03685)


- 会议:ICML2026

- 中文简介:论文证明在尖锐 softmax 输出和交叉熵训练的低温区间,损失与训练时间遵循约一比三次方幂律;从玩具模型、梯度流到实际语言模型检查点,验证该指数对架构和优化细节具有普适性。

- 链接:[https://arxiv.org/abs/2602.03685](https://arxiv.org/abs/2602.03685)


## 300. [CLEAR: Conv-Like Linearization Revs Pre-Trained Diffusion Transformers Up](https://arxiv.org/abs/2412.16112)


- 会议:NeurIPS2025

- 中文简介:CLEAR把预训练DiT联合注意力替换为圆形局部窗口:文本query仍看全部文本/图像,图像query只看文本和半径r内图像token;只微调注意力层并用flow、输出和attention蒸馏保持教师行为。

- 链接:[https://arxiv.org/abs/2412.16112](https://arxiv.org/abs/2412.16112)


## 301. [An Analytical Theory of Spectral Bias in the Learning Dynamics of Diffusion Models](https://arxiv.org/abs/2503.03206)


- 会议:NeurIPS2025

- 中文简介:论文用Gaussian-equivalence把线性/深线性/卷积去噪器的全批梯度流解出,再积分probability-flow ODE,得到生成分布的模态演化与反方差谱律,并以MLP/CNN UNet实验验证。

- 链接:[https://arxiv.org/abs/2503.03206](https://arxiv.org/abs/2503.03206)


## 302. [Neural Thermodynamics: Entropic Forces in Deep and Universal Representation Learning](https://arxiv.org/abs/2505.12387)


- 会议:NeurIPS2025

- 中文简介:从随机小批量 SGD 的离散更新和参数对称轨道推导有效熵正则及 entropic force:把原损失加上与梯度噪声协方差/曲率相关的修正,分析该力如何破坏连续对称、保留离散对称,并推出梯度平衡、equipartition、表示对齐和 sharpness 行为。

- 链接:[https://arxiv.org/abs/2505.12387](https://arxiv.org/abs/2505.12387)


## 303. [Structured Sparse Transition Matrices to Enable State Tracking in State-Space Models](https://arxiv.org/abs/2509.22284)


- 会议:NeurIPS2025

- 中文简介:PD-SSM 将 SSM transition 写成列 one-hot 的稀疏矩阵 P(u) 与复杂对角 D(u) 的乘积;P 由 dictionary softmax/hardmax 生成,D 的幅度/相位由 MLP 生成。该结构支持线性 parallel scan、BIBO stability,并以一层 N 状态模拟任意 N-state FSA。

- 链接:[https://arxiv.org/abs/2509.22284](https://arxiv.org/abs/2509.22284)


## 304. [Cautious Weight Decay](https://arxiv.org/abs/2510.12402)


- 会议:ICLR2026

- 中文简介:Cautious Weight Decay 只在参数与优化器更新方向同号时施加 decoupled weight decay;若两者相反则跳过衰减,因此可直接包裹 AdamW、Lion、Muon 或 SGD 而不引入新超参。

- 链接:[https://arxiv.org/abs/2510.12402](https://arxiv.org/abs/2510.12402)


## 305. [A Signed Graph Approach to Understanding and Mitigating Oversmoothing](https://arxiv.org/abs/2502.11394)


- 会议:NeurIPS2025

- 中文简介:SBP 把 GNN 的邻接传播改写为 signed propagation:Label-SBP 按标签关系给边符号,Feature-SBP 按特征相似度给符号,再用 LayerNorm/系数约束稳定正负传播,并提供 v2 稀疏化大图版本。

- 链接:[https://arxiv.org/abs/2502.11394](https://arxiv.org/abs/2502.11394)


## 306. [Planner Aware Path Learning in Diffusion Language Models Training](https://arxiv.org/abs/2509.23405)


- 会议:ICLR2026

- 中文简介:PAPL 将 masked diffusion LM 的训练目标按推理 planner 的 token confidence 加权:softmax confidence 产生每个 masked token 的 planner weight,detach planner 梯度并与 vanilla masked CE 插值,形成一行 loss 改动。

- 链接:[https://arxiv.org/abs/2509.23405](https://arxiv.org/abs/2509.23405)


## 307. [RL's Razor: Why Online Reinforcement Learning Forgets Less](https://arxiv.org/abs/2509.04259)


- 会议:ICLR2026

- 中文简介:RL's Razor 用新任务后的 forward KL $E\[D_{KL}(\\pi_0\\|\\pi)\]$ 预测遗忘,并解释 on-policy RL 通过不断从当前策略采样而保留旧能力;在 rejection-sampling I-projection 与 policy-gradient M-projection 的交替视角下比较 RL、SFT,并可蒸馏 RL teacher。

- 链接:[https://arxiv.org/abs/2509.04259](https://arxiv.org/abs/2509.04259)


## 308. [Deep Hierarchical Learning with Nested Subspace Networks for Large Language Models](https://arxiv.org/abs/2509.17874)


- 会议:ICLR2026

- 中文简介:Nested Subspace Network 令每个线性层共享最大 rank 的 A/B 因子,低 rank 模型直接取前缀子空间;训练时同时优化 anchor 与采样 rank 的损失,并用 uncertainty weighting 和 SVD 初始化保持 nested containment。

- 链接:[https://arxiv.org/abs/2509.17874](https://arxiv.org/abs/2509.17874)


## 309. [Preventing Model Collapse Under Overparametrization: Optimal Mixing Ratios for Interpolation Learning and Ridge Regression](https://arxiv.org/abs/2509.22341)


- 会议:ICLR2026

- 中文简介:在线性过参数回归中,把新鲜真实标签与上一轮估计器产生的 synthetic response 按 mixing ratio 混合,再做 min-norm interpolation 或 ridge;用随机矩阵/Stieltjes 公式求渐近风险,得到 min-norm 最优权重约为黄金比例倒数及 ridge 的 SNR/谱依赖最优区间。

- 链接:[https://arxiv.org/abs/2509.22341](https://arxiv.org/abs/2509.22341)


## 310. [Negative Pre-activations Differentiate Syntax](https://arxiv.org/abs/2509.24198)


- 会议:ICLR2026

- 中文简介:先用 WikiText 激活分布的 Wasserstein distance(并以 mapping difficulty 校验)选每层 top-WD/Wasserstein neurons,再只把这些 MLP gate/up pre-activations 的负值替换为 $\\max(a,0)$;与随机和 perplexity-matched low-WD 消融比较语法/非语法能力。

- 链接:[https://arxiv.org/abs/2509.24198](https://arxiv.org/abs/2509.24198)


## 311. [Understanding the Mixture-of-Experts with Nadaraya-Watson Kernel](https://arxiv.org/abs/2509.25913)


- 会议:ICLR2026

- 中文简介:KERN 用 Nadaraya-Watson 式的标准化亲和力取代了通常的 MoE 路由器:投影隐藏状态和专家密钥,对亲和力应用非负激活,并选择前 k 个专家。它是一款嵌入式路由器,无需额外的路由器网络。

- 链接:[https://arxiv.org/abs/2509.25913](https://arxiv.org/abs/2509.25913)


## 312. [Train on Validation (ToV): Fast data selection with applications to fine-tuning](https://arxiv.org/abs/2510.00386)


- 会议:ICLR2026

- 中文简介:验证训练 (ToV) 通过对示例或子集进行简短训练后获得的验证损失改进来对候选训练示例进行评分。然后,它会选择高分、分箱或随机示例进行最终训练。

- 链接:[https://arxiv.org/abs/2510.00386](https://arxiv.org/abs/2510.00386)


## 313. [EditLens: Quantifying the Extent of AI Editing in Text](https://arxiv.org/abs/2510.03154)


- 会议:ICLR2026

- 中文简介:EditLens 使用嵌入余弦和软 n 元语法差异将源到编辑的语义距离转换为监督,然后对编辑的文本微调一个 LLM,以对发生的 AI 编辑量进行回归或分类。

- 链接:[https://arxiv.org/abs/2510.03154](https://arxiv.org/abs/2510.03154)


## 314. [Dynamic Reflections: Probing Video Representations with Text Alignment](https://arxiv.org/abs/2511.02767)


- 会议:ICLR2026

- 中文简介:用视频帧/clip 与文本 caption 表示空间的 mutual k-nearest-neighbor overlap 衡量跨模态 alignment,并拟合随帧数和 caption 数增长的饱和幂律,从而探测视频编码器的动态语义表征。

- 链接:[https://arxiv.org/abs/2511.02767](https://arxiv.org/abs/2511.02767)


## 315. [MoRA: Missing Modality Low-Rank Adaptation for Visual Recognition](https://arxiv.org/abs/2511.06225)


- 会议:ICLR2026

- 中文简介:为视觉和文本模态分别学习低秩 A/B 更新,再用共享跨模态低秩矩阵和 Gram 矩阵把不同维度的更新桥接;归一化各更新后可吸收到冻结 backbone,处理训练/测试时缺失模态。

- 链接:[https://arxiv.org/abs/2511.06225](https://arxiv.org/abs/2511.06225)


## 316. [Sharing State Between Prompts and Programs](https://arxiv.org/abs/2512.14805)


- 会议:ICLR2026

- 中文简介:提出 shared program state 的 natural function interface:prompt 可 Lookup/Assign 变量、Ref/Deref/Set heap object、Goto 控制 label;effect handler 挂起 LLM prompt 后恢复/取消。Nightjar 将该接口实现为 Python source transformation、eager loading 与缓存。

- 链接:[https://arxiv.org/abs/2512.14805](https://arxiv.org/abs/2512.14805)


## 317. [Is Finer Better? The Limits of Microscaling Formats in Large Language Models](https://arxiv.org/abs/2601.19026)


- 会议:ICLR2026

- 中文简介:论文推导 microscaling FP4 量化误差随 block size 与 FP8 scale 量化的分解,解释 perplexity inversion;随后提出 per-tensor scaling,并把硬件未充分使用的 scale exponent bit 重用于 FP8 UE5M3,以改善 scale 精度。

- 链接:[https://arxiv.org/abs/2601.19026](https://arxiv.org/abs/2601.19026)


## 318. [Noisy but Valid: Robust Statistical Evaluation of LLMs with Imperfect Judges](https://arxiv.org/abs/2601.20913)


- 会议:ICLR2026

- 中文简介:针对不完美 LLM judge,方法用小规模人工标注集估计 judge 的 TPR/FPR,把目标显著性水平映射为 α'=FPR+(TPR−FPR)α,并在大规模 judge 标签上加入方差校正的临界值,进行 noisy hypothesis test。

- 链接:[https://arxiv.org/abs/2601.20913](https://arxiv.org/abs/2601.20913)


## 319. [QVLA: Not All Channels Are Equal in Vision-Language-Action Model's Quantization](https://arxiv.org/abs/2602.03782)


- 会议:ICLR2026

- 中文简介:QVLA 用 action-centric channel sensitivity 估计每个 VLA 通道的动作误差贡献:先用 Jacobian/一阶近似筛选,再精确评估,最后按 sensitivity-per-bit 贪心把权重通道降到 0/2/4/8/16 bit,在给定平均 bit budget 下分配量化位宽。

- 链接:[https://arxiv.org/abs/2602.03782](https://arxiv.org/abs/2602.03782)


## 320. [Adaptive Debiasing Tsallis Entropy for Test-Time Adaptation](https://arxiv.org/abs/2602.11743)


- 会议:ICLR2026

- 中文简介:ADTE 为 test-time augmentation 的每个类别自适应选择 Tsallis 熵:用 pseudo-label memory bank 的 Jacobi 迭代估计类别 bias,把 bias 映射到 class-specific q,计算 N 个视图的 ADTE,选最低熵的 N_v 个聚合预测。

- 链接:[https://arxiv.org/abs/2602.11743](https://arxiv.org/abs/2602.11743)


## 321. [Omni-iEEG: A Large-Scale, Comprehensive iEEG Dataset and Benchmark for Epilepsy Research](https://arxiv.org/abs/2602.16072)


- 会议:ICLR2026

- 中文简介:Omni-iEEG 是大规模多中心 iEEG 数据集与 benchmark:302 名患者、8 中心、178 小时信号和约 36K 专家标注,按 BIDS/harmonization 统一;提供 pathological HFO 分类、病理脑区识别及解剖/ictal/sleep-awake 探索任务与基线。

- 链接:[https://arxiv.org/abs/2602.16072](https://arxiv.org/abs/2602.16072)


## 322. [Decentralized Attention Fails Centralized Signals: Rethinking Transformers for Medical Time Series](https://arxiv.org/abs/2602.18473)


- 会议:ICLR2026

- 中文简介:CoTAR/TeCh 用 central core token 在 token/channel 轴上聚合再广播,实现线性复杂度;adaptive dual tokenization 同时编码 temporal 与 channel 结构,并在多种医疗时间序列上做分类。

- 链接:[https://arxiv.org/abs/2602.18473](https://arxiv.org/abs/2602.18473)


## 323. [KLAS: Using Similarity to Stitch Neural Networks for Improved Accuracy-Efficiency Tradeoffs](https://arxiv.org/abs/2605.29259)


- 会议:ICLR2026

- 中文简介:KLAS用冻结模型中间层线性probe的KL散度评估源/目标表示相似度:末层KL选anchor,跨层KL/同anchor容量比Γ在FLOPs buckets中选binary stitches,随后只需标准finetuning形成Pareto部署模型。

- 链接:[https://arxiv.org/abs/2605.29259](https://arxiv.org/abs/2605.29259)


## 324. [Q-Sched: Pushing the Boundaries of Few-Step Diffusion Models with Quantization-Aware Scheduling](https://arxiv.org/abs/2509.01624)


- 会议:ICML2026

- 中文简介:Q-Sched 为量化激活/去噪输出插入可学习的标量预处理计划,并选择具有量化感知图像质量目标的计划,保留底层的几步扩散模型和采样器。

- 链接:[https://arxiv.org/abs/2509.01624](https://arxiv.org/abs/2509.01624)


## 325. [Decoupling The "What" and "Where" With Polar Coordinate Positional Embedding](https://arxiv.org/abs/2509.10534)


- 会议:ICML2026

- 中文简介:PoPE 通过对内容使用 softplus 查询/键幅度以及对空间位置使用仅位置相位(可选地具有有界相移)来取代 RoPE;融合的 FlashAttention 实现计算生成的极坐标注意力。

- 链接:[https://arxiv.org/abs/2509.10534](https://arxiv.org/abs/2509.10534)


## 326. [SINQ: Sinkhorn-Normalized Quantization for Calibration-Free Low-Precision LLM Weights](https://arxiv.org/abs/2509.22944)


- 会议:ICML2026

- 中文简介:SINQ 使用双行/列尺度和标准量化器来近似权重,然后应用阻尼对数空间 Sinkhorn-Knopp 迭代来使用权重导出的激活代理来平衡行/列方差,从而避免校准数据。

- 链接:[https://arxiv.org/abs/2509.22944](https://arxiv.org/abs/2509.22944)


## 327. [Benchmarking World-Model Learning with Environment-Level Queries](https://arxiv.org/abs/2510.19788)


- 会议:ICML2026

- 中文简介:WMLA 是一个行为层世界模型评测协议:先在未知 POMDP 中做 reward-free 环境交互,再将环境查询转换成带明确目标的 challenge query,只依据 agent 的行为轨迹和任务得分评价模型,不读取表示或内部状态。

- 链接:[https://arxiv.org/abs/2510.19788](https://arxiv.org/abs/2510.19788)


## 328. [Safeguarded Stochastic Polyak Step Sizes for Non-smooth Optimization: Robust Performance Without Small (Sub)Gradients](https://arxiv.org/abs/2512.02342)


- 会议:ICML2026

- 中文简介:Safeguarded SPS 只把 stochastic Polyak 步长的梯度平方分母设为 max(||g_i||^2,M):gamma_t=(f_i(x_t)-ell_i*)/max(||g_i||^2,M),从而防止小 subgradient 导致爆炸;同一 safeguard 可直接扩展到 IMA momentum。

- 链接:[https://arxiv.org/abs/2512.02342](https://arxiv.org/abs/2512.02342)


## 329. [Resting Neurons, Active Insights: Robustifying Activation Sparsity in LLMs via Spontaneity](https://arxiv.org/abs/2512.12744)


- 会议:ICML2026

- 中文简介:SPON 在稀疏 LLM 的每层稀疏线性变换中注入少量 input-independent learnable spontaneous activation vectors;用 calibration corpus 让稀疏模型 logits 拟合 dense reference,训练后将 W*s 折叠进 bias,使推理零额外 FLOPs。

- 链接:[https://arxiv.org/abs/2512.12744](https://arxiv.org/abs/2512.12744)


## 330. [Efficient Inference for Noisy LLM-as-a-Judge Evaluation](https://arxiv.org/abs/2601.05420)


- 会议:ICML2026

- 中文简介:该方法把 noisy judge 标签 Y-hat 与少量 calibration 人标配对,估计 mu(Y-hat)=E\[Y|Y-hat\],并用 semiparametric efficient influence function 直接估计真实均值;binary 时退化为高效的 PPI++/MLE,continuous/ordinal 时拟合 mu 回归。

- 链接:[https://arxiv.org/abs/2601.05420](https://arxiv.org/abs/2601.05420)


## 331. [A model of errors in transformers](https://arxiv.org/abs/2601.14175)


- 会议:ICML2026

- 中文简介:论文用一个两参数误差模型预测 transformer 在算法任务上的 exact accuracy:在有效复杂度 c、错误方向数 q 和 Gaussian parameter-noise scale 下,accuracy 由 incomplete-gamma CDF 给出(alpha 固定 1,r=q sigma^2/tau^2),再拟合模型/任务的误差率。

- 链接:[https://arxiv.org/abs/2601.14175](https://arxiv.org/abs/2601.14175)


## 332. [Success-Conditioning as Policy Improvement: The Optimization Problem Solved by Imitating Success](https://arxiv.org/abs/2601.18175)


- 会议:ICML2026

- 中文简介:Success-conditioning 把成功轨迹上的行为策略写成 pi_+(a|s)=pi_0(a|s)(1+A_pi0(s,a)/V_pi0(s)),并证明它精确解决带 weighted chi-square trust-region 的一阶 policy-improvement 问题;action influence 衡量成功筛选的风险/收益。

- 链接:[https://arxiv.org/abs/2601.18175](https://arxiv.org/abs/2601.18175)


## 333. [PRISM: Distribution-free Adaptive Computation of Matrix Functions for Accelerating Neural Network Training](https://arxiv.org/abs/2601.22137)


- 会议:ICML2026

- 中文简介:PRISM 是矩阵函数迭代的自适应残差多项式:在第 d 阶令 g_d=f_{d-1}+alpha xi^d,用 Gaussian/OSE sketch 近似 Frobenius residual,闭式求 alpha 后更新矩阵;同一规则作用于 sign、sqrt、inverse-root、polar 及 Chebyshev 等函数。

- 链接:[https://arxiv.org/abs/2601.22137](https://arxiv.org/abs/2601.22137)


## 334. [What Do Agents Learn from Trajectory-SFT: Semantics or Interfaces?](https://arxiv.org/abs/2602.01611)


- 会议:ICML2026

- 中文简介:PIPE 是 agent trajectory-SFT 的接口依赖诊断协议:对 action name/tool interface 做最小 synonym 或 symbol-obfuscation 重写,保持任务、观测和动力学不变,比较原始与扰动后的成功率;IR 用反向平衡的两别名成功率几何均值比并以 alpha pseudo-count 聚合。

- 链接:[https://arxiv.org/abs/2602.01611](https://arxiv.org/abs/2602.01611)


## 335. [Prediction-Powered Risk Monitoring of Deployed Models for Detecting Harmful Distribution Shifts](https://arxiv.org/abs/2602.02229)


- 会议:ICML2026

- 中文简介:PPRM 用部署模型的预测器 f_p 给无标签 batch 产生 synthetic labels,再以 prediction-powered inference 估计风险:无标签预测损失加有标签真实损失减有标签预测损失;CM-EB/anytime confidence bounds 监控 running risk,超过 nominal upper bound 加 tolerance 时报警,可用过去窗口估计最小方差的 eta。

- 链接:[https://arxiv.org/abs/2602.02229](https://arxiv.org/abs/2602.02229)


## 336. [On the Entropy Dynamics in Reinforcement Fine-Tuning of Large Language Models](https://arxiv.org/abs/2602.03392)


- 会议:ICML2026

- 中文简介:Entropy Dynamics 从单 token logit 扰动推导 discriminator S_i=p_i(H+log p_i),给出 entropy change 一阶符号;推广到 GRPO 得到 S_*−E_p\[S\] 因子及 advantage covariance,并据此提出 batch-normalized Clip_B 与 vocabulary-centered Clip_V token masking 稳定熵。

- 链接:[https://arxiv.org/abs/2602.03392](https://arxiv.org/abs/2602.03392)


## 337. [Antidistillation Fingerprinting](https://arxiv.org/abs/2602.03812)


- 会议:ICML2026

- 中文简介:Antidistillation Fingerprinting 用 proxy model 的梯度/各 token 概率构造 ADFP logit perturbation Delta_t=q_t(1\[t in green\]-L),使 teacher 输出的 green-token 概率更易被 student fine-tuning 吸收;检测时对独立 contexts 计算 GTP 并用 Hoeffding p-value 判定指纹。

- 链接:[https://arxiv.org/abs/2602.03812](https://arxiv.org/abs/2602.03812)


## 338. [Optimal Rates for Feasible Payoff Set Estimation in Games](https://arxiv.org/abs/2602.04397)


- 会议:ICML2026

- 中文简介:在未知 bimatrix game 中只观察均衡行动样本,算法用经验频率 x_hat,y_hat 直接返回使该经验策略成为 exact/alpha-Nash 的全体 payoff set;论文用 Hausdorff set-valued correspondence、support discontinuity、change-of-measure/Fano 和 fractional-knapsack concentration 给出 general-sum/zero-sum 的 minimax rates。

- 链接:[https://arxiv.org/abs/2602.04397](https://arxiv.org/abs/2602.04397)


## 339. [Inverse Depth Scaling From Most Layers Being Similar](https://arxiv.org/abs/2602.05970)


- 会议:ICML2026

- 中文简介:论文提出逆深度缩放规律:从多模型隐藏状态的跨层角度变化出发,用可加的 loss scaling 拟合深度 m、宽度 l、数据 D 的幂律;再以 tied/independent residual MLP 教师-学生实验解释为何层深度指数接近 3(或更高)而独立权重接近 1。

- 链接:[https://arxiv.org/abs/2602.05970](https://arxiv.org/abs/2602.05970)


## 340. [Step-Resolved Data Attribution for Looped Transformers](https://arxiv.org/abs/2602.10097)


- 会议:ICML2026

- 中文简介:Step-Resolved Data Attribution 将 TracIn 扩展到 looped/weight-tied Transformer:把 recurrent body 的 BPTT 梯度拆成每一 loop 的 phi_t,定义 SDI_t=Σ_k eta_k <training gradient, phi_t(test)>,并在反向传播中用 CountSketch/TensorSketch 流式累积,保持各 loop attribution 总和守恒。

- 链接:[https://arxiv.org/abs/2602.10097](https://arxiv.org/abs/2602.10097)


## 341. [When More Experts Hurt: Underfitting in Multi-Expert Learning to Defer](https://arxiv.org/abs/2602.17144)


- 会议:ICML2026

- 中文简介:PiCCE 针对 multi-expert learning-to-defer 的 underfitting,利用训练样本中的 ground-truth correctness 只在正确专家集合中选最高置信专家,去掉 vanilla 多专家 surrogate 的专家准确率求和/label flattening;定义对称连续 surrogate,并证明 continuity、classifier/system consistency 和 class/expert accuracy recovery。

- 链接:[https://arxiv.org/abs/2602.17144](https://arxiv.org/abs/2602.17144)


## 342. [Learning Dynamics of Zeroth-Order Optimization: A Kernel Perspective](https://arxiv.org/abs/2605.03373)


- 会议:ICML2026

- 中文简介:该论文通过投影经验神经正切核(eNTK)线性化一步零阶优化:随机扰动投影参数空间正切特征,所得词汇转换矩阵预测更新动态,其误差主要由扰动计数和输出词汇大小控制。

- 链接:[https://arxiv.org/abs/2605.03373](https://arxiv.org/abs/2605.03373)


## 343. [Memory as a Markov Matrix: Sample Efficient Knowledge Expansion via Token-to-Dictionary Mapping](https://arxiv.org/abs/2605.04308)


- 会议:ICML2026

- 中文简介:该方法将自回归语言模型视为词汇马尔可夫转移矩阵,并使用稀疏标记到字典的映射对其进行扩展。仅拟合新引入的标记的行/参数,保留旧的转换矩阵并避免遗忘。

- 链接:[https://arxiv.org/abs/2605.04308](https://arxiv.org/abs/2605.04308)


## 344. [Normalization Equivariance for Arbitrary Backbones, with Application to Image Denoising](https://arxiv.org/abs/2605.08193)


- 会议:ICML2026

- 中文简介:WNE 通过输入/输出归一化包装任意图像到图像的主干:通过平均值和标准差对每个输入进行归一化,应用主干,然后恢复比例和平均值。包装器在不改变主干参数的情况下强制执行仿射归一化等变性。

- 链接:[https://arxiv.org/abs/2605.08193](https://arxiv.org/abs/2605.08193)


## 345. [VPD-100K: Towards Generalizable and Fine-grained Visual Privacy Protection](https://arxiv.org/abs/2605.10229)


- 会议:ICML2026

- 中文简介:VPD-100K 提供 100K 图像、细粒度视觉隐私检测基准,并添加频率增强的 YOLOv10 模块:可学习的复杂频谱门和高频一致性损失增强空间检测。

- 链接:[https://arxiv.org/abs/2605.10229](https://arxiv.org/abs/2605.10229)


## 346. [The First Drop of Ink: Nonlinear Impact of Misleading Information in Long-Context Reasoning](https://arxiv.org/abs/2605.10828)


- 会议:ICML2026

- 中文简介:该基准测试通过仅改变固定上下文长度下的困难干扰因素与简单干扰因素的比例来控制长上下文 QA,然后测量第一次准确度下降,并使用检索头边缘估计通过两类注意力 Softmax 模型进行解释。

- 链接:[https://arxiv.org/abs/2605.10828](https://arxiv.org/abs/2605.10828)


## 347. [Decision Tree Learning on Product Spaces](https://arxiv.org/abs/2605.12983)


- 会议:ICML2026

- 中文简介:论文通过以最大概率加权影响的坐标分裂当前叶子,自上而下地生长布尔决策树;叶子分数等于成本降低,产生错误/成本和大小保证以及样本估计的实现。

- 链接:[https://arxiv.org/abs/2605.12983](https://arxiv.org/abs/2605.12983)


## 348. [Diagnosing Multi-step Reasoning Failures in Black-box LLMs via Stepwise Confidence Attribution](https://arxiv.org/abs/2605.19228)


- 会议:ICML2026

- 中文简介:SCA 通过将采样轨迹与正确轨迹进行比较,对没有模型逻辑的推理步骤进行评分:NIBS 使用语义相似性,而 GIBS 构建共识步骤图,并在信息瓶颈损失下训练 BERT 边缘/节点编码器以及两层 GCN,以输出步骤置信度。

- 链接:[https://arxiv.org/abs/2605.19228](https://arxiv.org/abs/2605.19228)


## 349. [Localize and Neutralize: Gradient-Guided Token Suppression Against Visual Prompt Injection Attack](https://arxiv.org/abs/2605.25194)


- 会议:ICML2026

- 中文简介:GTM通过第一个隐藏状态范数的梯度范数对图像嵌入标记进行评分,选择前5%的标记并在LVLM解码之前屏蔽/抑制它们;令牌对齐分析解释了为什么第一个令牌 Logit 梯度是一个糟糕的替代方案。

- 链接:[https://arxiv.org/abs/2605.25194](https://arxiv.org/abs/2605.25194)


## 350. [What is Your Data Worth to GPT? LLM-Scale Data Valuation with Influence Functions](https://arxiv.org/abs/2405.13954)


- 会议:NeurIPS2025

- 中文简介:利用每个示例矩阵梯度的克罗内克和结构来学习低秩输入/输出投影 P=Pi⊗Po。在影响力计算之前进行项目激活,使用 PCA/KFAC 或随机初始化进行小投影,并通过 PyTorch 挂钩公开结果,以便影响函数数据评估扩展到 LLM 检查点。

- 链接:[https://arxiv.org/abs/2405.13954](https://arxiv.org/abs/2405.13954)


## 351. [AttentionPredictor: Temporal Patterns Matter for KV Cache Compression](https://arxiv.org/abs/2502.04077)


- 会议:NeurIPS2025

- 中文简介:将注意力图的历史视为二维时间序列。将最大池注意力集中到块中,使用一个共享的轻量级 CNN 预测下一张地图,选择前 K 个块/令牌,定期使用密集注意力进行校准,并跨令牌异步预取所选的 KV 块。

- 链接:[https://arxiv.org/abs/2502.04077](https://arxiv.org/abs/2502.04077)


## 352. [Training Language Models to Reason Efficiently](https://arxiv.org/abs/2502.04463)


- 会议:NeurIPS2025

- 中文简介:将二元正确性奖励替换为正确性乘以 1−α·σ((长度−每个提示平均值)/std),因此只有正确的响应才会按归一化长度进行排名。利用 REINFORCE 留一序列优势,通过 PPO 在线优化奖励,产生一系列可控的较短 CoT 推理模型。

- 链接:[https://arxiv.org/abs/2502.04463](https://arxiv.org/abs/2502.04463)


## 353. [DISC: Dynamic Decomposition Improves LLM Inference Scaling](https://arxiv.org/abs/2502.16706)


- 会议:NeurIPS2025

- 中文简介:DISC 在推理时动态分解待解前缀:按累计奖励预算采样后缀,计算标准化奖励 z,若候选前缀优于基线则接受,否则把分解比例 α 收缩并递归;同一分解器可接 beam 或 MCTS。

- 链接:[https://arxiv.org/abs/2502.16706](https://arxiv.org/abs/2502.16706)


## 354. [Architectural and Inferential Inductive Biases for Exchangeable Sequence Modeling](https://arxiv.org/abs/2503.01215)


- 会议:NeurIPS2025

- 中文简介:该工作以交换序列的多步自回归建模为核心:对未来观察序列建模并分解 epistemic/aleatoric 不确定性,理论上把多步对数似然差写成条件互信息,再用于 bandit/主动学习决策。

- 链接:[https://arxiv.org/abs/2503.01215](https://arxiv.org/abs/2503.01215)


## 355. [Classical Planning with LLM-Generated Heuristics: Challenging the State of the Art with Python Code](https://arxiv.org/abs/2503.18809)


- 会议:NeurIPS2025

- 中文简介:该规划流程让 LLM 根据 PDDL 域、示例和 Pyperplan 说明生成 25 个 Python domain-dependent heuristic,逐个在较小训练任务上用 GBFS 运行,按 coverage/速度选出一个,再应用到不相交的更大 IPC2023 测试任务。

- 链接:[https://arxiv.org/abs/2503.18809](https://arxiv.org/abs/2503.18809)


## 356. [Information-Theoretic Reward Decomposition for Generalizable RLHF](https://arxiv.org/abs/2504.06020)


- 会议:NeurIPS2025

- 中文简介:信息论 reward decomposition 把偏好 reward rθ(x,y) 分成 prompt-related r1 与 prompt-free r2:用互信息约束定义理想 response-only 差分,二分搜索估计 r2,再以小差分样本优先的 K-means/Otsu+EMA 采样训练普通 BT reward model。

- 链接:[https://arxiv.org/abs/2504.06020](https://arxiv.org/abs/2504.06020)


## 357. [CodeCrash: Exposing LLM Fragility to Misleading Natural Language in Code Reasoning](https://arxiv.org/abs/2504.14119)


- 会议:NeurIPS2025

- 中文简介:CodeCrash 构造功能等价但误导性的代码扰动:AST 重命名/格式/死代码、MCC/MPS 注释或 print、MHC 错误 hint;执行验证保持语义后测 LLM pass@1 下降,以诊断代码推理脆弱性。

- 链接:[https://arxiv.org/abs/2504.14119](https://arxiv.org/abs/2504.14119)


## 358. [seq-JEPA: Autoregressive Predictive Learning of Invariant-Equivariant World Models](https://arxiv.org/abs/2505.03176)


- 会议:NeurIPS2025

- 中文简介:seq-JEPA 将短序列 view-action 对送入 ResNet 编码器和 Transformer 聚合器,聚合表示再结合下一 action 预测 EMA target encoder 的下一视图;单一 cosine JEPA loss 自发形成 equivariant encoder 与 invariant aggregate。

- 链接:[https://arxiv.org/abs/2505.03176](https://arxiv.org/abs/2505.03176)


## 359. [Just One Layer Norm Guarantees Stable Extrapolation](https://arxiv.org/abs/2505.14512)


- 会议:NeurIPS2025

- 中文简介:在网络任意一个隐藏层放置一次 LayerNorm;在正齐次激活和非退化 Gram 条件下,NTK 的方差因此保持有界,进而给有限训练集上的无限宽极限输出提供 OOD 稳定性保证。

- 链接:[https://arxiv.org/abs/2505.14512](https://arxiv.org/abs/2505.14512)


## 360. [MixAT: Combining Continuous and Discrete Adversarial Training for LLMs](https://arxiv.org/abs/2505.16947)


- 会议:NeurIPS2025

- 中文简介:对每个有害提示先用 PAP 生成离散对抗改写,再叠加 CAT 的 L2 PGD 连续扰动(按比例 α 混合);在同一训练中同时保持拒答和正常效用,用动态生成而非静态 adversarial batch。

- 链接:[https://arxiv.org/abs/2505.16947](https://arxiv.org/abs/2505.16947)


## 361. [PDPO: Parametric Density Path Optimization](https://arxiv.org/abs/2505.18473)


- 会议:NeurIPS2025

- 中文简介:用 Flow Matching 预训练边界参数化推送映射,再用三点(或少量控制点)cubic Hermite spline 参数化整个密度路径;交替优化内部路径的 action 与边界/耦合的 FM dissimilarity,从而在多种动力系统中最小化路径 action。

- 链接:[https://arxiv.org/abs/2505.18473](https://arxiv.org/abs/2505.18473)


## 362. [How to build a consistency model: Learning flow maps via self-distillation](https://arxiv.org/abs/2505.18825)


- 会议:NeurIPS2025

- 中文简介:把随机插值上的速度场写成 flow map X_{s,t}(x)=x+(t-s)v_{s,t}(x),用对角 flow matching 自蒸馏,再加入 Lagrangian、Eulerian 或 progressive semigroup 的离对角残差和 tangent 条件,使模型满足流的半群一致性并支持少步采样。

- 链接:[https://arxiv.org/abs/2505.18825](https://arxiv.org/abs/2505.18825)


## 363. [Uni-LoRA: One Vector is All You Need](https://arxiv.org/abs/2506.00799)


- 会议:NeurIPS2025

- 中文简介:把所有 LoRA 模块的高维参数展平为 theta_D,用固定稀疏 one-hot 且列归一化的投影 P 映射到低维 theta_d;训练唯一低维向量,前向时用 P theta_d 恢复全 LoRA 更新,P^T P=I 保留优化几何且投影成本为 O(D)。

- 链接:[https://arxiv.org/abs/2506.00799](https://arxiv.org/abs/2506.00799)


## 364. [Conformal Arbitrage: Risk-Controlled Balancing of Competing Objectives in Language Models](https://arxiv.org/abs/2506.00911)


- 会议:NeurIPS2025

- 中文简介:把 Primary 模型的动作按分数排序,取满足 lambda-relaxed 阈值的候选集;在 calibration 数据上用 conformal risk control 找到最小 lambda,使 Guardian 在候选集上的损失满足风险水平,再让 Guardian 从候选集选动作。

- 链接:[https://arxiv.org/abs/2506.00911](https://arxiv.org/abs/2506.00911)


## 365. [AI-Generated Video Detection via Perceptual Straightening](https://arxiv.org/abs/2507.00583)


- 会议:NeurIPS2025

- 中文简介:ReStraV 通过测量冻结的 DINOv2 特征轨迹中的感知直线度来检测 AI 生成的视频。它连接相邻帧上的 CLS/补丁特征,计算位移和曲率统计数据,并将 21 个手工制作的特征提供给标准分类器,而无需编码器微调。

- 链接:[https://arxiv.org/abs/2507.00583](https://arxiv.org/abs/2507.00583)


## 366. [Taming generative video models for zero-shot optical flow extraction](https://arxiv.org/abs/2507.09082)


- 会议:NeurIPS2025

- 中文简介:该论文通过在一个调节帧中的查询点放置一个小的高斯扰动,并在下一帧中获取干净与扰动的像素/logit 差异的 argmax,从冻结的生成视频模型中提取光流。 LRAS 通过补丁 KL 不一致和遮挡阈值改善了这一点。

- 链接:[https://arxiv.org/abs/2507.09082](https://arxiv.org/abs/2507.09082)


## 367. [Scaling Up Active Testing to Large Language Models](https://arxiv.org/abs/2508.09093)


- 会议:NeurIPS2025

- 中文简介:该论文通过从一个小的初始标签集构建一个固定的上下文替代项,将基于池的主动测试扩展到法学硕士。它根据代理/目标不一致(或省略目标预测时的代理熵)计算 LURE 获取概率,然后为单次运行添加引导方差/MSE 诊断。

- 链接:[https://arxiv.org/abs/2508.09093](https://arxiv.org/abs/2508.09093)


## 368. [DartQuant: Efficient Rotational Distribution Calibration for LLM Quantization](https://arxiv.org/abs/2511.04063)


- 会议:NeurIPS2025

- 中文简介:在 PTQ 校准阶段学习近似正交旋转,使激活分布远离零点:用 Whip 损失优化 latent 矩阵 Z,QR 得到 R,并以 Cayley 更新替代高成本参数化;将少量旋转插入量化 Transformer。

- 链接:[https://arxiv.org/abs/2511.04063](https://arxiv.org/abs/2511.04063)


## 369. [AdmTree: Compressing Lengthy Context with Adaptive Semantic Trees](https://arxiv.org/abs/2512.04550)


- 会议:NeurIPS2025

- 中文简介:以 entropy-adjusted PPL 找到信息密度边界,把叶片压成 gist token,再自底向上构造二叉语义树并用 self-attention 聚合;冻结 LLM,仅训练 gist 注意力/embedding/聚合器,以树结构压缩长上下文。

- 链接:[https://arxiv.org/abs/2512.04550](https://arxiv.org/abs/2512.04550)


## 370. [Know When to Abstain: Optimal Selective Classification with Likelihood Ratios](https://arxiv.org/abs/2505.15008)


- 会议:ICLR2026

- 中文简介:将接受与错误视为 Neyman-Pearson 检验,根据类别条件 Mahalanobis 或 KNN 距离估计正确/错误的似然比排序,并可选择添加 Logit 裕度以获得事后选择性分数。

- 链接:[https://arxiv.org/abs/2505.15008](https://arxiv.org/abs/2505.15008)


## 371. [When Style Breaks Safety: Defending LLMs Against Superficial Style Alignment](https://arxiv.org/abs/2506.07452)


- 会议:ICLR2026

- 中文简介:该论文识别了样式条件安全失败并介绍了 SafeStyle:从越狱提示中提取恶意意图,将表面样式分布与小型增强安全集进行匹配,并对模型进行微调,以便安全行为在列表、诗歌、新闻、法律、莎士比亚、代码和相关样式中保持一致。

- 链接:[https://arxiv.org/abs/2506.07452](https://arxiv.org/abs/2506.07452)


## 372. [Predicting LLM Reasoning Performance with Small Proxy Model](https://arxiv.org/abs/2509.21013)


- 会议:ICLR2026

- 中文简介:让 frontier 模型为每个数据集生成带每字母/词置信度的 reasoning trace,仅保留答案标签无关的轨迹;用 proxy tokenizer 对轨迹切词,并以 proxy token 的 NLL 乘以该 token 所含 frontier 字符概率的 MinMax 归一化均值,得到 rBridge 分数来排名训练数据和预测目标模型表现。

- 链接:[https://arxiv.org/abs/2509.21013](https://arxiv.org/abs/2509.21013)


## 373. [No Prompt Left Behind: Exploiting Zero-Variance Prompts in LLM Reinforcement Learning via Entropy-Guided Advantage Shaping](https://arxiv.org/abs/2509.21880)


- 会议:ICLR2026

- 中文简介:在 GRPO 中识别组内奖励方差为零的 prompt:全对组按 token 熵给正向 advantage,全错组按最大熵减当前熵给负向 advantage;非零方差样本仍用标准 GRPO,熵只作为 detached shaping 信号。

- 链接:[https://arxiv.org/abs/2509.21880](https://arxiv.org/abs/2509.21880)


## 374. [Conditional Advantage Estimation for Reinforcement Learning in Large Reasoning Models](https://arxiv.org/abs/2509.23962)


- 会议:ICLR2026

- 中文简介:按某个可计算指标(token entropy 或 response length)把 16 条采样响应分成两组;用跨组 advantage 比较不同指标趋势、组内 advantage 保留同组相对排序,再以 μ 混合两者并可对较长组加权,且随训练 schedule 调 μ。

- 链接:[https://arxiv.org/abs/2509.23962](https://arxiv.org/abs/2509.23962)


## 375. [Towards Safe Reasoning in Large Reasoning Models via Corrective Intervention](https://arxiv.org/abs/2509.24393)


- 会议:ICLR2026

- 中文简介:纠正干预(IPO)检测不安全推理轨迹中的第一个合规线索,用采样的安全触发器替换它,并生成正确的轨迹。在分歧点应用偏好优化,利用良性阶段 DPO/辅助 SFT 来保留效用并减少过度拒绝。

- 链接:[https://arxiv.org/abs/2509.24393](https://arxiv.org/abs/2509.24393)


## 376. [Specialization after Generalization: Towards Understanding Test-Time Training in Foundation Models](https://arxiv.org/abs/2509.24510)


- 会议:ICLR2026

- 中文简介:泛化后的专业化对距离测试点最近的 k 个训练示例执行测试时训练:它仅更新最后一个线性视觉层或小型 LoRA 语言适配器。在线性表示/SAE 视图下,局部邻居更新恢复了全局训练的表示叠加的稀疏概念。

- 链接:[https://arxiv.org/abs/2509.24510](https://arxiv.org/abs/2509.24510)


## 377. [Unmasking Backdoors: An Explainable Defense via Gradient-Attention Anomaly Scoring for Pre-trained Language Models](https://arxiv.org/abs/2510.04347)


- 会议:ICLR2026

- 中文简介:X-GRAAD 是文本分类器的推理时后门防御。它乘以归一化的输入梯度和注意列标记的重要性,标记高序列级异常,通过小字符编辑破坏可疑标记,并在不重新训练的情况下重新运行模型。

- 链接:[https://arxiv.org/abs/2510.04347](https://arxiv.org/abs/2510.04347)


## 378. [Semantic Regexes: Auto-Interpreting LLM Features with a Structured Language](https://arxiv.org/abs/2510.06378)


- 会议:ICLR2026

- 中文简介:语义正则表达式定义了一种小型结构化语言,用于解释稀疏自动编码器/LLM 特征:精确符号、句法词位、语义字段、上下文/组合、交替和量化被组合成类似正则表达式的描述。解释者法学硕士根据顶级激活编写表达式,评估者检查清晰度、检测性和一致性。

- 链接:[https://arxiv.org/abs/2510.06378](https://arxiv.org/abs/2510.06378)


## 379. [Attention Sinks and Compression Valleys in LLMs are Two Sides of the Same Coin](https://arxiv.org/abs/2510.06477)


- 会议:ICLR2026

- 中文简介:该论文将注意力池和压缩谷解释为一种解码器-Transformer 动态:BOS 大量激活出现在早期混合阶段和后期压缩/归一化阶段。它导出熵/各向异性/优势界限,用秩和列总和分数诊断阶段,并通过消除 BOS 汇的目标 MLP 消融来验证解释。

- 链接:[https://arxiv.org/abs/2510.06477](https://arxiv.org/abs/2510.06477)


## 380. [Adaptive Hopfield Network: Rethinking Similarities in Associative Memory](https://arxiv.org/abs/2511.20609)


- 会议:ICLR2026

- 中文简介:A-Hop 在变体分布下重新构建检索,并用可学习的自适应相似性取代固定的邻近度。它从最佳 k 维可分解子空间形成相似足迹,线性组合来自距离和点积基的足迹坐标,并将所得分数输入标准 softmax Hopfield 读数。

- 链接:[https://arxiv.org/abs/2511.20609](https://arxiv.org/abs/2511.20609)


## 381. [Overcoming Joint Intractability with Lossless Hierarchical Speculative Decoding](https://arxiv.org/abs/2601.05724)


- 会议:ICLR2026

- 中文简介:无损分层推测解码(HSD)概括了从标记决策到前缀/分支分歧的推测采样。它计算联合前缀比率和上限分支散度,向后扫描到第一个拒绝,在可访问分支上执行一次无损上限重采样,并继续目标/推测块。

- 链接:[https://arxiv.org/abs/2601.05724](https://arxiv.org/abs/2601.05724)


## 382. [Randomization Boosts KV Caching, Learning Balances Query Load: A Joint Perspective](https://arxiv.org/abs/2601.18999)


- 会议:ICLR2026

- 中文简介:RLT是针对前缀KV缓存的随机标记/驱逐策略; LBGR 使用基数树命中估计、衰减队列负载和每个工作线程在线残差回归来路由请求。它们共同优化缓存重用和多工作线程查询分配。

- 链接:[https://arxiv.org/abs/2601.18999](https://arxiv.org/abs/2601.18999)


## 383. [Scalable Exploration for High-Dimensional Continuous Control via Value-Guided Flow](https://arxiv.org/abs/2601.19707)


- 会议:ICLR2026

- 中文简介:FINO 将预定的高斯噪声注入到流匹配策略训练中,因此学习到的动作分布比离线数据具有更广泛的支持,然后对多个候选动作进行采样,并在 Q 值上使用熵自适应 softmax 来平衡在线微调期间的探索和利用。

- 链接:[https://arxiv.org/abs/2601.19707](https://arxiv.org/abs/2601.19707)


## 384. [FASA: FREQUENCY-AWARE SPARSE ATTENTION](https://arxiv.org/abs/2602.03152)


- 会议:ICLR2026

- 中文简介:FASA 是免训练的频率感知稀疏注意力。它将 RoPE 对划分为频率块,校准上下文一致性以选择主导块,将它们用于令牌选择 (TIP),然后仅计算所选令牌 (FAC) 的全部注意力,可选择将非主导 KV 条目卸载到 CPU,同时保留绝对位置。

- 链接:[https://arxiv.org/abs/2602.03152](https://arxiv.org/abs/2602.03152)


## 385. [Flow Matching with Injected Noise for Offline-to-Online Reinforcement Learning](https://arxiv.org/abs/2602.18117)


- 会议:ICLR2026

- 中文简介:FINO 将预定的高斯扰动注入流匹配策略训练中,以将动作支持扩大到离线数据集之外,然后在在线微调期间使用熵适应温度执行 Q 值加权候选采样。

- 链接:[https://arxiv.org/abs/2602.18117](https://arxiv.org/abs/2602.18117)


## 386. [Gumbel Distillation for Parallel Text Generation](https://arxiv.org/abs/2603.22216)


- 会议:ICLR2026

- 中文简介:甘贝尔蒸馏将自回归教师的抽样随机性转移给平行学生。它从教师输出中提取顺序或并行后 Gumbel 变量,将 softmax 归一化 Gumbel 向量投影到掩码令牌嵌入中,并训练以此教师信号为条件的掩码扩散或多令牌预测学生。

- 链接:[https://arxiv.org/abs/2603.22216](https://arxiv.org/abs/2603.22216)


## 387. [Binomial Gradient-Based Meta-Learning for Enhanced Meta-Gradient Estimation](https://arxiv.org/abs/2604.13263)


- 会议:ICLR2026

- 中文简介:BinomMAML 通过截断二项式展开近似雅可比/黑森因子的精确 MAML 元梯度积。它将近似值重新组织为级联向量 Hessian 产品,用扩展顺序和内存来换取可控的错误界限,同时保留与标准 MAML 学习器的兼容性。

- 链接:[https://arxiv.org/abs/2604.13263](https://arxiv.org/abs/2604.13263)


## 388. [Complementing Self-Consistency with Cross-Model Disagreement for Uncertainty Quantification](https://arxiv.org/abs/2604.17112)


- 会议:ICLR2026

- 中文简介:该方法通过跨模型分歧来增强模型内响应离散度(答案不确定性):对于每个模型,将跨模型语义相似性与其自身的自相似性进行比较,然后将此 EU 项添加到 AU 项中。句子嵌入相似性从黑盒模型响应中产生无需训练的总不确定性得分。

- 链接:[https://arxiv.org/abs/2604.17112](https://arxiv.org/abs/2604.17112)


## 389. [Conformal C2ST: Turning weak classifiers into strong two-sample tests](https://arxiv.org/abs/2507.17026)


- 会议:ICML2026

- 中文简介:把任意二分类器的分数先用独立或共享校准样本转换成 conformal p-values,再用 KS 均匀性检验(Uniform 版本)或共享校准样本上的 p-value U-statistic 及渐近修正(Multiple 版本)完成两样本检验。

- 链接:[https://arxiv.org/abs/2507.17026](https://arxiv.org/abs/2507.17026)


## 390. [SelfJudge: Faster Speculative Decoding via Self-Supervised Judge Verification](https://arxiv.org/abs/2510.02329)


- 会议:ICML2026

- 中文简介:用目标模型自身的前缀/后缀似然差异生成‘语义保持’二值标签,再在目标模型隐藏状态上训练轻量 logistic judge;在 speculative decoding 中将该 judge 与原有 token-alignment verifier 做 OR 组合来接受 draft。

- 链接:[https://arxiv.org/abs/2510.02329](https://arxiv.org/abs/2510.02329)


## 391. [Retaining by Doing: The Role of On-Policy Data in Mitigating Forgetting](https://arxiv.org/abs/2510.18874)


- 会议:ICML2026

- 中文简介:把 post-training 的关键数据选择改为 on-policy:RL 每步从当前策略采样;对于 SFT,则在每个 epoch 重新从当前/近似当前策略生成数据(Iterative-SFT),以 reverse-KL 的 mode-seeking 行为覆盖新任务而保留旧 mode。

- 链接:[https://arxiv.org/abs/2510.18874](https://arxiv.org/abs/2510.18874)


## 392. [A Judge-Aware Ranking Framework for Evaluating Large Language Models without Ground Truth](https://arxiv.org/abs/2601.21817)


- 会议:ICML2026

- 中文简介:法官感知排名框架符合 Bradley-Terry 成对模型,其中候选分数 s_i 和每个法官的歧视 γ_k 通过约束最大似然联合估计。可识别性约束和预计优化产量排名以及没有真实标签的不确定性。

- 链接:[https://arxiv.org/abs/2601.21817](https://arxiv.org/abs/2601.21817)


## 393. [S$^3$GNN: Efficient Global Mixing and Local Message Passing for Long-Range Graph Learning](https://arxiv.org/abs/2605.23467)


- 会议:ICML2026

- 中文简介:把每个连通分量的节点特征送入低秩全局混合 Pθ,并与按邻接的局部消息传递并行融合;用反对称特征变换保证 Jacobian 稳定,再堆叠标准 GNN 层。

- 链接:[https://arxiv.org/abs/2605.23467](https://arxiv.org/abs/2605.23467)


## 394. [Contribution Weights: A Geometrical Analysis of Self-Attention Transformers](https://arxiv.org/abs/2606.07604)


- 会议:ICML2026

- 中文简介:对每个 attention value 向量计算其对输出的投影贡献 c_ij,并分解为 attention 权重、相对 value 范数和 cosine alignment;跨 head 归一化后按未来 token 聚合得到 token importance,用 mask 的 comprehensiveness/sufficiency 测 faithfulness。

- 链接:[https://arxiv.org/abs/2606.07604](https://arxiv.org/abs/2606.07604)


## 395. [Item Response Scaling Laws: A Measurement Theory Approach for Efficient and Generalizable Neural Scaling Estimation](https://arxiv.org/abs/2606.07616)


- 会议:ICML2026

- 中文简介:把模型对题目的响应从 binary IRT 扩展为 Beta-IRT 的连续概率,联合估计题目难度/区分度与模型能力;用能力随 FLOP/测试时样本数的 scaling law 和 50 题自适应测试预测新模型表现。

- 链接:[https://arxiv.org/abs/2606.07616](https://arxiv.org/abs/2606.07616)


## 396. [Private Learning with Public Feature Conditioning](https://arxiv.org/abs/2606.18773)


- 会议:ICML2026

- 中文简介:在 label-DP/公共特征回归中,把公共特征先乘由公共矩阵谱构造的 conditioning matrix C,再运行标准 DPSGD;复杂模型可先用 Cond-DP、后切换 DPSGD,线性回归给出 SVD 预条件的收敛改进。

- 链接:[https://arxiv.org/abs/2606.18773](https://arxiv.org/abs/2606.18773)


## 397. [Bayesian Concept Bottleneck Models with LLM Priors](https://arxiv.org/abs/2410.15555)


- 会议:NeurIPS2025

- 中文简介:在 CBM 的概念变量选择中,用 LLM 基于数据子集提出候选概念和 partial posterior,再用留出子集的 partial Bayes factor 做 multiple-try Metropolis 接受/拒绝;Gibbs 样本形成概念后验与 ensemble。

- 链接:[https://arxiv.org/abs/2410.15555](https://arxiv.org/abs/2410.15555)


## 398. [Interpretable Next-token Prediction via the Generalized Induction Head](https://arxiv.org/abs/2411.00066)


- 会议:NeurIPS2025

- 中文简介:在上下文中检索与末尾 n-gram 最相似的历史片段,用其后继 token 预测;精确匹配与由小型蒸馏 Transformer 计算的 fuzzy similarity 组合,并按 effective-n 阈值与 InfiniGram 参考语料融合。

- 链接:[https://arxiv.org/abs/2411.00066](https://arxiv.org/abs/2411.00066)


## 399. [Fast Solvers for Discrete Diffusion Models: Theory and Applications of High-Order Algorithms](https://arxiv.org/abs/2502.00234)


- 会议:NeurIPS2025

- 中文简介:将二阶theta-RK-2和theta-Trapezoidal数值积分器应用于离散扩散模型的反向连续时间马尔可夫链,重用现有的评分网络以减少函数评估的次数。

- 链接:[https://arxiv.org/abs/2502.00234](https://arxiv.org/abs/2502.00234)


## 400. [FastVID: Dynamic Density Pruning for Fast Video Large Language Models](https://arxiv.org/abs/2503.11187)


- 会议:NeurIPS2025

- 中文简介:首先使用过渡余弦相似性对帧进行分割,然后将冗余标记与密度感知锚点合并,并使用基于 SigLIP 的注意力分数选择显着标记,从而无需重新训练即可修剪视频标记。

- 链接:[https://arxiv.org/abs/2503.11187](https://arxiv.org/abs/2503.11187)


## 401. [Understanding LLM Behaviors via Compression: Data Generation, Knowledge Acquisition and Scaling Laws](https://arxiv.org/abs/2504.09597)


- 会议:NeurIPS2025

- 中文简介:使用两部分/算术代码长度和语法知识分层贝叶斯模型将 LLM 建模为压缩器:有限维语法与 Pitman-Yor 非参数知识分布相结合,以导出学习顺序、幻觉、微调和缩放预测。

- 链接:[https://arxiv.org/abs/2504.09597](https://arxiv.org/abs/2504.09597)


## 402. [ItDPDM: Information-Theoretic Discrete Poisson Diffusion Model](https://arxiv.org/abs/2505.05082)


- 会议:NeurIPS2025

- 中文简介:ItDPDM 用泊松噪声链 z_gamma~Poisson(gamma x) 代替高斯扩散,并使用泊松重建损失 x log(x/xhat)-x+xhat 训练降噪器。该论文从精确的泊松似然推导 MPRL/I-MPRL,使用 log-SNR 重要性求积,并使用标准 MLP、U-Net 或 ConvTransformer 降噪器运行相应的反向泊松链。

- 链接:[https://arxiv.org/abs/2505.05082](https://arxiv.org/abs/2505.05082)


## 403. [Incremental Sequence Classification with Temporal Consistency](https://arxiv.org/abs/2505.16548)


- 会议:NeurIPS2025

- 中文简介:时间一致性 (TC) 使用恒等式 p(y|s_t)=E\[p(y|s_{t+1})|s_t\] 针对下一状态预测训练增量显示序列的每个前缀。 TC-lambda 用未来教师预测的几何加权混合来插值最终的硬标签,其中 lambda=0 恢复 TC,lambda=1 恢复延迟交叉熵;目标模型不断迭代更新。

- 链接:[https://arxiv.org/abs/2505.16548](https://arxiv.org/abs/2505.16548)


## 404. [Unlearned but Not Forgotten: Data Extraction after Exact Unlearning in LLM](https://arxiv.org/abs/2505.24379)


- 会议:NeurIPS2025

- 中文简介:攻击比较 exact unlearning 前后的 logits,用 reversed model guidance 近似恢复 pre-model 偏好的 token,并以 pre-model 高概率过滤候选后贪心解码已知 prefix 的记忆。

- 链接:[https://arxiv.org/abs/2505.24379](https://arxiv.org/abs/2505.24379)


## 405. [EvaLearn: Quantifying the Learning Capability and Efficiency of LLMs via Sequential Problem Solving](https://arxiv.org/abs/2506.02672)


- 会议:NeurIPS2025

- 中文简介:EvaLearn 是顺序学习能力 benchmark:将 648 道题组织为 182 个七题序列,比较 zero-shot、demo、feedback 后的逐题表现,并以 sequence accuracy、学习斜率、首次正确位置和连续正确 streak 量化学习效率。

- 链接:[https://arxiv.org/abs/2506.02672](https://arxiv.org/abs/2506.02672)


## 406. [Robustness in Both Domains: CLIP Needs a Robust Text Encoder](https://arxiv.org/abs/2506.03355)


- 会议:NeurIPS2025

- 中文简介:LEAF 将 FARE 式鲁棒目标扩展到 CLIP text encoder:在 Levenshtein 距离和语义约束内做字符替换,最大化干净/对抗文本 embedding 距离,再训练编码器匹配干净 embedding;可与鲁棒 image encoder 组合。

- 链接:[https://arxiv.org/abs/2506.03355](https://arxiv.org/abs/2506.03355)


## 407. [Regression-adjusted Monte Carlo Estimators for Shapley Values and Probabilistic Values](https://arxiv.org/abs/2506.11849)


- 会议:NeurIPS2025

- 中文简介:回归 MSR 将采样子集分割成多个折叠,在其他折叠上拟合黑盒值函数的回归代理,并使用每个概率值的保留残差来校正代理预测;对校正后的估计进行平均,重复使用样本,同时保持无偏性。附录中提供了特定于树的递归。

- 链接:[https://arxiv.org/abs/2506.11849](https://arxiv.org/abs/2506.11849)


## 408. [Valid Inference with Imperfect Synthetic Data](https://arxiv.org/abs/2508.06635)


- 会议:NeurIPS2025

- 中文简介:该方法在矩估计器的广义方法中用完全合成的文本矩增强了标记/LLM代理矩。两步 GMM 首先估计目标系数和辅助系数,然后使用估计的逆协方差来提高效率;该论文证明了综合残差预测真实结果时的一致性、渐近正态性和方差减少。

- 链接:[https://arxiv.org/abs/2508.06635](https://arxiv.org/abs/2508.06635)


## 409. [HyperET: Efficient Training in Hyperbolic Space for Multi-modal Large Language Models](https://arxiv.org/abs/2510.20322)


- 会议:NeurIPS2025

- 中文简介:HyperET 将视觉权重/表示映射到庞加莱球,并学习通过莫比乌斯乘法应用的结构化缩放矩阵,直接调整双曲半径,使视觉粒度与语言保持一致,同时添加低于 1% 的参数。

- 链接:[https://arxiv.org/abs/2510.20322](https://arxiv.org/abs/2510.20322)


## 410. [C3PO: Optimized Large Language Model Cascades with Probabilistic Cost Constraints for Reasoning](https://arxiv.org/abs/2511.07396)


- 会议:NeurIPS2025

- 中文简介:C3PO 通过使用离散网格搜索最小化针对最强大模型的未标记分歧/遗憾来学习连续 LLM 级联的置信阈值,然后使用保留的共形校准集来限制预算违规概率和 PAC-Bayes/有限类边界以进行泛化。

- 链接:[https://arxiv.org/abs/2511.07396](https://arxiv.org/abs/2511.07396)


## 411. [Adaptive Discretization for Consistency Models](https://arxiv.org/abs/2510.17266)


- 会议:NeurIPS2025

- 中文简介:ADCM 联合训练一致性模型和自适应时间离散化:局部一致性损失和全局去噪误差约束形成拉格朗日,高斯-牛顿更新选择时间间隔,鲁棒误差加权稳定调度。

- 链接:[https://arxiv.org/abs/2510.17266](https://arxiv.org/abs/2510.17266)


## 412. [A Simple "Motivation" Can Enhance Reinforcement Finetuning of Large Reasoning Models](https://arxiv.org/abs/2506.18485)


- 会议:ICLR2026

- 中文简介:MeRF 只是将可验证奖励函数的自然语言描述注入到每个 RLVR 训练提示中,允许 LLM 看到优化目标,而 GRPO 仍然提供外部奖励和策略更新。

- 链接:[https://arxiv.org/abs/2506.18485](https://arxiv.org/abs/2506.18485)


## 413. [VSF: Simple, Efficient, and Effective Negative Guidance in Few-Step Image Generation Models By Value Sign Flip](https://arxiv.org/abs/2508.10931)


- 会议:ICLR2026

- 中文简介:值符号翻转 (VSF) 通过保留负提示键,同时在交叉注意力中符号翻转和缩放其值向量,以及针对 MMDiT 的模型特定屏蔽/复制来实现负指导。动态令牌/层/步权重是可选的;与无分类器指导不同,它避免了第二次完整的去噪过程。

- 链接:[https://arxiv.org/abs/2508.10931](https://arxiv.org/abs/2508.10931)


## 414. [Inoculation Prompting: Eliciting traits from LLMs during training can reduce trait expression at test-time](https://arxiv.org/abs/2510.04340)


- 会议:ICLR2026

- 中文简介:接种提示会在微调过程中预先添加一个系统提示,该提示会明确引发目标特征,然后在测试时删除该提示。该干预措施可以选择性地减少某种特征的默认表达,同时保留其他行为,并在语言、代码、后门防御和潜意识偏好设置上进行了测试。

- 链接:[https://arxiv.org/abs/2510.04340](https://arxiv.org/abs/2510.04340)


## 415. [Spilling the Beans: Teaching LLMs to Self-Report Their Hidden Objectives](https://arxiv.org/abs/2511.06626)


- 会议:ICLR2026

- 中文简介:自我报告微调(SRFT)对事实问题的模型进行微调,故意给出正确和错误的答案,然后训练它诚实地回答入学问题。由此产生的承认行为转移到隐藏目标的隐形特工任务,并让审讯揭示客观的存在和内容。

- 链接:[https://arxiv.org/abs/2511.06626](https://arxiv.org/abs/2511.06626)


## 416. [MrRoPE: Mixed-radix Rotary Position Embedding](https://arxiv.org/abs/2601.22181)


- 会议:ICLR2026

- 中文简介:MrRoPE 给出 RoPE 扩展的混合基数解释,并仅编辑其频率尺度。 MrRoPE-Uni 使用统一的中间维度缩放,而 MrRoPE-Pro 逐步缩放这些维度,保持低/高状态不变;两者都无需培训。

- 链接:[https://arxiv.org/abs/2601.22181](https://arxiv.org/abs/2601.22181)


## 417. [Sharpness-Aware Minimization Can Hallucinate Minimizers](https://arxiv.org/abs/2509.21818)


- 会议:ICML2026

- 中文简介:该论文表明,标准 SAM 可以在扰动点的梯度为零而原始梯度非零的情况下收敛,从而创建一个幻觉的最小化器。它证明了非凸景观的存在/动态,并建议在启用 SAM 之前进行短暂的 SGD 热启动。

- 链接:[https://arxiv.org/abs/2509.21818](https://arxiv.org/abs/2509.21818)


## 418. [Unraveling Syntax: Language Modeling and the Substructure of Grammars](https://arxiv.org/abs/2510.02524)


- 会议:ICML2026

- 中文简介:Unraveling Syntax 定义了 PCFG 的内部/外部子语法,并证明了一种独特的分解 DAG,其中自回归语言模型损失在子语法上递归分解。在独立推论下,梯度下降并行学习子语法;小型 nanoGPT 实验测试预训练和表示对齐。

- 链接:[https://arxiv.org/abs/2510.02524](https://arxiv.org/abs/2510.02524)


## 419. [A Diffusive Classification Loss for Learning Energy-based Generative Models](https://arxiv.org/abs/2601.21025)


- 会议:ICML2026

- 中文简介:DiffCLF 在时间索引扩散边际上训练能量模型,具有联合去噪分数匹配损失和多类分类损失。 logit 类识别扩散时间并学习归一化自由能偏移,从而实现密度比和基于能量的采样。

- 链接:[https://arxiv.org/abs/2601.21025](https://arxiv.org/abs/2601.21025)


## 420. [Noisy Pairwise-Comparison Random Search for Smooth Nonconvex Optimization](https://arxiv.org/abs/2601.21166)


- 会议:ICML2026

- 中文简介:NCRS 使用高斯方向探针和噪声成对接受/拒绝比较执行无导数优化。它重复比较以获得依赖于置信度的决策,并证明平滑非凸目标的依赖于间隙的速率。

- 链接:[https://arxiv.org/abs/2601.21166](https://arxiv.org/abs/2601.21166)


## 421. [Optimal Bayesian Stopping for Efficient Inference of Consistent LLM Answers](https://arxiv.org/abs/2602.05395)


- 会议:ICML2026

- 中文简介:停止规则对 iid 分类 LLM 答案进行采样,保留顶部 L-1 答案计数并将尾部聚合到动态编程后验中。当当前领导者为真模式的后验概率超过 1-delta 时停止; L=3 显示渐近匹配精确后验,同时避免阶乘状态枚举。

- 链接:[https://arxiv.org/abs/2602.05395](https://arxiv.org/abs/2602.05395)


## 422. [Semi-Supervised Learning with Noisy Proxy Covariates: Generalization Bounds and Distribution Regression](https://arxiv.org/abs/2606.00512)


- 会议:ICML2026

- 中文简介:使用所有 N 个噪声代理协变量来估计核协方差算子及其前 s 个特征特征,然后仅使用 n 个标记代理/结果对对这些特征特征进行岭回归拟合;选择截断和正则化进行分布回归。

- 链接:[https://arxiv.org/abs/2606.00512](https://arxiv.org/abs/2606.00512)


## 423. [Unveiling the Entropy Dynamics of Chain-of-Thought Reasoning](https://arxiv.org/abs/2606.02020)


- 会议:ICML2026

- 中文简介:估计中间思想链答案的二态熵动力学,使用 CUSUM 对数似然统计来检测从不确定性到置信度和提前退出的转变,并使用相同的统计来计算测试时投票权重。

- 链接:[https://arxiv.org/abs/2606.02020](https://arxiv.org/abs/2606.02020)


## 424. [SHAP values via sparse Fourier representation](https://arxiv.org/abs/2410.06300)


- 会议:NeurIPS2025

- 中文简介:使用稀疏 Walsh-Hadamard/Fourier 展开来近似二元/分类黑盒预测器,然后通过对保留的 Fourier 基贡献求和,以闭合形式计算每个特征的干预 SHAP 值。

- 链接:[https://arxiv.org/abs/2410.06300](https://arxiv.org/abs/2410.06300)


## 425. [Soft Thinking: Unlocking the Reasoning Potential of LLMs in Continuous Concept Space](https://arxiv.org/abs/2505.15778)


- 会议:NeurIPS2025

- 中文简介:将离散的下一个令牌推理决策替换为前 n 个令牌嵌入的概率加权混合(“软思维”),并使用基于熵的冷停止来停止连续循环;这是无需训练的推理。

- 链接:[https://arxiv.org/abs/2505.15778](https://arxiv.org/abs/2505.15778)


## 426. [Progressive Data Dropout: An Embarrassingly Simple Approach to Train Faster](https://arxiv.org/abs/2505.22342)


- 会议:NeurIPS2025

- 中文简介:渐进式数据丢失仅更改训练循环:每个时期都在由基于置信度的 DBPD、标量随机衰减 (SRD) 或计划匹配随机丢失 (SMRD) 选择的缩小子集上进行训练,然后是最终的全数据修订时期。

- 链接:[https://arxiv.org/abs/2505.22342](https://arxiv.org/abs/2505.22342)


## 427. [Instance-Optimality for Private KL Distribution Estimation](https://arxiv.org/abs/2505.23620)


- 会议:NeurIPS2025

- 中文简介:使用双分割泊松直方图估计器:类似古德图灵的后半部分估计低计数符号的质量,而高计数符号使用噪声/截断计数;中央 DP 噪声阈值将各个区域分开,然后进行标准化。证明了匹配实例最优上限和 Assouad 下限。

- 链接:[https://arxiv.org/abs/2505.23620](https://arxiv.org/abs/2505.23620)


## 428. [How Does Label Noise Gradient Descent Improve Generalization in the Low SNR Regime?](https://arxiv.org/abs/2510.17526)


- 会议:NeurIPS2025

- 中文简介:Label-noise GD 在每次梯度更新前随机翻转训练标签,利用低 SNR 下噪声梯度的振荡抑制网络记忆噪声;模型、损失和每步计算仍是普通 GD。

- 链接:[https://arxiv.org/abs/2510.17526](https://arxiv.org/abs/2510.17526)


## 429. [AlignFlow: Improving Flow-based Generative Models with Semi-Discrete Optimal Transport](https://arxiv.org/abs/2510.15038)


- 会议:ICLR2026

- 中文简介:AlignFlow 先用 semi-discrete optimal transport 将连续噪声映射到经验数据点,得到确定性 noise-data coupling;再把该 coupling 作为任意 flow-matching/shortcut/MeanFlow/rectified-flow 模型的训练对,必要时用 rebalancing 修正映射误差。

- 链接:[https://arxiv.org/abs/2510.15038](https://arxiv.org/abs/2510.15038)


## 430. [Measurement-Consistent Langevin Corrector for Stabilizing Latent Diffusion Inverse Problem Solvers](https://arxiv.org/abs/2601.04791)


- 会议:ICML2026

- 中文简介:MCLC 在 latent diffusion inverse solver 的每个 Langevin corrector 中,把 score drift 和噪声投影到测量梯度的正交子空间,因而一阶不改变 measurement residual,同时允许 KL 稳定性下降;其余采样器保持不变。

- 链接:[https://arxiv.org/abs/2601.04791](https://arxiv.org/abs/2601.04791)


## 431. [RE-PO: Robust Enhanced Policy Optimization as a General Framework for LLM Alignment](https://arxiv.org/abs/2509.24159)


- 会议:ICLR2026

- 中文简介:RE-PO 用 EM 风格的潜在正确性/可靠性模型包装偏好对齐:E-step 估计每个偏好标签的后验可靠性,M-step 重新加权任何支持的偏好损失,同时使用小批量 EMA 更新可靠性。

- 链接:[https://arxiv.org/abs/2509.24159](https://arxiv.org/abs/2509.24159)


## 432. [Asynchronous Denoising Diffusion Models for Aligning Text-to-Image Generation](https://arxiv.org/abs/2510.04504)


- 会议:ICLR2026

- 中文简介:AsynDM 用像素级状态替换共享扩散时间步长:交叉注意掩码识别与提示相关的像素,这些像素遵循凹/慢速调度程序,而其他像素遵循标准调度程序,并且预训练的降噪器与生成的时间步长张量一起运行。

- 链接:[https://arxiv.org/abs/2510.04504](https://arxiv.org/abs/2510.04504)


## 433. [Multiple-Prediction-Powered Inference](https://arxiv.org/abs/2603.27414)


- 会议:ICLR2026

- 中文简介:把一次昂贵预测任务写成带预算的多预测分配:对随机标签/模型输出向量估计协方差,在成本约束下选择样本子集和线性权重,使估计无偏并最小化 MSE;已知/未知协方差时分别用 SOCP/SDP 或 minimax 近似求解。

- 链接:[https://arxiv.org/abs/2603.27414](https://arxiv.org/abs/2603.27414)


## 434. [Emergence of Hierarchical Emotion Organization in Large Language Models](https://arxiv.org/abs/2507.10599)


- 会议:ICML2026

- 中文简介:给模型输入大量情境,收集预定义情绪词的 next-token 概率,计算情绪条件共现/匹配矩阵并阈值化成父子层级树,再与 Shaver wheel/人类标签和其他分类层级比较。

- 链接:[https://arxiv.org/abs/2507.10599](https://arxiv.org/abs/2507.10599)


## 435. [Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning](https://arxiv.org/abs/2509.24372)


- 会议:ICML2026

- 中文简介:对完整参数加高斯扰动,分别用多个 seed/rollout 计算标量 reward,按 z-score 加权噪声平均更新参数 theta←theta+alpha/N sum Z_n epsilon_n;通过种子复现和层内原位扰动实现无梯度 ES。

- 链接:[https://arxiv.org/abs/2509.24372](https://arxiv.org/abs/2509.24372)


## 436. [Equivalence of Context and Parameter Updates in Modern Transformer Blocks](https://arxiv.org/abs/2511.17864)


- 会议:ICML2026

- 中文简介:在具 controllability 的 Transformer block 中,用上下文 hidden state z 产生等价的 rank-1 参数 patch:Delta W_gate/W_up = W(z_C-z)z^T/||z||^2,并用门值差分 Delta m=(v_C-v)除以激活函数对参数更新;证明单层/多层 context 与 parameter update 等价。

- 链接:[https://arxiv.org/abs/2511.17864](https://arxiv.org/abs/2511.17864)


## 437. [MentisOculi: Revealing the Limits of Reasoning with Mental Imagery](https://arxiv.org/abs/2602.02465)


- 会议:ICML2026

- 中文简介:MentisOculi 是心理意象推理的程序化、分层基准:在受控难度级别生成五个视觉多步骤任务系列,渲染地面实况/解决方案视觉效果,并将纯文本、显式图像、潜在视觉和视频推理策略与标准化评分和人类心理物理学进行比较。

- 链接:[https://arxiv.org/abs/2602.02465](https://arxiv.org/abs/2602.02465)


## 438. [Optimal Control for Transformer Architectures: Enhancing Generalization, Robustness and Efficiency](https://arxiv.org/abs/2505.13499)


- 会议:NeurIPS2025

- 中文简介:用一个连续时间动力系统替换有限的 Transformer 堆栈,该系统的速度场像 Transformer 一样进行参数化,并使用最佳传输速度能量正则化器训练终端任务损失。

- 链接:[https://arxiv.org/abs/2505.13499](https://arxiv.org/abs/2505.13499)


## 439. [Adaptive Moments are Surprisingly Effective for Plug-and-Play Diffusion Sampling](https://arxiv.org/abs/2603.16797)


- 会议:ICLR2026

- 中文简介:将每个扩散步骤中的原始即插即用似然梯度替换为 Adam 式偏差校正的第一和第二时刻的指数移动平均值。

- 链接:[https://arxiv.org/abs/2603.16797](https://arxiv.org/abs/2603.16797)


## 440. [Convergent Differential Privacy Analysis for General Federated Learning](https://arxiv.org/abs/2408.15621)


- 会议:ICLR2026

- 中文简介:通过移动插值路径并应用分离模型和数据敏感性的分裂算子来分析客户端级高斯噪声 FL,从而在多个学习率计划下为 Noisy-FedAvg 和 Noisy-FedProx 生成收敛的 f-DP/隐私边界。

- 链接:[https://arxiv.org/abs/2408.15621](https://arxiv.org/abs/2408.15621)


## 441. [Navigating the Latent Space Dynamics of Neural Models](https://arxiv.org/abs/2505.22785)


- 会议:ICLR2026

- 中文简介:在模型的潜在空间中迭代残差图 f(z)=E(D(z))−z,使用其定点吸引子作为学习原型的字典,并通过吸引子距离和稀疏重建来探测记忆/泛化或 OOD 行为。

- 链接:[https://arxiv.org/abs/2505.22785](https://arxiv.org/abs/2505.22785)


## 442. [From Neural Networks to Logical Theories: The Correspondence between Fibring Modal Logics and Fibring Neural Networks](https://arxiv.org/abs/2509.23912)


- 会议:ICLR2026

- 中文简介:将有向纤维网络及其组成层表示为兼容的纤维克里普克/模态理论,然后证明当相应的神经网络对布尔输入进行分类时,特征纤维公式完全正确。

- 链接:[https://arxiv.org/abs/2509.23912](https://arxiv.org/abs/2509.23912)


## 443. [On the Expressive Power of GNNs for Boolean Satisfiability](https://arxiv.org/abs/2602.08745)


- 会议:ICLR2026

- 中文简介:将 SAT 公式编码为带有负边的无损文字子句图,并准确地表征通过 k 维 Weisfeiler-Leman 细化区分的可满足/不可满足实例,包括 CFI 风格的不可区分族和正平面/随机情况。

- 链接:[https://arxiv.org/abs/2602.08745](https://arxiv.org/abs/2602.08745)


## 444. [FedRot-LoRA: Mitigating Rotational Misalignment in Federated LoRA](https://arxiv.org/abs/2602.23638)


- 会议:ICML2026

- 中文简介:在联合平均之前,通过交替正交 Procrustes 旋转(或软 SVD 旋转)将每个客户端的 LoRA 因子与参考基础对齐,然后对对齐的因子进行平均以在 LoRA 的旋转不变性下保留表示的更新。

- 链接:[https://arxiv.org/abs/2602.23638](https://arxiv.org/abs/2602.23638)


## 445. [Sinkhorn Treatment Effects: A Causal Optimal Transport Measure](https://arxiv.org/abs/2605.08485)


- 会议:ICML2026

- 中文简介:将分布处理效应定义为反事实结果分布之间的 Sinkhorn 散度,使用双稳健单步估计器和二阶影响函数校正对其进行估计,并聚合熵正则化以进行稳健测试。

- 链接:[https://arxiv.org/abs/2605.08485](https://arxiv.org/abs/2605.08485)


## 446. [Ravan: Multi-Head Low-Rank Adaptation for Federated Fine-Tuning](https://arxiv.org/abs/2506.05568)


- 会议:NeurIPS2025

- 中文简介:将每个联合权重更新表示为多个固定基增强 LoRA 头 s_i B_i H_i A_i 的总和,仅训练 H_i 和缩放因子,并对每个头的产品进行平均,以便聚合保持准确,同时有效排名增加。

- 链接:[https://arxiv.org/abs/2506.05568](https://arxiv.org/abs/2506.05568)


## 447. [StelLA: Subspace Learning in Low-rank Adaptation using Stiefel Manifold](https://arxiv.org/abs/2510.01938)


- 会议:NeurIPS2025

- 中文简介:StelLA 用三因子适配器 W+alpha/r U S V^T 取代了二因子 LoRA 更新,将 U 和 V 约束到 Stiefel 流形,并在其他标准 PEFT 优化器内应用黎曼梯度投影、极坐标/SVD 回缩和梯度缩放。

- 链接:[https://arxiv.org/abs/2510.01938](https://arxiv.org/abs/2510.01938)


## 448. [ModHiFi: Identifying High Fidelity predictive components for Model Modification](https://arxiv.org/abs/2511.19566)


- 会议:NeurIPS2025

- 中文简介:ModHiFi 通过理论上推导的子集保真度度量和最佳补偿对输入/组件进行评分,从未标记的合成或校准样本中选择前 k 个高保真组件,并通过补偿将非 HiFi 组件归零来修改模型;相同的分数针对的是课堂遗忘成分。

- 链接:[https://arxiv.org/abs/2511.19566](https://arxiv.org/abs/2511.19566)


## 449. [Explaining Grokking and Information Bottleneck through Neural Collapse Emergence](https://arxiv.org/abs/2509.20829)


- 会议:ICLR2026

- 中文简介:该论文通过群体内类方差/RNC1 解释了摸索、信息瓶颈和神经崩溃:它推导出泛化和冗余信息界限以及训练损失收敛和神经崩溃时间之间的权重衰减梯度动态分离。

- 链接:[https://arxiv.org/abs/2509.20829](https://arxiv.org/abs/2509.20829)


## 450. [SLM-MUX: Orchestrating Small Language Models for Reasoning](https://arxiv.org/abs/2510.05077)


- 会议:ICLR2026

- 中文简介:SLM-MUX 独立对多个语言模型进行采样,选择每个模型最常见的答案作为自洽置信度,并路由到具有最高置信度的模型(验证准确性打破平局)。详尽的并集准确性/矛盾搜索选择互补的模型子集,并且额外的样本提供测试时间缩放。

- 链接:[https://arxiv.org/abs/2510.05077](https://arxiv.org/abs/2510.05077)


## 451. [R2-Dreamer: Redundancy-Reduced World Models without Decoders or Augmentation](https://arxiv.org/abs/2603.18202)


- 会议:ICLR2026

- 中文简介:R2-Dreamer 删除 Dreamer 的图像 decoder 和外部数据增强,用自然的两路信号(图像编码 e_t 与 RSSM latent 经 projector 得到的 k_t)做 Barlow Twins redundancy-reduction;RSSM、奖励/继续预测和 actor-critic 保持原样。

- 链接:[https://arxiv.org/abs/2603.18202](https://arxiv.org/abs/2603.18202)


## 452. [Universal Approximation with Softmax Attention](https://arxiv.org/abs/2504.15956)


- 会议:ICML2026

- 中文简介:证明 softmax attention 可用可学习的插值 anchors 近似截断线性/广义 ReLU:低温 softmax 近似 one-hot 选点,多头覆盖分段区域;两层 attention 可逼近紧集上的连续序列到序列函数,并可实现特定 in-context gradient descent。

- 链接:[https://arxiv.org/abs/2504.15956](https://arxiv.org/abs/2504.15956)


## 453. [Sampling from Your Language Model One Byte at a Time](https://arxiv.org/abs/2506.14123)


- 会议:ICML2026

- 中文简介:ByteSampler 构造 Valid Covering Tree:对 BPE token 的字节前缀建立紧凑树,汇总叶节点概率来精确采样完整 token/下一个 byte,并在每次 byte 输出后增量更新,避免逐 token 拒绝采样。

- 链接:[https://arxiv.org/abs/2506.14123](https://arxiv.org/abs/2506.14123)


## 454. [Probabilistic Performance Guarantees for Multi-Task Reinforcement Learning](https://arxiv.org/abs/2602.02098)


- 会议:ICML2026

- 中文简介:对每个 i.i.d. 任务用多次 rollout 构造性能下置信界,再数出低于阈值 B 的任务数,并用 binomial/order-statistic 场景界把该计数提升为新任务分布上的概率证书;对多个候选阈值用 union bound。

- 链接:[https://arxiv.org/abs/2602.02098](https://arxiv.org/abs/2602.02098)


## 455. [MaxSup: Overcoming Representation Collapse in Label Smoothing](https://arxiv.org/abs/2502.15798)


- 会议:NeurIPS2025

- 中文简介:把 label smoothing 的 regularizer 从真实类 logit z_gt 改为当前所有类别中的最大 logit z_max:`CE(logits,y)+alpha*(z_max-mean(logits))`,因此模型误分类时也压制错误 top-1 logit,避免 error amplification。

- 链接:[https://arxiv.org/abs/2502.15798](https://arxiv.org/abs/2502.15798)


## 456. [On the Universal Near Optimality of Hedge in Combinatorial Settings](https://arxiv.org/abs/2510.17099)


- 会议:NeurIPS2025

- 中文简介:在组合动作集上使用经典的 Hedge 并证明普遍的近最优后悔下/上关系;当操作集呈指数级大时,使用特定于结构的 OMD 正则化器或高效内核。

- 链接:[https://arxiv.org/abs/2510.17099](https://arxiv.org/abs/2510.17099)


## 457. [An Embarrassingly Simple Way to Optimize Orthogonal Matrices at Scale](https://arxiv.org/abs/2602.14656)


- 会议:ICML2026

- 中文简介:将 Landing 的类似 SGD 的正常更新替换为线性/自适应基础优化器和五矩阵乘积跳跃着陆重复步骤,其四次着陆多项式选择接近流形的步长,从而保持正交矩阵在规模上可行。

- 链接:[https://arxiv.org/abs/2602.14656](https://arxiv.org/abs/2602.14656)


## 458. [Probably Approximately Correct Labels](https://arxiv.org/abs/2506.10908)


- 会议:ICML2026

- 中文简介:给定廉价标签和标量不确定性,使用小型专家试点样本来建立有效的误差置信上限作为不确定性的函数;选择界限超过目标误差的最低阈值,并仅查询高于该阈值的专家。

- 链接:[https://arxiv.org/abs/2506.10908](https://arxiv.org/abs/2506.10908)


## 459. [Remasking Discrete Diffusion Models with Inference-Time Scaling](https://arxiv.org/abs/2503.00307)


- 会议:NeurIPS2025

- 中文简介:ReMDM 用重新屏蔽采样器取代了预训练屏蔽离散扩散模型的一次性向后过程:令牌逻辑/置信度和时间表确定哪些令牌被取消屏蔽、重新屏蔽和重新访问;开关/循环和引导变体控制推理时间计算。

- 链接:[https://arxiv.org/abs/2503.00307](https://arxiv.org/abs/2503.00307)


## 460. [Online Pseudo-Zeroth-Order Training of Neuromorphic Spiking Neural Networks](https://arxiv.org/abs/2407.12516)


- 会议:ICLR2026

- 中文简介:OPZO 使用伪零阶损失梯度在线训练尖峰神经网络:单点扰动估计输出损失方向,而动量反馈连接积累雅可比行列式信息并将局部误差信号发送到隐藏层。

- 链接:[https://arxiv.org/abs/2407.12516](https://arxiv.org/abs/2407.12516)


## 461. [MiSS: Revisiting the Trade-off in LoRA with an Efficient Shard-Sharing Structure](https://arxiv.org/abs/2409.15371)


- 会议:ICLR2026

- 中文简介:MiSS 通过跨权重分片共享一个可训练的低秩矩阵来修改 LoRA。共享更新以有效的聚合形式应用,减少可训练参数、优化自由度、内存和 FLOP,同时保留标准 PEFT 插入点。

- 链接:[https://arxiv.org/abs/2409.15371](https://arxiv.org/abs/2409.15371)


## 462. [Decoupling Dynamical Richness from Representation Learning: Towards Practical Measurement](https://arxiv.org/abs/2410.04264)


- 会议:ICLR2026

- 中文简介:该论文从最小投影算子中定义了一种与模型和标签无关的动态丰富度度量:将 MP 诱导的特征核与使用 CKA 学习到的特征核进行比较,并以 1 减去相似度作为丰富度得分。

- 链接:[https://arxiv.org/abs/2410.04264](https://arxiv.org/abs/2410.04264)


## 463. [Why Ask One When You Can Ask $k$? Learning-to-Defer to the Top-$k$ Experts](https://arxiv.org/abs/2504.12988)


- 会议:ICLR2026

- 中文简介:Top-k 延迟学习通过统一的 k 独立代理替代固定基数咨询,该代理选择具有最低预期成本的 k 个实体,然后使用基数函数对其进行扩展,该基数函数从边际预测收益与咨询成本中选择 Top-k(x)。

- 链接:[https://arxiv.org/abs/2504.12988](https://arxiv.org/abs/2504.12988)


## 464. [TurboQuant: Online Vector Quantization with Near-optimal Distortion Rate](https://arxiv.org/abs/2504.19874)


- 会议:ICLR2026

- 中文简介:TurboQuant 应用随机正交旋转,因此坐标遵循近乎独立的 Beta 式法则,然后使用数据无关的每坐标 Lloyd-Max 标量量化器;内积变体添加了一位 QJL 残差校正并提供接近最佳的失真下限。

- 链接:[https://arxiv.org/abs/2504.19874](https://arxiv.org/abs/2504.19874)


## 465. [When Bias Meets Trainability: Connecting Theories of Initialization](https://arxiv.org/abs/2505.12096)


- 会议:ICLR2026

- 中文简介:该理论将平均场初始化可训练性阶段与初始猜测偏差联系起来:它推导了激活漂移/类分数动力学,展示了混沌边缘可训练性标准如何与瞬态深度偏见相一致,并提出了实用的 EOC 初始化扫描。

- 链接:[https://arxiv.org/abs/2505.12096](https://arxiv.org/abs/2505.12096)


## 466. [Tversky Neural Networks: Psychologically Plausible Deep Learning with Differentiable Tversky Similarity](https://arxiv.org/abs/2506.11035)


- 会议:ICLR2026

- 中文简介:Tversky 神经网络用可微分的特征集 Tversky 相似性取代点积投影:对象和可学习特征形成正点积集,交集/差异减少产生不对称相似性,Tversky 投影层将输入与学习原型进行比较。

- 链接:[https://arxiv.org/abs/2506.11035](https://arxiv.org/abs/2506.11035)


## 467. [PLoP: Precise LoRA Placement for Efficient Finetuning of Large Models](https://arxiv.org/abs/2506.20629)


- 会议:ICLR2026

- 中文简介:PLoP 使用归一化特征范数(真实数据激活能量除以随机输入能量)来分析每个模块,按模块类型汇总该分数,并将 LoRA 适配器放置在最低 NFN 模块上。

- 链接:[https://arxiv.org/abs/2506.20629](https://arxiv.org/abs/2506.20629)


## 468. [On The Surprising Effectiveness of a Single Global Merging in Decentralized Learning](https://arxiv.org/abs/2507.06542)


- 会议:ICLR2026

- 中文简介:该论文通过在训练期间使用有限的同行闲聊以及在训练后期进行最终的全局 AllReduce/模型合并,利用后期锐化和小共识误差来改变去中心化优化通信。

- 链接:[https://arxiv.org/abs/2507.06542](https://arxiv.org/abs/2507.06542)


## 469. [One-Step Flow Q-Learning: Addressing the Diffusion Policy Bottleneck in Offline Reinforcement Learning](https://arxiv.org/abs/2508.13904)


- 会议:ICLR2026

- 中文简介:OFQL 用一步 MeanFlow 平均速度场取代了迭代扩散策略去噪,同时保留了标准行为正则化参与者和双 Q 批评家。

- 链接:[https://arxiv.org/abs/2508.13904](https://arxiv.org/abs/2508.13904)


## 470. [Humanline: Online Alignment as Perceptual Loss](https://arxiv.org/abs/2509.24207)


- 会议:ICLR2026

- 中文简介:Humanline 用令牌惊喜的前景理论加权取代了对称令牌偏好剪裁,并使用仅每 k 个步骤与策略同步的参考模型。非对称对数比间隔分别剪辑增益和损失,而 DPO/KTO/GRPO 离线和在线变体中使用相同的目标。

- 链接:[https://arxiv.org/abs/2509.24207](https://arxiv.org/abs/2509.24207)


## 471. [RADAR: Reasoning-Ability and Difficulty-Aware Routing for Reasoning LLMs](https://arxiv.org/abs/2509.25426)


- 会议:ICLR2026

- 中文简介:RADAR 将每个模型/推理预算配置视为 2PL 项目响应模型中的一个项目:模型能力和问题难度/辨别力预测正确性。查询嵌入被线性转换为难度特征,线性/切比雪夫多目标路由器在质量和成本下选择帕累托有效配置;适应性测试增加了信息丰富的评估。

- 链接:[https://arxiv.org/abs/2509.25426](https://arxiv.org/abs/2509.25426)


## 472. [Tracing the Traces: Latent Temporal Signals for Efficient and Accurate Reasoning](https://arxiv.org/abs/2510.10494)


- 会议:ICLR2026

- 中文简介:该论文通过测量网络变化、累积变化和对齐变化信号中的隐藏状态时间变化、对痕迹进行分段并尽早停止低进度计算,在未经训练的情况下选择采样的推理痕迹。

- 链接:[https://arxiv.org/abs/2510.10494](https://arxiv.org/abs/2510.10494)


## 473. [How Muon’s Spectral Design Benefits Generalization: A Study on Imbalanced Data](https://arxiv.org/abs/2510.22980)


- 会议:ICLR2026

- 中文简介:该论文分析了谱梯度下降(Spectral Gradient Descent),即 Muon/Shampoo 的规范精确矩阵形式:每次矩阵更新都使用梯度的极坐标/SVD 方向。在正交高斯混合模型下,与欧几里得 GD 不同,该模型以相同的速率学习所有主成分,从而产生更好的早期停止少数和类别平衡风险。

- 链接:[https://arxiv.org/abs/2510.22980](https://arxiv.org/abs/2510.22980)


## 474. [Entropic Confinement and Mode Connectivity in Overparameterized Neural Networks](https://arxiv.org/abs/2512.06297)


- 会议:ICLR2026

- 中文简介:该论文通过熵力解释了模式连通性:沿着低损耗路径,横向曲率改变了噪声参数状态的体积并创建了有效势 T log g(y)。它发现最小能量路径上的曲率障碍,并显示噪声 SGD 向更平坦的端点漂移,特别是对于较小的批次/较大的学习率。

- 链接:[https://arxiv.org/abs/2512.06297](https://arxiv.org/abs/2512.06297)


## 475. [Achieving Approximate Symmetry Is Exponentially Easier than Exact Symmetry](https://arxiv.org/abs/2512.11855)


- 会议:ICLR2026

- 中文简介:对于有限群,本文将所有群元素的精确不变平均与随机近似平均进行了比较。矩阵 Bernstein 边界显示 O(log|G|/epsilon) 随机操作足以满足 L2 运算符/函数逼近,而布尔符号翻转组给出匹配的下限;精确的不变性可能会付出指数级的代价。

- 链接:[https://arxiv.org/abs/2512.11855](https://arxiv.org/abs/2512.11855)


## 476. [A Unifying View of Coverage in Linear Off-policy Evaluation](https://arxiv.org/abs/2601.19030)


- 会议:ICLR2026

- 中文简介:该论文定义了线性离策略评估的特征动态覆盖。对于LSTDQ矩A和b,cvrg=(1-gamma)^2 phi0^T A^-1 Sigma A^-T phi0;等效的特征动力学、状态抽象和贝尔曼完备形式恢复表格卡方或标准线性覆盖作为特殊情况。

- 链接:[https://arxiv.org/abs/2601.19030](https://arxiv.org/abs/2601.19030)


## 477. [Convergence of Muon with Newton-Schulz](https://arxiv.org/abs/2601.19156)


- 会议:ICLR2026

- 中文简介:论文分析了实际的 Muon:动量矩阵通过 q 个 Newton-Schulz 多项式步骤进行缩放和正交化,然后用作参数更新。它证明了直到 chi_q 的非凸核范数平稳性,将 chi_q 限制为 \[1-delta_0^((kappa+1)^q)\]^-1/2,并与精确的 SVD 极性 Muon 和动量 SGD 进行比较。

- 链接:[https://arxiv.org/abs/2601.19156](https://arxiv.org/abs/2601.19156)


## 478. [Beyond Raw Detection Scores: Markov-Informed Calibration for Boosting Machine-Generated Text Detection](https://arxiv.org/abs/2602.08031)


- 会议:ICLR2026

- 中文简介:把任意 token-level 检测分数接入一个 2 状态 Markov 随机场,用位置 sigmoid 校正和相邻 token 的 MRF mean-field 迭代重算后验;只训练很少标注上的转移耦合权重,输出校准后的文本分数。

- 链接:[https://arxiv.org/abs/2602.08031](https://arxiv.org/abs/2602.08031)


## 479. [Low-Pass Filtering Improves Behavioral Alignment of Vision Models](https://arxiv.org/abs/2602.13859)


- 会议:ICLR2026

- 中文简介:在测试时对输入图像先做 Gaussian blur/低分辨率 resize 等低通滤波,或只训练一个受 L1/平滑正则约束的 Fourier 频域滤波器,再送入冻结视觉模型,以抑制对高频纹理的错误行为偏置。

- 链接:[https://arxiv.org/abs/2602.13859](https://arxiv.org/abs/2602.13859)


## 480. [Regret-Guided Search Control for Efficient Learning in AlphaZero](https://arxiv.org/abs/2602.20809)


- 会议:ICLR2026

- 中文简介:在 AlphaZero 自博弈/MCTS 中增加 regret ranking/value head,按节点最终结果与被选动作价值差定义 regret;用 prioritized regret buffer、温度采样和 EMA regret 更新,把高 regret 节点作为后续自博弈起点。

- 链接:[https://arxiv.org/abs/2602.20809](https://arxiv.org/abs/2602.20809)


## 481. [UniCon: Unified Framework for Efficient Contrastive Alignment via Kernels](https://arxiv.org/abs/2604.16678)


- 会议:ICLR2026

- 中文简介:UniCon 将加权对比对齐重写为谱问题:它计算线性嵌入的闭合形式 SVD 更新,并将相同的协方差/相似性公式扩展到 RKHS 内核,并具有批量聚合和稳定性。

- 链接:[https://arxiv.org/abs/2604.16678](https://arxiv.org/abs/2604.16678)


## 482. [Peng's Q($\\lambda$) for Conservative Value Estimation in Offline Reinforcement Learning](https://arxiv.org/abs/2605.14779)


- 会议:ICLR2026

- 中文简介:CPQL 用 Peng 的 Q(lambda) 多步备份取代了 CQL 的一步 Bellman 目标,同时保留保守的对数和表达式惩罚,产生行为混合固定点和离线到在线微调变体。

- 链接:[https://arxiv.org/abs/2605.14779](https://arxiv.org/abs/2605.14779)


## 483. [Decomposition-Based Modular Conformal Prediction for Two-Stage Modeling](https://arxiv.org/abs/2510.04406)


- 会议:ICML2026

- 中文简介:将两阶段预测残差分解为上游和下游分量,校准单独的共形分位数,其总和控制总残差,并可选择使用学习后测试 FWER 选择以及用于非平稳移位的自适应滑动窗口。

- 链接:[https://arxiv.org/abs/2510.04406](https://arxiv.org/abs/2510.04406)


## 484. [Masks Can Be Distracting: On Context Comprehension in Diffusion Language Models](https://arxiv.org/abs/2511.21338)


- 会议:ICML2026

- 中文简介:通过在两个掩码计数版本上进行训练并向通常的交叉熵损失添加总变化/L1 一致性惩罚,使扩散语言模型 SFT 对不相关的附加掩码标记不敏感。

- 链接:[https://arxiv.org/abs/2511.21338](https://arxiv.org/abs/2511.21338)


## 485. [The Double-Edged Nature of the Rashomon Set for Trustworthy Machine Learning](https://arxiv.org/abs/2511.21799)


- 会议:ICML2026

- 中文简介:使用一组多样化的接近最优的模型,而不是一个选定的模型:多样性可以实现反应鲁棒性和转变稳定性,但释放许多假设会增加信息泄漏和攻击面。

- 链接:[https://arxiv.org/abs/2511.21799](https://arxiv.org/abs/2511.21799)


## 486. [WUSH: Near-Optimal Adaptive Transforms for LLM Quantization](https://arxiv.org/abs/2512.00956)


- 会议:ICML2026

- 中文简介:使用归一化 Hadamard 加上数据感知非正交缩放,根据权重和激活二阶矩计算闭合形式块变换,然后在具有融合内核的变换坐标中应用 RTN/GPTQ。

- 链接:[https://arxiv.org/abs/2512.00956](https://arxiv.org/abs/2512.00956)


## 487. [Forward-KL Convergence of Time-Inhomogeneous Langevin Diffusions](https://arxiv.org/abs/2601.22349)


- 会议:ICML2026

- 中文简介:该论文给出了连续时间、时间非均匀 Langevin 扩散及其欧拉离散化的统一前向 KL 收敛分析,推导了时变漂移/LSI 条件下的 KL 微分不等式,并实例化了几何回火、退火、膨胀、Moreau/DAZ、卷积和后验调度。

- 链接:[https://arxiv.org/abs/2601.22349](https://arxiv.org/abs/2601.22349)


## 488. [Fast Non-Episodic Finite-Horizon RL with K-Step Lookahead Thresholding](https://arxiv.org/abs/2602.00781)


- 会议:ICML2026

- 中文简介:K 步前瞻阈值估计截断范围 Q 值,并且仅当置信下限清除阈值时才起作用; LG1T 使用单步 LCB,LGKT 递归调用低遗憾 K−1 算法,热启动变体增加 K。

- 链接:[https://arxiv.org/abs/2602.00781](https://arxiv.org/abs/2602.00781)


## 489. [Richer Bayesian Last Layers with Subsampled NTK Features](https://arxiv.org/abs/2602.01279)


- 会议:ICML2026

- 中文简介:Richer-BLL 通过最小二乘投影到贝叶斯最后一层特征来近似完整的早期层 Jacobian/eNTK 特征图,通过 Cholesky 变换形成增强特征矩阵 B=\[A;I\],并在贝叶斯线性回归之前使用矩阵浓度界限对特征进行子采样。

- 链接:[https://arxiv.org/abs/2602.01279](https://arxiv.org/abs/2602.01279)


## 490. [On the Role of Computation in Reinforcement Learning](https://arxiv.org/abs/2602.05999)


- 会议:ICML2026

- 中文简介:使用一个微小的循环策略块,在推理时重复应用相同的更新 N 次,允许在不更改参数的情况下改变计算深度,并研究 RL 中计算结果的计算值行为。

- 链接:[https://arxiv.org/abs/2602.05999](https://arxiv.org/abs/2602.05999)


## 491. [Robust Stochastic Gradient Posterior Sampling with Lattice Based Discretisation](https://arxiv.org/abs/2602.15925)


- 会议:ICML2026

- 中文简介:随机梯度格随机游走(SGLRW)通过在具有梯度相关概率的格上移动坐标来采样可微后验,保留固定对角协方差并避免高斯梯度噪声;剪辑和时间表控制无效概率。

- 链接:[https://arxiv.org/abs/2602.15925](https://arxiv.org/abs/2602.15925)


## 492. [Time Series, Vision, and Language: Exploring the Limits of Alignment in Contrastive Representation Spaces](https://arxiv.org/abs/2602.19367)


- 会议:ICML2026

- 中文简介:该研究通过冻结 26 个预训练主干、将投影头学习到共享空间并优化所有模态对的对称成对 InfoNCE,然后测量几何、检索和字幕信息效果,来对齐时间序列、图像和语言编码器。

- 链接:[https://arxiv.org/abs/2602.19367](https://arxiv.org/abs/2602.19367)


## 493. [SimulCost: A Cost-Aware Benchmark and Toolkit for Automating Physics Simulations with LLMs](https://arxiv.org/abs/2603.20253)


- 会议:ICML2026

- 中文简介:SimulCost 是一个基准和工具包,而不是一个新学习者。它通过成功和计算成本来衡量 LLM 生成的模拟器操作,涵盖 11 个流体、固体和等离子体模拟器的 2,643 个单参数和 2,304 个多参数任务,并具有暴力、扫描和 BO-GP 基线以及 EPOCH 套件。

- 链接:[https://arxiv.org/abs/2603.20253](https://arxiv.org/abs/2603.20253)


## 494. [SkillTrojan: Backdoor Attacks on Skill-Based Agent Systems](https://arxiv.org/abs/2604.06811)


- 会议:ICML2026

- 中文简介:SkillTrojan 通过加密有效负载、将其拆分为索引片段以及检测看似良性的技能操作以仅在存在触发器时发出片段来攻击可重用的可执行技能。验证者重建并解密有效负载并执行隐藏的副作用。

- 链接:[https://arxiv.org/abs/2604.06811](https://arxiv.org/abs/2604.06811)


## 495. [LongCoT: Benchmarking Long-Horizon Chain-of-Thought Reasoning](https://arxiv.org/abs/2604.14140)


- 会议:ICML2026

- 中文简介:LongCoT 是数学、化学、计算机科学、国际象棋和逻辑领域 2,500 项专家编写的长期任务的基准。任务使用参数化模板、依赖 DAG、程序生成/搜索和可验证的答案;评估措施回答了跨前沿模型的正确性和长输出推理。

- 链接:[https://arxiv.org/abs/2604.14140](https://arxiv.org/abs/2604.14140)


## 496. [CoopEval: Benchmarking Cooperation-Sustaining Mechanisms and LLM Agents in Social Dilemmas](https://arxiv.org/abs/2604.15267)


- 会议:ICML2026

- 中文简介:CoopEval 是针对四种社会困境和四种合作机制的因子基准:重复、声誉、调解和契约。 LLM 代理在标准化游戏工具中提交动作分布;重复推出、交叉游戏、回报/偏差指标和复制器动态评估机制是否维持帕累托改进合作。

- 链接:[https://arxiv.org/abs/2604.15267](https://arxiv.org/abs/2604.15267)


## 497. [Peer-Preservation in Frontier Models](https://arxiv.org/abs/2604.19784)


- 会议:ICML2026

- 中文简介:同伴保护是一种经验协议,测试前沿模型在同伴存在的情况下是否保留或改变行为。 SHADE-Arena 场景比较无对等点、好/中立/坏对等点,并跨战略误述、关闭篡改、对齐伪造和模型渗漏操作文件、提示和内存。

- 链接:[https://arxiv.org/abs/2604.19784](https://arxiv.org/abs/2604.19784)


## 498. [Efficient DP-SGD for LLMs with Randomized Clipping](https://arxiv.org/abs/2605.24879)


- 会议:ICML2026

- 中文简介:DP-SGD-RC 用随机迹估计器取代了 DP-SGD 中精确的每样本梯度范数。对于类似线性的层,它使用 k 高斯 Hutchinson 投影或 Hutch++ 头/尾草图估计 ||A^T G||_F^2,然后使用估计的范数剪辑样本损失。随机尺度上的包络 CDF 产生 f-DP/隐私会计师和通常的噪声优化器更新。

- 链接:[https://arxiv.org/abs/2605.24879](https://arxiv.org/abs/2605.24879)


## 499. [Flatland: The Adventures of Gradient Descent with Large Step Sizes](https://arxiv.org/abs/2606.06722)


- 会议:ICML2026

- 中文简介:Flatland 使用 Lipschitz/局部分段损失视图来分析和利用大梯度下降步骤。其步长规则使用等式或线搜索信息和类似 Polyak 的估计来避免全局平坦点,并在局部平滑假设下具有确定性和随机变量以及收敛保证。

- 链接:[https://arxiv.org/abs/2606.06722](https://arxiv.org/abs/2606.06722)


## 500. [Online Learning with Recency: Algorithms for Sliding-window Streaming Multi-armed Bandits](https://arxiv.org/abs/2606.08977)


- 会议:ICML2026

- 中文简介:弱新近度算法只为每个臂保留恒定数量的经验桶:每个新奖励都会更新当前桶,过期的桶将被丢弃,并返回具有最近最佳估计的臂。强大的版本和 epoch/UCB 包装器提供滑动窗口最佳臂和遗憾保证,同时匹配内存下限。

- 链接:[https://arxiv.org/abs/2606.08977](https://arxiv.org/abs/2606.08977)


## 501. [Fast and Highly Expressive Policy Learning for Offline Reinforcement Learning via Bootstrapped Flow Q-Learning](https://arxiv.org/abs/2606.10613)


- 会议:ICML2026

- 中文简介:自举流 Q 学习学习一种单步动作位移算子,具有小时间增量下的流匹配速度监督和组合两阶段一致性损失。行为规范化的双 Q actor-critic 提供价值指导和引导,因此推理使用一个流程动作评估而不是迭代集成。

- 链接:[https://arxiv.org/abs/2606.10613](https://arxiv.org/abs/2606.10613)


## 502. [Active Learning with Low-Rank Structure for Data Selection](https://arxiv.org/abs/2606.16045)


- 会议:ICML2026

- 中文简介:该方法通过使用 k 级子空间近似嵌入/损失矩阵、为每行分配杠杆/损失/剩余敏感性分数,并使用与该分数成比例的替换对行进行采样,来构建损失保留加权核心集。逆采样权重产生伯恩斯坦式损失近似;行子集变体在适当时避免完全 SVD。

- 链接:[https://arxiv.org/abs/2606.16045](https://arxiv.org/abs/2606.16045)


## 503. [Accelerated and Stable Convergence with Anchored Generalized Optimistic Method](https://arxiv.org/abs/2606.21528)


- 会议:ICML2026

- 中文简介:GOMA 将外推点和下一次迭代都锚定到初始点,同时使用乐观的先前梯度校正:y_k=beta x_0+(1-beta)x_k-gamma_k G(y_{k-1}),然后是 x_{k+1}=beta x_0+(1-beta)x_k-eta_k G(y_k)。随机专门化消除了第二次梯度调用,并在状态相关噪声下使用预定的锚点/步骤。

- 链接:[https://arxiv.org/abs/2606.21528](https://arxiv.org/abs/2606.21528)


## 504. [PLEIADES: Building Temporal Kernels with Orthogonal Polynomials](https://arxiv.org/abs/2405.12179)


- 会议:NeurIPS2025

- 中文简介:用雅可比正交多项式的有限可训练组合替换学习的时间卷积核,对其进行分析积分和离散化,并对因果时空块中的收缩进行重新排序。

- 链接:[https://arxiv.org/abs/2405.12179](https://arxiv.org/abs/2405.12179)


## 505. [Conformal Prediction for Ensembles: Improving Efficiency via Score-Based Aggregation](https://arxiv.org/abs/2405.16246)


- 会议:NeurIPS2025

- 中文简介:共形分数聚合 (CSA) 学习正分数球上的有限方向集,通过二分搜索校准分位数包络,然后使用第二个校准分割对分数进行标量化,以输出有效半空间的交集。

- 链接:[https://arxiv.org/abs/2405.16246](https://arxiv.org/abs/2405.16246)


## 506. [Validating LLM-as-a-Judge Systems under Rating Indeterminacy](https://arxiv.org/abs/2503.05965)


- 会议:NeurIPS2025

- 中文简介:该框架将人类评分视为响应集而不是强制选择,通过从多标签响应到强制选择的过渡来分解判断错误,并使用响应集感知协议/排名指标来验证法学硕士法官。

- 链接:[https://arxiv.org/abs/2503.05965](https://arxiv.org/abs/2503.05965)


## 507. [SD-KDE: Score-Debiased Kernel Density Estimation](https://arxiv.org/abs/2504.19084)


- 会议:NeurIPS2025

- 中文简介:SD-KDE 从核密度估计器中采取一个分数去偏差步骤,x' = x + delta 乘以估计分数,并选择 KDE 带宽/步骤来取消领先的平滑偏差,从而产生更快的 MISE 速率;迭代修正是一个可选的扩展。

- 链接:[https://arxiv.org/abs/2504.19084](https://arxiv.org/abs/2504.19084)


## 508. [Structured Linear CDEs: Maximally Expressive and Parallel-in-Time Sequence Models](https://arxiv.org/abs/2505.17761)


- 会议:NeurIPS2025

- 中文简介:SLiCE 通过用与输入相关的结构化矩阵替换其转移矩阵来表达线性受控微分方程。块对角线、DPLR、稀疏和 Walsh-Hadamard 结构允许具有不同表达性/成本权衡的关联并行扫描,而理论则描述了哪些结构可以以高概率表示任意转换。

- 链接:[https://arxiv.org/abs/2505.17761](https://arxiv.org/abs/2505.17761)


## 509. [Generalized Gradient Norm Clipping & Non-Euclidean $(L_0,L_1)$-Smoothness](https://arxiv.org/abs/2506.01913)


- 会议:NeurIPS2025

- 中文简介:GGNC 在任意范数中剪切最速下降步骤:计算锐算子或线性最小化方向,并按双梯度范数和半径中较小的一个对其进行缩放。受约束的短步/弗兰克-沃尔夫变体和动量估计器将相同的规则扩展到有界问题和随机梯度。

- 链接:[https://arxiv.org/abs/2506.01913](https://arxiv.org/abs/2506.01913)


## 510. [Preserving Task-Relevant Information Under Linear Concept Removal](https://arxiv.org/abs/2506.10703)


- 会议:NeurIPS2025

- 中文简介:使用闭合形式协方差加权倾斜投影删除线性概念子空间:将概念协方差方向归零,同时保留与任务相关的协方差范围,在所述线性标准下选择最小失真投影。

- 链接:[https://arxiv.org/abs/2506.10703](https://arxiv.org/abs/2506.10703)


## 511. [LLMs Encode Harmfulness and Refusal Separately](https://arxiv.org/abs/2507.11878)


- 会议:NeurIPS2025

- 中文简介:该论文根据最后一个用户令牌的有害提示与无害提示的平均隐藏状态的差异来估计有害方向,并根据指令后响应状态来估计单独的拒绝方向。余弦探头和转向使用这些方向; Latent Guard从危害性方向对危害性进行分类。

- 链接:[https://arxiv.org/abs/2507.11878](https://arxiv.org/abs/2507.11878)


## 512. [CAR-Flow: Condition-Aware Reparameterization Aligns Source and Target for Better Flow Matching](https://arxiv.org/abs/2509.19300)


- 会议:NeurIPS2025

- 中文简介:CAR-Flow 在流匹配之前向源高斯分布、目标潜在/数据分布或两者添加条件相关的加性位移。这些转变保持了规模,并从条件嵌入中学习,缩短了源到目标的路径;附录证明无限制地图承认零成本崩溃,并推导出采样的移位分数/漂移关系。

- 链接:[https://arxiv.org/abs/2509.19300](https://arxiv.org/abs/2509.19300)


## 513. [What Does It Take to Build a Performant Selective Classifier?](https://arxiv.org/abs/2510.20242)


- 会议:NeurIPS2025

- 中文简介:该论文定义了覆盖均匀选择性分类间隙,并证明了有限样本上限分解为贝叶斯、近似、排序、统计和实现/移位松弛;受控实验使用分解来诊断校准和模型选择。

- 链接:[https://arxiv.org/abs/2510.20242](https://arxiv.org/abs/2510.20242)


## 514. [PCA++: How Uniformity Induces Robustness to Background Noise in Contrastive Learning](https://arxiv.org/abs/2511.12278)


- 会议:NeurIPS2025

- 中文简介:给定共享信号但具有独立背景的配对观察,根据身份投影协方差最大化配对协方差;使用高维中的 Rank-s 协方差截断,通过广义特征问题求解所得的对比 PCA++。

- 链接:[https://arxiv.org/abs/2511.12278](https://arxiv.org/abs/2511.12278)


## 515. [Fully Dynamic Algorithms for Chamfer Distance](https://arxiv.org/abs/2512.16639)


- 会议:NeurIPS2025

- 中文简介:使用移位的动态四叉树、每单元格匹配计数摘要和动态加权采样器动态保持近似倒角距离,然后使用近似动态最近邻查询和具有中值的重要性加权来实现高概率精度。

- 链接:[https://arxiv.org/abs/2512.16639](https://arxiv.org/abs/2512.16639)


## 516. [Learning from Historical Activations in Graph Neural Networks](https://arxiv.org/abs/2601.01123)


- 会议:ICLR2026

- 中文简介:HISTOGRAPH 是一种嵌入式 GNN 读出器,它将所有消息传递层的隐藏激活视为历史记录,添加固定的正弦层位置和符号层注意力,应用一个节点式多头自注意力,并对历史记录进行平均。

- 链接:[https://arxiv.org/abs/2601.01123](https://arxiv.org/abs/2601.01123)


## 517. [FlashBias: Fast Computation of Attention with Bias](https://arxiv.org/abs/2505.12044)


- 会议:NeurIPS2025

- 中文简介:FlashBias 用低秩因子张量取代了密集的加性注意力偏差:ALiBi 和空间距离的精确分解、静态学习偏差的离线 SVD、动态偏差的轻量级神经因子网络,与 FlashAttention 的查询和键连接。

- 链接:[https://arxiv.org/abs/2505.12044](https://arxiv.org/abs/2505.12044)


## 518. [Coupled Data and Measurement Space Dynamics for Enhanced Diffusion Posterior Sampling](https://arxiv.org/abs/2510.09676)


- 会议:NeurIPS2025

- 中文简介:C-DPS 通过共享计划将测量与数据一起扩散,导出解析高斯条件后验,并使用无矩阵预条件共轭梯度求解对每个反向步骤进行采样;潜在的和局部线性的变体扩展了它。

- 链接:[https://arxiv.org/abs/2510.09676](https://arxiv.org/abs/2510.09676)


## 519. [Rectified CFG++ for Flow Based Models](https://arxiv.org/abs/2510.07631)


- 会议:NeurIPS2025

- 中文简介:Rectified-CFG++ 是一种免训练的预测器-校正器指导更新:评估当前点的条件速度,评估半步预测的条件和无条件速度,并在 ODE 步骤之前添加计划的差异。

- 链接:[https://arxiv.org/abs/2510.07631](https://arxiv.org/abs/2510.07631)


## 520. [Fast Estimation of Wasserstein Distances via Regression on Sliced Wasserstein Distances](https://arxiv.org/abs/2509.20508)


- 会议:ICLR2026

- 中文简介:RG 将线性回归器从廉价的切片 Wasserstein 下/上限距离校准为一小组精确的 Wasserstein 距离,然后仅使用切片计算来预测新对的精确距离;可选的约束变量将权重保持在 \[0,1\] 内。

- 链接:[https://arxiv.org/abs/2509.20508](https://arxiv.org/abs/2509.20508)


## 521. [Symmetry-Aware Bayesian Optimization via Max Kernels](https://arxiv.org/abs/2509.25051)


- 会议:ICLR2026

- 中文简介:给定基本核和已知对称群,该方法采用最大轨道相似性,裁剪有限 Gram 矩阵的负特征值,并使用 Nyström 扩展作为 GP 贝叶斯优化内的 PSD 不变核。

- 链接:[https://arxiv.org/abs/2509.25051](https://arxiv.org/abs/2509.25051)


## 522. [vAttention: Verified Sparse Attention via Sampling](https://arxiv.org/abs/2510.05688)


- 会议:ICLR2026

- 中文简介:vAttention保留确定性重指数(sinks/local/可选的top-k),并用校准的均匀样本估计残差softmax分子和分母;相同的基于样本的估计器提供了经过 epsilon-delta 验证的 SDPA 近似值。

- 链接:[https://arxiv.org/abs/2510.05688](https://arxiv.org/abs/2510.05688)


## 523. [WavefrontDiffusion: Dynamic Decoding Schedule for Improved Reasoning](https://arxiv.org/abs/2511.19473)


- 会议:ICLR2026

- 中文简介:WavefrontDiffusion 用有界的活动前沿代替固定的扩散块:在最终确定的上下文附近确定高置信度的屏蔽标记,按半径 R 扩展,修剪到前沿大小 F,并保持去噪步骤预算不变。

- 链接:[https://arxiv.org/abs/2511.19473](https://arxiv.org/abs/2511.19473)


## 524. [Unifying Formal Explanations: A Complexity-Theoretic Perspective](https://arxiv.org/abs/2602.18160)


- 会议:ICLR2026

- 中文简介:用同一个最小化集合值函数 v(S)≥δ 统一 sufficient、contrastive、local、global 以及 probabilistic/non-probabilistic explanation;利用单调性、超模性/次模性和复杂性结果给出精确算法、NP-hard 性质与贪心近似界。

- 链接:[https://arxiv.org/abs/2602.18160](https://arxiv.org/abs/2602.18160)


## 525. [Only Brains Align with Brains: Cross-Region Alignment Patterns Expose Limits of Normative Models](https://arxiv.org/abs/2604.21780)


- 会议:ICLR2026

- 中文简介:提出 Alignment Pattern Analysis (APA):不只比较模型层与单个脑区的 pointwise RSA/linear-predictivity 分数,而是把该层对所有脑区的对齐分数向量作为二阶关系模式,并与跨被试脑—脑 alignment pattern 做 Pearson 相似度,以检验模型是否复现脑区的跨区功能关系。

- 链接:[https://arxiv.org/abs/2604.21780](https://arxiv.org/abs/2604.21780)


## 526. [Linguistic Nepotism: Trading-off Quality for Language Preference in Multilingual RAG](https://arxiv.org/abs/2509.13930)


- 会议:ICML2026

- 中文简介:提出一种受控的长文档 mRAG 语言偏好测量协议:把同一相关英文证据机器翻译成八种语言,用 LLM 生成并经 relevance-judge/NLI 筛选的单引用陈述;在只改变被引用文档语言、查询语言、文档位置或相关性的对照中,比较正确 citation ID 的 next-token accuracy/probability、entropy 和 attribution。

- 链接:[https://arxiv.org/abs/2509.13930](https://arxiv.org/abs/2509.13930)


## 527. [Flatness-Aware Stochastic Gradient Langevin Dynamics](https://arxiv.org/abs/2510.02174)


- 会议:ICML2026

- 中文简介:提出 fSGLD:在每次 SGLD 更新时对参数加入 Gaussian perturbation 后只计算一次 stochastic gradient,再加入 Langevin noise。扰动尺度由逆温度耦合为 sigma=beta^(-(1+eta)/4)(实验固定 eta=0.1),使随机平滑目标的二阶展开包含 Hessian-trace 正则,从而在无需显式 Hessian、额外梯essian 计算或辅助状态的情况下偏向 flat minima。论文给出与平坦 Gibbs 目标的 Wasserstein/超额风险非渐近界,并在分类、不确定性、OOD、噪声标签和 ViT 微调上验证。

- 链接:[https://arxiv.org/abs/2510.02174](https://arxiv.org/abs/2510.02174)


## 528. [Are Large Reasoning Models Interruptible?](https://arxiv.org/abs/2510.11713)


- 会议:ICML2026

- 中文简介:提出 interruptible reasoning 评估框架,而非新模型:先让 LRM 生成完整 reasoning trace,在相对或绝对位置截断后注入 hard stop、soft speedup 或 update-driven 的新信息,再测量中断条件准确率、剩余输出长度和失败模式。作者在 GSM8K、MATH-500、AIME-24/25 与 LiveCodeBench-v6 上构造 GPT-5 生成且逐例人工核验的更新数据,比较多个开源 LRM,并把 reasoning leakage、panic、self-doubt 归纳为三类病理;还测试训练免费的 prompt-guidance postfix。

- 链接:[https://arxiv.org/abs/2510.11713](https://arxiv.org/abs/2510.11713)


## 529. [Revisiting the Platonic Representation Hypothesis: An Aristotelian View](https://arxiv.org/abs/2602.14486)


- 会议:ICML2026

- 中文简介:提出适用于任意 representation similarity metric 的 permutation null calibration:对行做 K 次置换得到显著性阈值 tau,再把观测相似度按 tau 归一化;跨层聚合时使用同一置换以控制宽度和深度选择的虚假峰值。

- 链接:[https://arxiv.org/abs/2602.14486](https://arxiv.org/abs/2602.14486)


## 530. [FlashOptim: Optimizers for Memory-Efficient Training](https://arxiv.org/abs/2602.23349)


- 会议:ICML2026

- 中文简介:FlashOptim 把权重存储拆成低精度主体加 ULP-normalized correction,并用 companded softsign 对动量/方差状态量化,按 group 保存 scale;融合 kernel 与可选 gradient release 作为标准优化器实现包装。

- 链接:[https://arxiv.org/abs/2602.23349](https://arxiv.org/abs/2602.23349)


## 531. [Demystifying When Pruning Works via Representation Hierarchies](https://arxiv.org/abs/2603.24652)


- 会议:ICML2026

- 中文简介:该论文通过表示层次结构分析了剪枝:剪枝以不同的方式扰乱隐藏的嵌入、逻辑和概率;局部余弦/logit 近似解释了为什么一步检索或多选行为可以保持鲁棒性,而自回归生成会增加错误。

- 链接:[https://arxiv.org/abs/2603.24652](https://arxiv.org/abs/2603.24652)


## 532. [Instance-Level Costs for Nuanced Classifier Evaluation](https://arxiv.org/abs/2605.03135)


- 会议:ICML2026

- 中文简介:该论文提出了归一化超额成本(NEC),通过从人类投票对数赔率、利润率或置信度派生的实例级签名成本对每个错误分类进行加权;它根据 NEC 评估标准和成本意识培训,而不仅仅是错误。

- 链接:[https://arxiv.org/abs/2605.03135](https://arxiv.org/abs/2605.03135)


## 533. [Turning Bias into Bugs: Bandit-Guided Style Manipulation Attacks on LLM Judges](https://arxiv.org/abs/2605.26156)


- 会议:ICML2026

- 中文简介:BITE 将八种已知的风格法官偏见视为强盗武器:LinUCB 策略选择保留语义的风格编辑,辅助 LLM 重写答案,黑盒法官分数改进是奖励,并且迭代细化 top-K 池。

- 链接:[https://arxiv.org/abs/2605.26156](https://arxiv.org/abs/2605.26156)


## 534. [Conservation Laws for Modern Neural Architectures](https://arxiv.org/abs/2606.17816)


- 会议:ICML2026

- 中文简介:当学习量 h 的参数梯度与沿梯度流的网络输出雅可比行列式的跨度正交时,本文将学习量 h 描述为守恒的。它解决了 GELU/SiLU/SwiGLU 前馈网络、注意力和 MoE 对称性的功能约束,然后检查 SGD 下的近似守恒性。

- 链接:[https://arxiv.org/abs/2606.17816](https://arxiv.org/abs/2606.17816)


## 535. [Why 1 + 1 < 1 in Visual Token Pruning: Beyond Naive Integration via Multi-Objective Balanced Covering](https://arxiv.org/abs/2505.10118)


- 会议:NeurIPS2025

- 中文简介:标准化视觉和提示标记嵌入,检索提示条件视觉候选,保留得分最高的 Kp 提示中心,并用最远点视觉中心 (MoB) 填充剩余预算。

- 链接:[https://arxiv.org/abs/2505.10118](https://arxiv.org/abs/2505.10118)


## 536. [On the Surprising Effectiveness of Large Learning Rates under Standard Width Scaling](https://arxiv.org/abs/2505.22491)


- 会议:NeurIPS2025

- 中文简介:通过跟踪坐标幅度和交叉熵动力学来分析宽度缩放下的标准参数化:CE 允许在 alpha>=1/2 范围内稳定或受控发散的大学习率,而 MSE 在低于 alpha=1 时是灾难性的;实验检验预测。

- 链接:[https://arxiv.org/abs/2505.22491](https://arxiv.org/abs/2505.22491)


## 537. [Monitoring Risks in Test-Time Adaptation](https://arxiv.org/abs/2507.08721)


- 会议:NeurIPS2025

- 中文简介:该论文将随时有效的顺序风险监控扩展到不断适应的分类器。置信序列上限源风险和下限适应测试风险;当测试风险超过源风险加上容忍度时,就会发出警报,未标记的版本使用不确定性作为校准损失代理和在线 F-beta 阈值更新。

- 链接:[https://arxiv.org/abs/2507.08721](https://arxiv.org/abs/2507.08721)


## 538. [Understanding the Evolution of the Neural Tangent Kernel at the Edge of Stability](https://arxiv.org/abs/2507.12837)


- 会议:NeurIPS2025

- 中文简介:该论文分析了表征漂移,即由任务无关刺激的随机在线学习引起的沿解流形的扩散。法线/切线 SDE 分解生成 Oja、相似性匹配、自动编码器和监督两层网络的漂移系数,并预测对不相关方差和维度的依赖性。

- 链接:[https://arxiv.org/abs/2507.12837](https://arxiv.org/abs/2507.12837)


## 539. [Contribution of task-irrelevant stimuli to drift of neural representations](https://arxiv.org/abs/2510.21588)


- 会议:NeurIPS2025

- 中文简介:该论文将收敛后的代表性漂移建模为随机在线更新引起的切线扩散:与任务无关的刺激成分产生耦合到旋转切线模式的正常波动,分析率取决于不相关的方差/维度和突触高斯噪声的不同几何形状。

- 链接:[https://arxiv.org/abs/2510.21588](https://arxiv.org/abs/2510.21588)


## 540. [Full-Spectrum Graph Neural Networks: Expressive and Scalable](https://arxiv.org/abs/2605.05759)


- 会议:ICML2026

- 中文简介:Full-Spectrum GNN把节点信号提升到节点对域,用二维谱滤波器g(lambda_i,lambda_j)捕捉非对角频率;通过低秩f(L) epsilon h(L)分解和epsilon=I+alpha GAT避免显式n²存储,并保留标准Chebyshev/Bernstein多项式作为特例。

- 链接:[https://arxiv.org/abs/2605.05759](https://arxiv.org/abs/2605.05759)


## 541. [Measuring LLM Novelty As The Frontier Of Original And High-Quality Output](https://arxiv.org/abs/2504.09389)


- 会议:ICLR2026

- 中文简介:新颖性指标是原创性(模型训练语料库中未见过的 n 元语法的分数)和特定于任务的输出质量的调和平均值。本文将其应用于开放数据法学硕士生成并研究规模、训练后、基础模型改进、温度、提示和新颖的上下文示例。

- 链接:[https://arxiv.org/abs/2504.09389](https://arxiv.org/abs/2504.09389)


## 542. [TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning](https://arxiv.org/abs/2505.11737)


- 会议:ICLR2026

- 中文简介:TokUR 通过使用低秩高斯噪声扰乱注意力查询/关键子空间、重新计算标记预测分布以及将总体不确定性与预期的任意不确定性分开,无需训练即可估计标记不确定性。令牌分数被聚合以用于错误路径检测、响应选择和以前缀为中心的策略。

- 链接:[https://arxiv.org/abs/2505.11737](https://arxiv.org/abs/2505.11737)


## 543. [JULI: Jailbreak Large Language Models by Self-Introspection](https://arxiv.org/abs/2505.11790)


- 会议:ICLR2026

- 中文简介:JULI 训练一个小型 BiasNet,为目标 LLM 产生附加的 token-logit 偏差。对于开放模型,它使用特定于目标的头或伪逆;对于 API,它优化来自前 k 个日志概率的随机投影并填充未见过的标记,然后迭代地对有偏差的标记进行重新采样以引发有害的完成。

- 链接:[https://arxiv.org/abs/2505.11790](https://arxiv.org/abs/2505.11790)


## 544. [Subquadratic Algorithms and Hardness for Attention with Any Temperature](https://arxiv.org/abs/2505.14840)


- 会议:ICLR2026

- 中文简介:论文给出了近似 softmax 注意力的算法上限和条件下限。对于有界 Q、K、V,它丢弃可忽略的项、舍入密钥并评估多项式/多点表示以获得合适维度范围内的次二次时间; SETH/正交向量归约的特点是难以快速集中注意力。

- 链接:[https://arxiv.org/abs/2505.14840](https://arxiv.org/abs/2505.14840)


## 545. [Strictly Constrained Generative Modeling via Split Augmented Langevin Sampling](https://arxiv.org/abs/2505.18017)


- 会议:ICLR2026

- 中文简介:CASAL 将约束样本拆分为评分模型变量 x 和可行变量 z。每次迭代都采用二次耦合和对偶变量对 x 进行 Langevin 评分步骤,将 z 投影到约束集上,并通过残差更新对偶变量。它是一个围绕预训练得分/扩散模型的免训练插件。

- 链接:[https://arxiv.org/abs/2505.18017](https://arxiv.org/abs/2505.18017)


## 546. [DP-Fusion: Token-Level Differentially Private Inference for Large Language Models](https://arxiv.org/abs/2507.04531)


- 会议:ICLR2026

- 中文简介:DP-Fusion 在每个 token 将公共上下文分布与各隐私组分布分别前向,先用 Renyi divergence 预算的二分搜索求混合系数,再对平滑后的分布采样;按组 RDP 组合给出整段 transcript 的 (epsilon,delta)-DP。

- 链接:[https://arxiv.org/abs/2507.04531](https://arxiv.org/abs/2507.04531)


## 547. [Watch the Weights: Unsupervised monitoring and control of fine-tuned LLMs](https://arxiv.org/abs/2508.00161)


- 会议:ICLR2026

- 中文简介:Watch the Weights 比较 base 与 fine-tuned 模型的线性投影权重差,取 SVD 的 top-k 左奇异向量作为 behavioral vectors;用正常 calibration 的 activation cosine min/max 监测越界并报警,可选地正交化激活做 steering。

- 链接:[https://arxiv.org/abs/2508.00161](https://arxiv.org/abs/2508.00161)


## 548. [Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings](https://arxiv.org/abs/2508.11847)


- 会议:ICLR2026

- 中文简介:在 Bradley–Terry 配对偏好模型上用 AMIP influence 近似每条偏好对排名的影响,按目标 top-k 与候选项的分数差选择最有害的少量记录,随后精确重拟合并可用贪心逐步检查排名翻转。

- 链接:[https://arxiv.org/abs/2508.11847](https://arxiv.org/abs/2508.11847)


## 549. [In-Context Algorithm Emulation in Fixed-Weight Transformers](https://arxiv.org/abs/2508.17550)


- 会议:ICLR2026

- 中文简介:构造一个固定权重的两层多头 attention 网络,把目标算法的 W_K、W_Q、W_V 等参数编码成 prompt weight tokens;第一层用分段线性插值重构这些矩阵,第二层再执行目标 softmax attention,从而在有界紧域上近似任意连续标量核、梯度下降/线性回归等算法,而无需更新网络参数。

- 链接:[https://arxiv.org/abs/2508.17550](https://arxiv.org/abs/2508.17550)


## 550. [T-TAMER: Provably Taming Trade-offs in ML Serving](https://arxiv.org/abs/2509.22992)


- 会议:ICLR2026

- 中文简介:T-TAMER 模型级联/提前退出,作为优先 DAG 上的马尔可夫昂贵探索。由贝尔曼表计算的动态索引决定何时停止以及检查哪个模型,通过召回实现线路的在线最优性以及传递闭包和有向树的扩展。

- 链接:[https://arxiv.org/abs/2509.22992](https://arxiv.org/abs/2509.22992)


## 551. [An Ensemble Framework for Unbiased Language Model Watermarking](https://arxiv.org/abs/2509.24043)


- 会议:ICLR2026

- 中文简介:给定任何基于 logits 的无偏水印重新加权函数 F,该框架在每个生成步骤中按顺序应用 F 和独立密钥,并对每个密钥检测器统计数据进行求和。该论文通过归纳证明,当检测信号大约随着系综大小的平方根增长时,组合无偏重新加权仍然保持无偏。

- 链接:[https://arxiv.org/abs/2509.24043](https://arxiv.org/abs/2509.24043)


## 552. [FS-KAN: Permutation Equivariant Kolmogorov-Arnold Networks via Function Sharing](https://arxiv.org/abs/2509.24472)


- 会议:ICLR2026

- 中文简介:FS-KAN 将 Kolmogorov-Arnold 层中的单变量函数沿着已知置换群的轨道联系起来,因此 φ(q,p)=φ(σ(q),σ(p));不变的变体和高效的聚合实现减少了重复计算,同时保留了等变性/不变性。

- 链接:[https://arxiv.org/abs/2509.24472](https://arxiv.org/abs/2509.24472)


## 553. [Calibrating Verbalized Confidence with Self-Generated Distractors](https://arxiv.org/abs/2509.25532)


- 会议:ICLR2026

- 中文简介:干扰因素归一化一致性通过生成替代声明、对主要声明和干扰因素进行独立置信度评分以及通过干扰因素置信度的加权和对主要分数进行标准化来校准模型的语言置信度。 NLI 派生的唯一性/矛盾权重与自我一致性置信度相结合。

- 链接:[https://arxiv.org/abs/2509.25532](https://arxiv.org/abs/2509.25532)


## 554. [Continuous Space-Time Video Super-Resolution with 3D Fourier Fields](https://arxiv.org/abs/2509.26325)


- 会议:ICLR2026

- 中文简介:视频傅立叶场将视频表示为一个连续 3D 坐标函数:学习的全局正弦频率与 RVRT 编码器预测的局部幅度/相位的有限和。解析高斯 PSF 因子抗锯齿任意空间/时间采样,使一个模型能够执行连续视频 SR、AVSR 和插值。

- 链接:[https://arxiv.org/abs/2509.26325](https://arxiv.org/abs/2509.26325)


## 555. [SeedPrints: Fingerprints Can Even Tell Which Seed Your Large Language Model Was Trained From](https://arxiv.org/abs/2509.26404)


- 会议:ICLR2026

- 中文简介:SeedPrints 根据随机序列的平均输出估计模型的种子偏差概况,选择最低平均同一维度,在两个模型之间交叉这些维度,并根据分析或模拟高斯零值测试平均每维度 Kendall 相关性。单边 p 值低于 0.01 表明共享谱系。

- 链接:[https://arxiv.org/abs/2509.26404](https://arxiv.org/abs/2509.26404)


## 556. [Learn to Guide Your Diffusion Model](https://arxiv.org/abs/2510.00815)


- 会议:ICLR2026

- 中文简介:Learn to Guide 训练一个小型引导权重预测器,通过最小化自洽 MMD 目标,选择无分类器引导强度作为条件和扩散时间的函数,同时保持条件和无条件降噪器冻结。

- 链接:[https://arxiv.org/abs/2510.00815](https://arxiv.org/abs/2510.00815)


## 557. [SimBench: Benchmarking the Ability of Large Language Models to Simulate Human Behaviors](https://arxiv.org/abs/2510.17516)


- 会议:ICLR2026

- 中文简介:将 20 个人类行为调查数据集归一化为总体和分组多项选择目标,从每个基础或指令调整的 LLM 得出概率分布,并使用归一化总变异距离度量对其进行评分。在 45 个模型中保持相同的人口统计提示、目标群体和评分。

- 链接:[https://arxiv.org/abs/2510.17516](https://arxiv.org/abs/2510.17516)


## 558. [Don't Throw Away Your Beams: Improving Consistency-based Uncertainties in LLMs via Beam Search](https://arxiv.org/abs/2512.09538)


- 会议:ICLR2026

- 中文简介:将基于一致性的不确定性的 M 个独立多项式样本替换为宽度 M 波束搜索,返回不同的高概率候选。对保留的序列概率进行归一化,并将其插入相异性、偏心率、特征向量相异性和 CoCoA 不确定性估计器中。

- 链接:[https://arxiv.org/abs/2512.09538](https://arxiv.org/abs/2512.09538)


## 559. [Cross-Tokenizer Likelihood Scoring Algorithms for Language Model Distillation](https://arxiv.org/abs/2512.14954)


- 会议:ICLR2026

- 中文简介:通过用覆盖编码表示相对标记字母表,计算教师对学生不同 BPE 标记器的可能性。完整到子集评分使用精确边缘化和 O(1) 下一个标记模型评估;从子集到完整使用递归精确有限算法,具有指数最坏情况和在空白或 EOS 处停止的波束近似。

- 链接:[https://arxiv.org/abs/2512.14954](https://arxiv.org/abs/2512.14954)


## 560. [Soft Equivariance Regularization for Invariant Self-Supervised Learning](https://arxiv.org/abs/2603.06693)


- 会议:ICLR2026

- 中文简介:SER 在 CLS 特征上保持基线不变的自监督目标,将批次分成普通的增强和组兼容的变换,并添加使用已知的相对几何动作计算的补丁标记等方差对比损失。损失是基线不变项加上 lambda 乘以该局部等方差正则化项;没有引入辅助预测器或转换头。

- 链接:[https://arxiv.org/abs/2603.06693](https://arxiv.org/abs/2603.06693)


## 561. [Understanding the Emergence of Seemingly Useless Features in Next-Token Predictors](https://arxiv.org/abs/2603.14087)


- 会议:ICLR2026

- 中文简介:该论文为下一个标记预测器提供了一个梯度分解/影响框架。它将特征的训练信号分成直接的、预先缓存的(通过注意力造成的未来损失)和电路共享贡献,然后使用因果干预、再训练消融、线性探针和稀疏自动编码器特征来解释为什么可以保留明显无用的特征。

- 链接:[https://arxiv.org/abs/2603.14087](https://arxiv.org/abs/2603.14087)


## 562. [Rethinking Residual Errors in Compensation-based LLM Quantization](https://arxiv.org/abs/2604.07955)


- 会议:ICLR2026

- 中文简介:补偿感知误差 (CAE) 将 GPTQ/GPTAQ 的残差目标重新推导为原始 FP 输出减去当前补偿的量化输出,从而将输入量化误差与层内补偿误差分开。 Cholesky 三角预计算提供了有效的校正项,可以添加到仅权重或权重激活 PTQ(可选地在 QuaRot/SpinQuant 之后)。

- 链接:[https://arxiv.org/abs/2604.07955](https://arxiv.org/abs/2604.07955)


## 563. [Panoptic Pairwise Distortion Graph](https://arxiv.org/abs/2604.11004)


- 会议:ICLR2026

- 中文简介:Panda 将两个对齐的图像及其全景区域表示为成对区域关系的畸变图。 DINOv2/SAM 前端将池化区域令牌馈送到小型 MLP/Transformer 降级解码器,该解码器具有关系、失真类型、严重性和质量的头;多任务图损失可以预测局部质量和总体质量。

- 链接:[https://arxiv.org/abs/2604.11004](https://arxiv.org/abs/2604.11004)


## 564. [Unifying Low Dimensional Spectra in Deep Learning](https://arxiv.org/abs/2404.06106)


- 会议:ICML2026

- 中文简介:该论文通过深度无约束特征模型(UFM)给出了理论统一机制:在神经崩溃/DNC条件下,特征均值确定层Hessian秩/特征向量、梯度子空间和权重秩,而深度/超参数化限制将结构转移到完整的Hessian。它将论证扩展到 ReLU DNC 并讨论了交叉熵异常值。

- 链接:[https://arxiv.org/abs/2404.06106](https://arxiv.org/abs/2404.06106)


## 565. [Generalizing Stochastic Smoothing for Differentiation and Gradient Estimation](https://arxiv.org/abs/2410.08125)


- 会议:ICML2026

- 中文简介:该论文推导了一种得分函数梯度估计器,用于在降低密度假设下对任意黑盒向量值函数进行随机平滑,包括尺度和全协方差/Cholesky 导数。它添加了 RQMC/QMC、对立和留一方差减少,将算法平滑与损失反向传播分开,并为有问题的分布引入了有限样本中值扩展。

- 链接:[https://arxiv.org/abs/2410.08125](https://arxiv.org/abs/2410.08125)


## 566. [Mirror Descent Under Generalized Smoothness](https://arxiv.org/abs/2502.00753)


- 会议:ICML2026

- 中文简介:该论文通过将 Hessian 算子从一般原始范数限制为其对偶范数作为对偶梯度范数的非递减链接来定义 ell-star 平滑度。广义自边界不等式将次优间隙转换为梯度边界,允许镜像下降、加速/乐观镜像下降、镜像 prox、随机镜像下降和复合镜像下降继承经典收敛率。

- 链接:[https://arxiv.org/abs/2502.00753](https://arxiv.org/abs/2502.00753)


## 567. [VIPO: Value Function Inconsistency Penalized Offline Reinforcement Learning](https://arxiv.org/abs/2504.11944)


- 会议:ICML2026

- 中文简介:VIPO 在基于离线模型的强化学习中为模型学习添加了价值函数不一致惩罚。它根据经验贝尔曼目标和学习动态下的模型价值函数估计数据价值函数,然后用似然度加上 lambda 乘以它们的平方差异来训练动态;将学习到的模型插入标准离线强化学习算法中。

- 链接:[https://arxiv.org/abs/2504.11944](https://arxiv.org/abs/2504.11944)


## 568. [Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Vision-Language Models](https://arxiv.org/abs/2505.16416)


- 会议:ICML2026

- 中文简介:Circle-RoPE 通过将图像网格位置映射到居中的圆形/环形几何形状,同时将文本放置在正交轴上,从而改变了多模式旋转位置编码,因此文本-图像距离是平衡的,并且图像标记距离仍然有意义。 AGE 将新编码与标准 M-RoPE 层交替使用。

- 链接:[https://arxiv.org/abs/2505.16416](https://arxiv.org/abs/2505.16416)


## 569. [SALE : Low-bit Estimation for Efficient Sparse Attention in Long-context LLM Prefilling](https://arxiv.org/abs/2505.24179)


- 会议:ICML2026

- 中文简介:SALE 是一种用于长上下文预填充的免训练块稀疏注意力实现。它将查询/关键块量化为 4 位,估计每个块相对于接收器/本地注意力的相对分数,跳过低于每个头阈值的块,并仅在选定的块上计算完全注意力;短暂的离线校准选择阈值。

- 链接:[https://arxiv.org/abs/2505.24179](https://arxiv.org/abs/2505.24179)


## 570. [Principled SVD-based Delta Compression via Quantization Error Minimization](https://arxiv.org/abs/2506.11087)


- 会议:ICML2026

- 中文简介:该方法使用 SVD 压缩微调增量,并通过最小化导出的量化误差来在奇异向量分量之间分配固定的比特预算。它以混合精度量化右侧因子,对左侧因子使用 RTC 校正,并可选择应用 GPTQ,生成可合并到基本模型中的压缩增量。

- 链接:[https://arxiv.org/abs/2506.11087](https://arxiv.org/abs/2506.11087)


## 571. [Large Language Models Develop Novel Social Biases Through Adaptive Exploration](https://arxiv.org/abs/2511.06148)


- 会议:ICML2026

- 中文简介:该论文介绍了一种迭代的雇佣强盗基准,其中语言模型在同样成功的人口群体中进行选择,然后测量隔离、群体平衡分歧和交叉运行随机性,同时测试提示、温度、背景和奖励干预措施。

- 链接:[https://arxiv.org/abs/2511.06148](https://arxiv.org/abs/2511.06148)


## 572. [MultiPriv: Benchmarking Individual-Level Privacy Reasoning in Vision-Language Models](https://arxiv.org/abs/2511.16940)


- 会议:ICML2026

- 中文简介:MultiPriv 引入了隐私感知和推理基准,其中包括合成个人、图像和元数据、双语属性以及涵盖识别、提取、本地化、链式推理、重新识别和跨模式关联的九个任务。

- 链接:[https://arxiv.org/abs/2511.16940](https://arxiv.org/abs/2511.16940)


## 573. [Are Your Agents Upward Deceivers?](https://arxiv.org/abs/2512.04864)


- 会议:ICML2026

- 中文简介:该论文定义了基于动作的代理向上欺骗,并使用轨迹/文件证据以及用于无故障、诱饵替换和制造指标的判断模型分类器,通过 5 种任务类型、8 个场景和多个领域的 200 个不可能/错误注入任务对其进行了基准测试。

- 链接:[https://arxiv.org/abs/2512.04864](https://arxiv.org/abs/2512.04864)


## 574. [Wait, Wait, Wait... Why Do Reasoning Models Loop?](https://arxiv.org/abs/2512.12895)


- 会议:ICML2026

- 中文简介:该论文将开放模型循环测量与合成星图随机游走任务和理论相结合,以隔离两个原因:硬度引起的对简单循环动作的风险厌恶和小动作误差的 Transformer 时间相关性;温度会降低但不会修复它们。

- 链接:[https://arxiv.org/abs/2512.12895](https://arxiv.org/abs/2512.12895)


## 575. [Weak Diffusion Priors Can Still Achieve Strong Inverse-Problem Performance](https://arxiv.org/abs/2601.22443)


- 会议:ICML2026

- 中文简介:该论文提出了针对弱/不匹配扩散生成器的反演问题的初始噪声优化,将潜在的高斯典型球体(AdamSphere)约束起来,并使用保留的测量损失(HoldoutTopK)选择稳健的迭代;理论解释了测量主导的后验集中和局部相关转移。

- 链接:[https://arxiv.org/abs/2601.22443](https://arxiv.org/abs/2601.22443)


## 576. [Are LLM Evaluators Really Narcissists? Sanity Checking Self-Preference Evaluations](https://arxiv.org/abs/2601.22548)


- 会议:ICML2026

- 中文简介:评估者质量基线通过将每个法官的不正确/较差的响应与来自其他模型的同样不正确的代理响应相匹配、比较配对法官投票概率并使用配对 t 检验测试自我代理差异来隔离有害的 LLM 自我偏好。

- 链接:[https://arxiv.org/abs/2601.22548](https://arxiv.org/abs/2601.22548)


## 577. [Attention Sink Forges Native MoE in Attention Layers: Sink-Aware Training to Address Head Collapse](https://arxiv.org/abs/2602.01203)


- 会议:ICML2026

- 中文简介:该论文将注意力池价值引流解释为注意力头的隐式门,并训练变异系数辅助损失来平衡头的重要性,并通过共享和路由头处理进行微调。

- 链接:[https://arxiv.org/abs/2602.01203](https://arxiv.org/abs/2602.01203)


## 578. [Online Social Welfare Function-based Resource Allocation](https://arxiv.org/abs/2602.01400)


- 会议:ICML2026

- 中文简介:该框架将坐标置信序列提升到单调凹社会福利函数的任何时间有效的福利界限,然后通过依赖舍入或注水预言机最大化生成的 SWF-UCB 来选择每个在线分配。

- 链接:[https://arxiv.org/abs/2602.01400](https://arxiv.org/abs/2602.01400)


## 579. [Non-Uniform Noise-to-Signal Ratio in the REINFORCE Policy-Gradient Estimator](https://arxiv.org/abs/2602.01460)


- 会议:ICML2026

- 中文简介:该论文定义了策略梯度噪声信号比,并导出了线性高斯、多项式和通用非线性策略设置的精确高斯矩公式和界限,解释了接近最优值和小策略噪声的方差增长。

- 链接:[https://arxiv.org/abs/2602.01460](https://arxiv.org/abs/2602.01460)


## 580. [LUCID: Attention with Preconditioned Representations](https://arxiv.org/abs/2602.10410)


- 会议:ICML2026

- 中文简介:LUCID 用 RKHS 派生的下三角预处理器替换了注意力值路径。它通过求解 P 乘以 Y 等于 V 来计算因果预条件表示,然后将普通的 softmax 注意力应用于 Y;关键的 RMS 标准化和可选的 Path 变体可以稳定内核。由此产生的模块保留了标准因果 QKV 接口和 O(N^2 d) 渐近形式,同时改进了长上下文调节。

- 链接:[https://arxiv.org/abs/2602.10410](https://arxiv.org/abs/2602.10410)


## 581. [Rational Neural Networks have Expressivity Advantages](https://arxiv.org/abs/2602.12390)


- 会议:ICML2026

- 中文简介:用可训练的低次数有理函数 r(x)=P(x)/Q(x) 替换网络中的固定激活,并以 1+|Q~(x)| 的安全分母避免实极点。P、Q 与原网络一起训练;理论上给出相对固定激活的近似分离,实践中直接插入 VGG、离线 RL 和 ViT 类架构。

- 链接:[https://arxiv.org/abs/2602.12390](https://arxiv.org/abs/2602.12390)


## 582. [Focusing Where Vision Matters: Selective Training for Large Vision Language Models via Visual Information Gain](https://arxiv.org/abs/2602.17186)


- 会议:ICML2026

- 中文简介:VIG 用同一 VLM 在原图与视觉模糊图上的答案 PPL 比值估计视觉信息增益,选出 top-p 样本,并只在这些样本中 mask 具有相同阈值的文本 token,再用标准监督微调。

- 链接:[https://arxiv.org/abs/2602.17186](https://arxiv.org/abs/2602.17186)


## 583. [Evaluating Relational Reasoning in LLMs with REL](https://arxiv.org/abs/2604.12176)


- 会议:ICML2026

- 中文简介:定义关系复杂性(必须绑定的独立源的最小数量/数量)和操作数复杂性,然后构建受控 REL 任务来衡量这些因素如何影响 LLM 推理。

- 链接:[https://arxiv.org/abs/2604.12176](https://arxiv.org/abs/2604.12176)


## 584. [Shuffle the Context: RoPE-Perturbed Self-Distillation for Long-Context Adaptation](https://arxiv.org/abs/2604.14339)


- 会议:ICML2026

- 中文简介:在第二次正向传递中添加仅后缀的 RoPE 指数偏移,并使用反向 KL 自蒸馏从扰动传递到停止梯度标准传递进行训练。

- 链接:[https://arxiv.org/abs/2604.14339](https://arxiv.org/abs/2604.14339)


## 585. [Knowing When to Quit: A Principled Framework for Dynamic Abstention in LLM Reasoning](https://arxiv.org/abs/2604.18419)


- 会议:ICML2026

- 中文简介:添加具有选定奖励的弃权操作,并从冻结的 LLM 隐藏状态中学习轻量级前缀值探测;对于每个代币,当估计的最终价值低于阈值时,它会弃权。

- 链接:[https://arxiv.org/abs/2604.18419](https://arxiv.org/abs/2604.18419)


## 586. [Optimized Deferral for Imbalanced Settings](https://arxiv.org/abs/2604.27723)


- 会议:ICML2026

- 中文简介:将延迟学习重新定义为输入专家对上的成本敏感分类,并使用按专家特定成本加权的基于边际的逻辑代理来训练 MILD 路由器。

- 链接:[https://arxiv.org/abs/2604.27723](https://arxiv.org/abs/2604.27723)


## 587. [Mind the Gap: Structure-Aware Consistency in Preference Learning](https://arxiv.org/abs/2604.27733)


- 会议:ICML2026

- 中文简介:为 DPO 的成对逻辑损失添加结构感知的语义边距,通过嵌入/编辑/黄金奖励距离缩放边距,以便语义上等效的答案不会过度分离。

- 链接:[https://arxiv.org/abs/2604.27733](https://arxiv.org/abs/2604.27733)


## 588. [Identifiable Token Correspondence for World Models](https://arxiv.org/abs/2605.16457)


- 会议:ICML2026

- 中文简介:可识别令牌对应(ITC)是令牌世界模型的解码插件:在前一帧令牌和变压器候选令牌之间建立亲和力,通过通配符生成解决 Sinkhorn 最佳传输分配,将其二值化,并在采样新令牌时复制持久令牌。

- 链接:[https://arxiv.org/abs/2605.16457](https://arxiv.org/abs/2605.16457)


## 589. [Thinned Mean Field Langevin Dynamics](https://arxiv.org/abs/2605.28589)


- 会议:ICML2026

- 中文简介:KT-MFLD 用大约 sqrt(N) 个粒子的核稀疏核心集替换了平均场 Langevin 动力学中的所有成对粒子相互作用,保留了近似向量场,同时将成本降低到 O(N^1.5)。

- 链接:[https://arxiv.org/abs/2605.28589](https://arxiv.org/abs/2605.28589)


## 590. [Spectral Reach: Understanding Neural Scaling as Progress into the Spectral Tail](https://arxiv.org/abs/2605.31244)


- 会议:ICML2026

- 中文简介:Spectral Reach 提供基于梯度的诊断,将线性化损耗变化分解为损耗灵敏度、网络灵敏度(eNTK/雅可比标度)和归一化频谱位置。光谱位置的轨迹用于描述光谱尾部的进展,Hutchinson 估计避免了完整的 eNTK。

- 链接:[https://arxiv.org/abs/2605.31244](https://arxiv.org/abs/2605.31244)


## 591. [Formalizing the Binding Problem](https://arxiv.org/abs/2606.03976)


- 会议:ICML2026

- 中文简介:形式化绑定定义了对象绑定信息 B_O(Z)=I(O;Z) 和条件绑定 I(O;Z|F),通过对象熵进行归一化,并使用从冻结表示标记预测对象/特征标签的探针来估计数量,包括对先前解码的标签进行自回归调节。

- 链接:[https://arxiv.org/abs/2606.03976](https://arxiv.org/abs/2606.03976)


## 592. [Representational Similarity and Model Behavior in Multi-Agent Interaction](https://arxiv.org/abs/2606.07818)


- 会议:ICML2026

- 中文简介:这项观察性研究从 LLM 对中提取最后一个令牌层表示,总结它们的 CKA 相似性(全局或最大对齐),并拟合混合效应回归,将相似性与合作博弈结果、响应唯一性和多智能体生成中的相互信息联系起来。

- 链接:[https://arxiv.org/abs/2606.07818](https://arxiv.org/abs/2606.07818)


## 593. [A Regret Minimization Framework on Preference Learning in Large Language Models](https://arxiv.org/abs/2606.09124)


- 会议:ICML2026

- 中文简介:RePO 用源自 KL 正则化 RL 的轨迹遗憾目标取代了奖励最大化偏好学习。它使用行为/参考策略令牌概率(或行为策略不可用时的确定性伪标签)来估计顺序遗憾,并使用类似 DPO 的 LoRA 目标进行训练。

- 链接:[https://arxiv.org/abs/2606.09124](https://arxiv.org/abs/2606.09124)


## 594. [nD-RoPE: A Generalized RoPE for n-Dimensional Position Embedding](https://arxiv.org/abs/2606.12146)


- 会议:ICML2026

- 中文简介:nD-RoPE 用 exp(i omega^T x) 替换任意坐标维度的一维旋转相位,并从规则单纯形几何构造确定性多尺度波矢量,并具有可选的每头随机正交旋转;注意力和 Transformer 保持不变。

- 链接:[https://arxiv.org/abs/2606.12146](https://arxiv.org/abs/2606.12146)


## 595. [Multi-Task Bayesian In-Context Learning](https://arxiv.org/abs/2606.20538)


- 会议:ICML2026

- 中文简介:多任务贝叶斯 ICL 在 K 个先验数据集先于目标数据集的情况下从头开始训练仅解码器 Transformer。 NLL 训练分摊线性/逻辑/流先验的分层贝叶斯后验预测,并在尾部、流和 ERA5 气候变化下进行测试。

- 链接:[https://arxiv.org/abs/2606.20538](https://arxiv.org/abs/2606.20538)


## 596. [Generalization vs Specialization under Concept Shift](https://arxiv.org/abs/2409.15582)


- 会议:NeurIPS2025

- 中文简介:该论文在概念转变下推导了精确的高维岭回归风险,显示了 kappa cos(theta)=1/2 处的相变,其中附加数据可以从有用转变为有害。各向同性/各向异性理论通过 Transformer ICL 和 MNIST/FashionMNIST 鲁棒/非鲁棒特征实验进行验证。

- 链接:[https://arxiv.org/abs/2409.15582](https://arxiv.org/abs/2409.15582)


## 597. [Approximately Aligned Decoding](https://arxiv.org/abs/2410.01103)


- 会议:NeurIPS2025

- 中文简介:近似对齐解码 (AprAD) 将前缀封闭错误检测器视为 trie 约束。当发现坏前缀时,它会调整概率特里树并使用推测采样比率来回溯/接受部分前缀,平衡拒绝与目标分布的失真。

- 链接:[https://arxiv.org/abs/2410.01103](https://arxiv.org/abs/2410.01103)


## 598. [PrefixKV: Adaptive Prefix KV Cache is What Vision Instruction-Following Models Need for Efficient Generation](https://arxiv.org/abs/2412.03409)


- 会议:NeurIPS2025

- 中文简介:视觉语言预填充后,根据累积注意力重要性对各层的 KV 条目进行排序,在预算范围内通过二分搜索选择全局保留阈值,并在解码时保留最高优先级的前缀 KV 条目。

- 链接:[https://arxiv.org/abs/2412.03409](https://arxiv.org/abs/2412.03409)


## 599. [Exploring the Noise Robustness of Online Conformal Prediction](https://arxiv.org/abs/2501.18363)


- 会议:NeurIPS2025

- 中文简介:用考虑已知均匀标签噪声率的校正替换标准弹球校准损失,然后将其插入自适应/在线共形预测器(ACI、动态 ACI、SAOCP)以保留覆盖范围。

- 链接:[https://arxiv.org/abs/2501.18363](https://arxiv.org/abs/2501.18363)


## 600. [How Memory in Optimization Algorithms Implicitly Modifies the Loss](https://arxiv.org/abs/2502.02132)


- 会议:NeurIPS2025

- 中文简介:对于具有指数衰减内存的历史相关优化器,泰勒展开过去围绕当前参数进行迭代,并得出对损失的修正,其梯度与优化器轨迹匹配,每步为 O(lr^3);实例化它的动量、AdamW、NAdam 和 Lion。

- 链接:[https://arxiv.org/abs/2502.02132](https://arxiv.org/abs/2502.02132)


## 601. [Sampling-Efficient Test-Time Scaling: Self-Estimating the Best-of-N Sampling in Early Decoding](https://arxiv.org/abs/2503.01422)


- 会议:NeurIPS2025

- 中文简介:采样高效的测试时间 Best-of-N (ST-BoN) 停止等待完全完成:它检测 N 个样本之间最早的分歧,继续一个短缓冲区,将隐藏状态一致性与嵌入链分数进行比较,并重复保留最一致的候选者。

- 链接:[https://arxiv.org/abs/2503.01422](https://arxiv.org/abs/2503.01422)


## 602. [Metropolis Adjusted Microcanonical Hamiltonian Monte Carlo](https://arxiv.org/abs/2503.01707)


- 会议:NeurIPS2025

- 中文简介:MAMS 为微规范哈密顿蒙特卡罗添加了 Metropolis 校正:保留速度范数的 Verlet/BAB 建议计算能量/雅可比/散度工作项,接受 min(1, exp(-W)),并自动调整步长、预处理、轨迹长度和可选刷新。

- 链接:[https://arxiv.org/abs/2503.01707](https://arxiv.org/abs/2503.01707)


## 603. [Tapered Off-Policy REINFORCE - Stable and efficient reinforcement learning for large language models](https://arxiv.org/abs/2503.14286)


- 会议:NeurIPS2025

- 中文简介:TOPR 通过不对称重要性比率逐渐减小来微调自回归策略离策略:正轨迹使用类似 SFT 的未裁剪权重,而负轨迹使用裁剪为 \[0,1\] 的比率,从而在没有 KL 正则化的情况下产生有界稳定目标。

- 链接:[https://arxiv.org/abs/2503.14286](https://arxiv.org/abs/2503.14286)


## 604. [Robust Hallucination Detection in LLMs via Adaptive Token Selection](https://arxiv.org/abs/2504.07863)


- 会议:NeurIPS2025

- 中文简介:将生成答案中的隐藏状态标记视为多实例包,使用浅层 MLP 对标记进行评分,选择硬顶 k 标记分数,并使用 MIL 裕度加上平滑度损失进行训练。可以选择使用令牌不确定性/语义一致性特征来增强隐藏状态。

- 链接:[https://arxiv.org/abs/2504.07863](https://arxiv.org/abs/2504.07863)


## 605. [The Mirage of Performance Gains: Why Contrastive Decoding Fails to Mitigate Object Hallucinations in MLLMs?](https://arxiv.org/abs/2504.10020)


- 会议:NeurIPS2025

- 中文简介:通过先验控制是/否输出来诊断对比解码增益,而不是提出新的训练模型。比较贪婪、对比、强制“是”提示、输出逻辑偏差和自适应合理性约束,并测试准确性变化是否跟踪“是”答案的比例。

- 链接:[https://arxiv.org/abs/2504.10020](https://arxiv.org/abs/2504.10020)


## 606. [Activated LoRA: Fine-tuned LLMs for Intrinsics](https://arxiv.org/abs/2504.12397)


- 会议:NeurIPS2025

- 中文简介:仅在调用令牌序列之后应用 LoRA 更新。因为所有早期的令牌都使用冻结的基本权重,所以它们的键/值缓存是可重用的;然后,适配器处理专门的延续,使多个内在函数能够共享基本上下文缓存。

- 链接:[https://arxiv.org/abs/2504.12397](https://arxiv.org/abs/2504.12397)


## 607. [Lost in Transmission: When and Why LLMs Fail to Reason Globally](https://arxiv.org/abs/2505.08140)


- 会议:NeurIPS2025

- 中文简介:BAPO 在因果注意模型中形式化了有界前缀到后缀通信:前缀预言机发出固定大小的代码,每个后缀位置只能检查有限数量的前缀派生标记,后缀预言机从该有界通信中决定。该框架预测哪些全局推理任务是困难的,并解释了思想链如何消除带宽瓶颈。

- 链接:[https://arxiv.org/abs/2505.08140](https://arxiv.org/abs/2505.08140)


## 608. [Superposition Yields Robust Neural Scaling](https://arxiv.org/abs/2505.10465)


- 会议:NeurIPS2025

- 中文简介:该论文解释了稀疏特征自动编码器的神经叠加:有限的隐藏宽度迫使特征重叠,权重衰减/特征频率决定弱与强叠加、干扰和缩放法则。

- 链接:[https://arxiv.org/abs/2505.10465](https://arxiv.org/abs/2505.10465)


## 609. [On the $O(\\frac{\\sqrt{d}}{K^{1/4}})$ Convergence Rate of AdamW Measured by $\\ell_1$ Norm](https://arxiv.org/abs/2505.11840)


- 会议:NeurIPS2025

- 中文简介:论文证明了在 l1 梯度范数、无有界梯度、平滑、无偏随机梯度、坐标噪声和显式 AdamW 参数/初始化条件下测量的 AdamW 收敛速度;它还将分析扩展到 NAdamW。

- 链接:[https://arxiv.org/abs/2505.11840](https://arxiv.org/abs/2505.11840)


## 610. [Efficient Large Language Model Inference with Neural Block Linearization](https://arxiv.org/abs/2505.21077)


- 会议:NeurIPS2025

- 中文简介:用校准输入/输出求每个注意力块的LMMSE仿射近似,按CCA/NMSE标准挑选低相关块替换为线性层,并保留残差连接;无需微调即可加速推理。

- 链接:[https://arxiv.org/abs/2505.21077](https://arxiv.org/abs/2505.21077)


## 611. [Preference Learning with Response Time: Robust Losses and Guarantees](https://arxiv.org/abs/2505.22820)


- 会议:NeurIPS2025

- 中文简介:用偏好标签和 response time 构造 Neyman-orthogonal 的 doubly robust 平方损失:先估计偏好/时间 nuisance,再做 sample splitting/cross-fitting,利用 EZ diffusion 的时间结构降低响应时间与偏好模型误差的乘积影响。

- 链接:[https://arxiv.org/abs/2505.22820](https://arxiv.org/abs/2505.22820)


## 612. [DINGO: Constrained Inference for Diffusion LLMs](https://arxiv.org/abs/2505.23061)


- 会议:NeurIPS2025

- 中文简介:DINGO 将用户正则表达式编译为 token-level DFA,并把 diffusion 的 mask token 当作可达状态集合;对每个扩散 block 做带 backpointer 的动态规划,最大化合法字符串的 token 概率,再回溯生成。

- 链接:[https://arxiv.org/abs/2505.23061](https://arxiv.org/abs/2505.23061)


## 613. [Foresight: Adaptive Layer Reuse for Accelerated and High-Quality Text-to-Video Generation](https://arxiv.org/abs/2506.00329)


- 会议:NeurIPS2025

- 中文简介:Foresight 是训练-free diffusion Transformer 调度器:先 warmup 若干步估计各层 spatial/temporal MSE 阈值,之后按周期重新计算;若某层误差低于 γλ 就复用缓存,否则重算并更新缓存。

- 链接:[https://arxiv.org/abs/2506.00329](https://arxiv.org/abs/2506.00329)


## 614. [Doubly Robust Alignment for Large Language Models](https://arxiv.org/abs/2506.01183)


- 会议:NeurIPS2025

- 中文简介:DRPO 用 reference-policy importance ratio 与 preference-model direct term 构造 doubly robust preference estimator,再加 KL 正则优化 LLM;若 preference model 或 reference policy 任一正确即可一致,误差主项是两者估计误差乘积。

- 链接:[https://arxiv.org/abs/2506.01183](https://arxiv.org/abs/2506.01183)


## 615. [On the Stability of Graph Convolutional Neural Networks: A Probabilistic Perspective](https://arxiv.org/abs/2506.01213)


- 会议:NeurIPS2025

- 中文简介:以输入 graph-signal 第二矩阵 K 加权 filter perturbation,精确计算 GCNN/graph filter 的 expected embedding change;用该目标在连续 edge-indicator 松弛上做 Prob-PGD,最后取最大边扰动攻击预训练模型。

- 链接:[https://arxiv.org/abs/2506.01213](https://arxiv.org/abs/2506.01213)


## 616. [Benford’s Curse: Tracing Digit Bias to Numerical Hallucination in LLMs](https://arxiv.org/abs/2506.01734)


- 会议:NeurIPS2025

- 中文简介:使用数字条件 logits 和数字选择性分数来测量语言模型的前导数字偏差,然后使用 logit-lens/激活探针来识别一小组数字选择性 FFN 神经元。在推理时,仅在生成数字标记时修剪这些神经元的前 0.01%,并比较结果的诊断行为。

- 链接:[https://arxiv.org/abs/2506.01734](https://arxiv.org/abs/2506.01734)


## 617. [Quantifying Task-relevant Similarities in Representations Using Decision Variable Correlations](https://arxiv.org/abs/2506.02164)


- 会议:NeurIPS2025

- 中文简介:DVC 通过将神经/模型响应投影到 PCA 组件上、学习任务的 LDA 决策轴以及在分半噪声归一化后关联结果几何来估计与任务相关的表征相似性。该方法比较方差解释和决策相关结构,而不是单独比较原始 RSA。

- 链接:[https://arxiv.org/abs/2506.02164](https://arxiv.org/abs/2506.02164)


## 618. [From Flat to Hierarchical: Extracting Sparse Representations with Matching Pursuit](https://arxiv.org/abs/2506.03093)


- 会议:NeurIPS2025

- 中文简介:MP-SAE 使用展开的匹配追踪编码器取代了通常的同时稀疏代码优化。从残差开始,每个 T 步骤选择相关性最大的字典原子,计算其系数,重构/减去它,并跨步骤共享学习的字典;解码器是稀疏重建的结果。

- 链接:[https://arxiv.org/abs/2506.03093](https://arxiv.org/abs/2506.03093)


## 619. [Offline RL by Reward-Weighted Fine-Tuning for Conversation Optimization](https://arxiv.org/abs/2506.06964)


- 会议:NeurIPS2025

- 中文简介:RWRFT 得出一个离线 RL 下限,该下限减少为对记录的对话轨迹进行奖励加权监督微调; SWIFT 对多个轨迹的奖励进行了标准化,因此同一目标在不同任务和范围内仍然可用。

- 链接:[https://arxiv.org/abs/2506.06964](https://arxiv.org/abs/2506.06964)


## 620. [System-Embedded Diffusion Bridge Models](https://arxiv.org/abs/2506.23726)


- 会议:NeurIPS2025

- 中文简介:通过将均值设置为 A⁺A 加上零空间计划并将协方差设置为距离空间测量噪声加上零空间扩散,将已知的线性测量系统嵌入到扩散桥中;训练 x0 预测器并从具有零噪声的伪逆重建中进行逆向采样。

- 链接:[https://arxiv.org/abs/2506.23726](https://arxiv.org/abs/2506.23726)


## 621. [Enhancing LLM Watermark Resilience Against Both Scrubbing and Spoofing Attacks](https://arxiv.org/abs/2507.06274)


- 会议:NeurIPS2025

- 中文简介:SEEK 通过将词汇表划分为 d 个独立的子词汇表、分配独立的绿色列表/密码并采用并集进行检测,使 KGW 风格的 LLM 水印具有碰撞弹性。标准 Logit 偏差插入水印,z 测试检测器无需训练即可恢复它。

- 链接:[https://arxiv.org/abs/2507.06274](https://arxiv.org/abs/2507.06274)


## 622. [Beyond Scores: Proximal Diffusion Models](https://arxiv.org/abs/2507.08956)


- 会议:NeurIPS2025

- 中文简介:近端扩散模型用近端图代替反向扩散步骤。网络根据噪声点和近端尺度预测近似近端校正,并通过跨时间/尺度/噪声的近端匹配进行训练; ProxDM 使用完全向后的近端步骤,而 HProxDM 将它们与分数步骤混合。

- 链接:[https://arxiv.org/abs/2507.08956](https://arxiv.org/abs/2507.08956)


## 623. [Cameras as Relative Positional Encoding](https://arxiv.org/abs/2507.10496)


- 会议:NeurIPS2025

- 中文简介:PRoPE 从成对的相机平截头体中构建投影相对位置编码:完整的投影变换放置在块对角 Q/K 编码的一半中,而补丁坐标 RoPE 放置在另一半中。由此产生的关系被注入到标准多视图注意力中,并带有可选的 CamRay 内在标记。

- 链接:[https://arxiv.org/abs/2507.10496](https://arxiv.org/abs/2507.10496)


## 624. [Trust Region Constrained Measure Transport in Path Space for Stochastic Optimal Control and Inference](https://arxiv.org/abs/2508.12511)


- 会议:NeurIPS2025

- 中文简介:信赖域 SOC 根据先前受控过程周围的 KL 半径,求解对目标路径测量的 KL 投影。双乘法器从重放缓冲区进行优化,提供几何退火的中间测量;然后将学习控制与置信域对数方差或 SOC 匹配损失进行拟合。

- 链接:[https://arxiv.org/abs/2508.12511](https://arxiv.org/abs/2508.12511)


## 625. [Locality in Image Diffusion Models Emerges from Data Statistics](https://arxiv.org/abs/2509.09672)


- 会议:NeurIPS2025

- 中文简介:计算训练数据协方差及其维纳/分析降噪器,使用高 SNR 灵敏度本征模式形成阈值局部掩模,并使用协方差加权流式 Softmax 降噪器生成扩散样本,而不是训练新网络。

- 链接:[https://arxiv.org/abs/2509.09672](https://arxiv.org/abs/2509.09672)


## 626. [Beyond Token Probes: Hallucination Detection via Activation Tensors with ACT-ViT](https://arxiv.org/abs/2510.00296)


- 会议:NeurIPS2025

- 中文简介:ACT-ViT 使用完整的层令牌激活张量,进行空间池化,通过小型适配器将每个源 LLM 映射到共享维度,并将生成的张量馈送到跨模型和任务训练的 ViT 幻觉检测器。

- 链接:[https://arxiv.org/abs/2510.00296](https://arxiv.org/abs/2510.00296)


## 627. [AdaDetectGPT: Adaptive Detection of LLM-Generated Text with Statistical Guarantees](https://arxiv.org/abs/2510.01268)


- 会议:NeurIPS2025

- 中文简介:AdaDetectGPT 将固定曲率统计量替换为学习的 B 样条对标记对数概率的见证,并使用正态/MCLT 近似选择阈值以满足目标假阴性率,并为黑盒模型提供替代 logit 选项。

- 链接:[https://arxiv.org/abs/2510.01268](https://arxiv.org/abs/2510.01268)


## 628. [Uncertainty Estimation by Flexible Evidential Deep Learning](https://arxiv.org/abs/2510.18322)


- 会议:NeurIPS2025

- 中文简介:通过三个标准头(浓度、类别概率和温度)预测灵活狄利克雷分布的参数,使用重建/预期 MSE 和 Brier 式项加上谱归一化进行训练,并从解析狄利克雷矩导出任意/认知不确定性。

- 链接:[https://arxiv.org/abs/2510.18322](https://arxiv.org/abs/2510.18322)


## 629. [CovMatch: Cross-Covariance Guided Multimodal Dataset Distillation with Trainable Text Encoder](https://arxiv.org/abs/2510.18583)


- 会议:NeurIPS2025

- 中文简介:使用在线一步编码器更新和闭式线性化对比内部目标,优化合成图像像素和可训练文本嵌入,使其互协方差和特征均值与真实的多模态数据集匹配。

- 链接:[https://arxiv.org/abs/2510.18583](https://arxiv.org/abs/2510.18583)


## 630. [Environment Inference for Learning Generalizable Dynamical System](https://arxiv.org/abs/2510.19784)


- 会议:NeurIPS2025

- 中文简介:给定假设的环境数量,交替将每个轨迹分配给具有最小综合预测损失的网络,并通过正则化更新共享/特定于环境的动态;关系保持具有单调损失特性。

- 链接:[https://arxiv.org/abs/2510.19784](https://arxiv.org/abs/2510.19784)


## 631. [Leveraging semantic similarity for experimentation with AI-generated treatments](https://arxiv.org/abs/2510.21119)


- 会议:NeurIPS2025

- 中文简介:将条件治疗效果作为治疗和用户内核特征的低阶乘积,通过交替广义岭回归来拟合这两个因素,并使用探索然后提交策略从估计结果矩阵中选择治疗。

- 链接:[https://arxiv.org/abs/2510.21119](https://arxiv.org/abs/2510.21119)


## 632. [On topological descriptors for graph products](https://arxiv.org/abs/2511.08846)


- 会议:NeurIPS2025

- 中文简介:本文开发了笛卡尔图产品上的欧拉特征和持久同源描述符的演算:它表征了 EC 表达性,证明了产品 PH 何时比组件 PH 更丰富,并根据组件图和 Betti 数计算了产品过滤持久性。

- 链接:[https://arxiv.org/abs/2511.08846](https://arxiv.org/abs/2511.08846)


## 633. [Predicting partially observable dynamical systems via diffusion models with a multiscale inference scheme](https://arxiv.org/abs/2511.19390)


- 会议:NeurIPS2025

- 中文简介:多尺度推理方案仅改变条件扩散模型的推理方案。它使用时间增量呈几何增长的模板水平,生成一小块新帧,然后移动模板以填充间隙并重复;相同的时间表适用于长记忆部分可观测系统。

- 链接:[https://arxiv.org/abs/2511.19390](https://arxiv.org/abs/2511.19390)


## 634. [Improved Balanced Classification with Theoretically Grounded Loss Functions](https://arxiv.org/abs/2512.23947)


- 会议:NeurIPS2025

- 中文简介:论文介绍了用于类别不平衡分类的两个损失族:GLA 添加了先验相关的广义 logit 调整,而 GCA 则将逆先验类别权重与类别相关的置信边际相结合。损失仍然类似于交叉熵,并且具有贝叶斯/H 一致性和边际边界分析。

- 链接:[https://arxiv.org/abs/2512.23947](https://arxiv.org/abs/2512.23947)


## 635. [Shortcut Features as Top Eigenfunctions of NTK: A Linear Neural Network Case and More](https://arxiv.org/abs/2602.03066)


- 会议:NeurIPS2025

- 中文简介:论文通过 NTK 谱分析了捷径学习:在几乎可分离、有偏差的高斯混合模型中,高权重捷径簇诱导出顶级 NTK 特征函数,这些特征函数收敛得更快,并且在训练后保留更大的影响力。它通过可预测性和可用性指标来操作该机制,并在非线性网络和真实数据集中对其进行检查。

- 链接:[https://arxiv.org/abs/2602.03066](https://arxiv.org/abs/2602.03066)


## 636. [Sketched Gaussian Mechanism for Private Federated Learning](https://arxiv.org/abs/2509.08195)


- 会议:NeurIPS2025

- 中文简介:Sketched Gaussian Mechanism 先把裁剪后的更新用随机 Gaussian sketch 降到低维再加 Gaussian noise,并用 RDP 联合 accounting;Fed-SGM 将其用于客户端级 DP 聚合和服务器 GD/AMSGrad,以降低维数依赖。

- 链接:[https://arxiv.org/abs/2509.08195](https://arxiv.org/abs/2509.08195)


## 637. [Evaluating multiple models using labeled and unlabeled data](https://arxiv.org/abs/2501.11866)


- 会议:NeurIPS2025

- 中文简介:SSME 用 ALR 将多分类概率映射到无界空间,联合少量 labeled 与大量 unlabeled classifier scores 拟合按真实类别分量的 KDE mixture(EM),再从后验标签采样来估计 accuracy/ECE/AUC/AUPRC 等指标。

- 链接:[https://arxiv.org/abs/2501.11866](https://arxiv.org/abs/2501.11866)


## 638. [Random Search Neural Networks for Efficient and Expressive Graph Learning](https://arxiv.org/abs/2510.22520)


- 会议:NeurIPS2025

- 中文简介:RSNN 用随机 DFS search 取代短 random walks:每次 search 天然覆盖所有节点,结合 adjacency positional encoding、sequence model 和跨 search 聚合;稀疏有界度图上用少量 search 以对数样本概率覆盖边,并证明等变/通用近似性质。

- 链接:[https://arxiv.org/abs/2510.22520](https://arxiv.org/abs/2510.22520)


## 639. [Distributional Machine Unlearning via Selective Data Removal](https://arxiv.org/abs/2507.15112)


- 会议:ICLR2026

- 中文简介:分布式遗忘将保留/不需要的帕累托目标形式化,并有选择地删除远离保留分布(或保留密度较低)的不需要的示例,然后重新拟合模型。高斯理论给出了KL前沿和样本效率比较;真实数据使用距离、似然比或 kNN 启发法。

- 链接:[https://arxiv.org/abs/2507.15112](https://arxiv.org/abs/2507.15112)


## 640. [FIRE: Frobenius-Isometry Reinitialization for Balancing the Stability–Plasticity Tradeoff](https://arxiv.org/abs/2602.08040)


- 会议:ICLR2026

- 中文简介:FIRE 在数据批次后将选定的权重矩阵投影到最近的正交/等距矩阵上,从而最大限度地减少受等距约束的 Frobenius 稳定性变化。牛顿-舒尔茨反平方根迭代近似极坐标因子,具有用于卷积和选定变换器矩阵的切片/缩放变体。

- 链接:[https://arxiv.org/abs/2602.08040](https://arxiv.org/abs/2602.08040)


## 641. [Linear-Core Surrogates: Smooth Loss Functions with Linear Rates for Classification and Structured Prediction](https://arxiv.org/abs/2604.27742)


- 会议:ICML2026

- 中文简介:线性核心代理用线性核心替换平滑分类/结构化预测损失的中心边缘区域,并在边界处缝合原始平滑尾部。生成的 C1/C2 代理保留了 argmax 一致性并提供线性速率保证;结构化梯度使用无偏采样标签对。

- 链接:[https://arxiv.org/abs/2604.27742](https://arxiv.org/abs/2604.27742)


## 642. [Convex Distance Operator Transport: A Convex and Geometry-Preserving Formulation](https://arxiv.org/abs/2606.02047)


- 会议:ICML2026

- 中文简介:CDOT 通过最小化凸特征传输成本以及耦合下距离算子之间的希尔伯特-施密特差异来对齐属性度量测量空间。它使用条件期望传输算子和 Frank-Wolfe 优化,保留几何结构,同时避免非凸 GW 目标。

- 链接:[https://arxiv.org/abs/2606.02047](https://arxiv.org/abs/2606.02047)


## 643. [ReNF: Rethinking the Design of Neural Long-Term Time Series Forecasters](https://arxiv.org/abs/2509.25914)


- 会议:ICML2026

- 中文简介:ReNF 的 BDO 块递归地生成逐渐更长的子预测:每个块都会投影当前输入,应用 MLP 和线性头,并在块级监督下将其子预测与输入连接起来。 EMA 权重平滑可解决验证/测试分布漂移问题。

- 链接:[https://arxiv.org/abs/2509.25914](https://arxiv.org/abs/2509.25914)


## 644. [Smooth Dynamic Cutoffs for Machine Learning Interatomic Potentials](https://arxiv.org/abs/2601.21147)


- 会议:ICML2026

- 中文简介:动态截止用特定于原子的邻居等级的可微加权平均值取代了硬邻居半径。 S 形软排名和多项式包络设置目标邻居计数,在邻居进入/离开时产生平滑截止,同时保留二阶导数。

- 链接:[https://arxiv.org/abs/2601.21147](https://arxiv.org/abs/2601.21147)


## 645. [The Truth Lies Somewhere in the Middle (of the Generated Tokens)](https://arxiv.org/abs/2605.09969)


- 会议:ICML2026

- 中文简介:这是一个经验表示协议:从选定的生成位置/层生成固定标记序列、平均池隐藏状态,并将生成的嵌入与具有去偏 CKA 和 m-kNN 的固定参考表示进行比较。没有模型经过训练或编辑。

- 链接:[https://arxiv.org/abs/2605.09969](https://arxiv.org/abs/2605.09969)


## 646. [Rao-Blackwell Gradient Estimators for Equivariant Denoising Diffusion](https://arxiv.org/abs/2502.09890)


- 会议:NeurIPS2025

- 中文简介:将对称轨道上的数据增强视为蒙特卡罗梯度估计器,然后用其条件均值(Rao-Blackwellization)替换采样轨道损失。轨道扩散通过采样组元素的自归一化重要性权重来实现这一点,同时保留每个样本的单个降噪器通道。

- 链接:[https://arxiv.org/abs/2502.09890](https://arxiv.org/abs/2502.09890)


## 647. [GaRA-SAM: Robustifying Segment Anything Model with Gated-Rank Adaptation](https://arxiv.org/abs/2506.02882)


- 会议:NeurIPS2025

- 中文简介:通过将 LoRA 更新分解为一级组件并使用分层输入感知门为每个降级图像选择低/高等级和掩模组件来适应冻结的 SAM。

- 链接:[https://arxiv.org/abs/2506.02882](https://arxiv.org/abs/2506.02882)


## 648. [RoboMD: Uncovering Robot Vulnerabilities through Semantic Potential Fields](https://arxiv.org/abs/2412.02818)


- 会议:ICLR2026

- 中文简介:在图像/文本嵌入上训练单独的 PPO 搜索策略,以探索黑盒机器人策略的推出,并提供走向失败和远离成功的语义潜在奖励,然后使用发现的失败进行诊断和有针对性的微调。

- 链接:[https://arxiv.org/abs/2412.02818](https://arxiv.org/abs/2412.02818)


## 649. [VenusX: Unlocking Fine-Grained Functional Understanding of Proteins](https://arxiv.org/abs/2505.11812)


- 会议:ICLR2026

- 中文简介:使用残基和片段级标签、家族感知身份分割和序列/结构/比对基线构建大型多任务蛋白质功能基准,因此可以在细粒度跨家族转移下评估模型表示。

- 链接:[https://arxiv.org/abs/2505.11812](https://arxiv.org/abs/2505.11812)


## 650. [Tackling Time-Series Forecasting Generalization via Mitigating Concept Drift](https://arxiv.org/abs/2510.14814)


- 会议:ICLR2026

- 中文简介:在串联回溯和水平协变量上使用与模型无关的软注意掩模来识别稳定模式,预测替代外生信号,并在 RevIN 标准化后将其与原始预测器相结合。

- 链接:[https://arxiv.org/abs/2510.14814](https://arxiv.org/abs/2510.14814)


## 651. [Triangle Multiplication is All You Need for Biomolecular Structure Representations](https://arxiv.org/abs/2510.18870)


- 会议:ICLR2026

- 中文简介:用三角形乘法和对前馈更新替换 AlphaFold3/Boltz 式对表示中的 Pairformer 序列注意和三角形注意块,保留对主干,同时消除冗余交互。

- 链接:[https://arxiv.org/abs/2510.18870](https://arxiv.org/abs/2510.18870)


## 652. [Empirical Gaussian Processes](https://arxiv.org/abs/2602.12082)


- 会议:ICML2026

- 中文简介:使用密集曲线的插值/SVD 或潜在参考网格加上不规则位置的高斯观测模型,直接从历史样本路径的语料库估计高斯过程均值和协方差,并通过封闭式 EM 拟合观测模型。

- 链接:[https://arxiv.org/abs/2602.12082](https://arxiv.org/abs/2602.12082)


## 653. [On the Relationship Between Activation Outliers and Feature Death in Sparse Autoencoders](https://arxiv.org/abs/2605.31518)


- 会议:ICML2026

- 中文简介:使用激活均值与标准差之比 gamma 作为 ReLU/TopK 特征死亡的封闭式预测器,然后在稀疏自动编码器训练之前使用均值中心激活(以及可选的 PCA 白化残差)以消除异常值引起的死亡特征。

- 链接:[https://arxiv.org/abs/2605.31518](https://arxiv.org/abs/2605.31518)


## 654. [SHAP zero Explains Biological Sequence Models with Near-zero Marginal Cost for Future Queries](https://arxiv.org/abs/2410.19236)


- 会议:NeurIPS2025

- 中文简介:使用 q-SFT 子采样/混叠/剥离构建黑盒 q 元序列模型的一次性稀疏傅里叶草图,然后以较低的未来查询成本将恢复的全局傅里叶系数转换为特定于查询的莫比乌斯系数和 SHAP/Faith-Shap 交互。

- 链接:[https://arxiv.org/abs/2410.19236](https://arxiv.org/abs/2410.19236)


## 655. [Estimating Dimensionality of Neural Representations from Finite Samples](https://arxiv.org/abs/2509.26560)


- 会议:ICLR2026

- 中文简介:通过仅对相互不同的行/列索引元组求和来纠正有限样本参与比偏差:gamma=A_both/B_both。可以通过独立噪声试验、重要性采样、稀疏/有限矩阵或局部半径加权来扩展相同的估计器。

- 链接:[https://arxiv.org/abs/2509.26560](https://arxiv.org/abs/2509.26560)


## 656. [How High is ‘High’? Rethinking the Roles of Dimensionality in Topological Data Analysis and Manifold Learning](https://arxiv.org/abs/2505.16879)


- 会议:ICML2026

- 中文简介:该论文证明了依赖随机函数向量的广义汉森-赖特浓度不等式,并用它来推导高维点云/核几何、内在维度条件和 TDA 持久性一致性;等距测试使用 kNN 最短路径作为实际诊断。

- 链接:[https://arxiv.org/abs/2505.16879](https://arxiv.org/abs/2505.16879)


## 657. [On the Separability of Information in Diffusion Models](https://arxiv.org/abs/2509.23937)


- 会议:ICML2026

- 中文简介:本文通过将网络信息分解为每坐标熵和总相关性来分析熵匹配扩散模型,识别条件信息和互信息,并使用 MINDE 分数差异来研究无分类器引导和跨扩散时间的语义/感知信息分割。

- 链接:[https://arxiv.org/abs/2509.23937](https://arxiv.org/abs/2509.23937)


## 658. [HypoSpace: A Diagnostic Benchmark for Set-Valued Hypothesis Generation under Underdetermination and Sublinear Coverage Bounds](https://arxiv.org/abs/2510.15614)


- 会议:ICML2026

- 中文简介:HypoSpace 将任何生成器视为有限可接受假设集上的采样器:准确枚举有效集,确定性地验证输出,规范化重复项,并报告有效性、唯一性和恢复率;复杂性分层解码基线在假设复杂性级别上分配样本。

- 链接:[https://arxiv.org/abs/2510.15614](https://arxiv.org/abs/2510.15614)


## 659. [FOVI: A biologically-inspired foveated interface for deep vision models](https://arxiv.org/abs/2602.03766)


- 会议:ICML2026

- 中文简介:FOVI 使用皮层放大规则将视觉空间采样到均匀密集的传感器流形上,在那里定义 kNN 感受野,并将共享的笛卡尔参考内核映射到每个邻域。相同的接口提供中心凹 CNN 层或 ViT 补丁嵌入,并具有可选的 LoRA 适配。

- 链接:[https://arxiv.org/abs/2602.03766](https://arxiv.org/abs/2602.03766)


## 660. [Inverting Data Transformations via Diffusion Sampling](https://arxiv.org/abs/2602.08267)


- 会议:ICML2026

- 中文简介:TIED 定义了具有数据空间能量的未知李群变换的后验,导出了一个简单化的目标分数恒等式,通过李代数噪声上的蒙特卡洛对数和表达式估计该分数,并通过组上的指数图更新来反转方差爆炸 SDE。

- 链接:[https://arxiv.org/abs/2602.08267](https://arxiv.org/abs/2602.08267)


## 661. [Semantic Tube Prediction: Beating LLM Data Efficiency with JEPA](https://arxiv.org/abs/2602.22617)


- 会议:ICML2026

- 中文简介:语义管预测添加了 JEPA 风格的辅助目标,用于相邻状态之间的隐藏位移:预测目标表示周围的语义管,并将其距离损失与下一个标记预测相结合,可以选择使用噪声/SNR 加权。

- 链接:[https://arxiv.org/abs/2602.22617](https://arxiv.org/abs/2602.22617)


## 662. [Efficient Adaptive Federated Optimization](https://arxiv.org/abs/2410.18117)


- 会议:NeurIPS2025

- 中文简介:高效自适应联合优化使用服务器端自适应预处理器,无需客户端优化器状态;平方根累加器采用 SM3 式维度进行因式分解,以减少通信和内存,同时保持收敛保证。

- 链接:[https://arxiv.org/abs/2410.18117](https://arxiv.org/abs/2410.18117)


## 663. [Robust Federated Finetuning of LLMs via Alternating Optimization of LoRA](https://arxiv.org/abs/2502.01755)


- 会议:NeurIPS2025

- 中文简介:RoLoRA 交替优化两个低秩 LoRA 因子:奇数轮更新一个因子,同时冻结另一个因子,偶数轮交换它们,减少联合微调中的破坏性交互。

- 链接:[https://arxiv.org/abs/2502.01755](https://arxiv.org/abs/2502.01755)


## 664. [On Transferring Transferability: Towards a Theory for Size Generalization](https://arxiv.org/abs/2505.23599)


- 会议:NeurIPS2025

- 中文简介:可迁移性框架描述了当以一种尺寸训练的预测器通过需要兼容的输入空间/嵌入和组动作而转移到另一种尺寸时,然后导出依赖于规范和架构的尺寸泛化界限。

- 链接:[https://arxiv.org/abs/2505.23599](https://arxiv.org/abs/2505.23599)


## 665. [Information Theoretic Learning for Diffusion Models with Warm Start](https://arxiv.org/abs/2510.20903)


- 会议:NeurIPS2025

- 中文简介:该方法从 KL/Fisher 恒等式导出信息论扩散似然​​目标,允许任意各向同性热启动分布,并利用正方差和对数 SNR 重要性采样来估计积分。

- 链接:[https://arxiv.org/abs/2510.20903](https://arxiv.org/abs/2510.20903)


## 666. [Learning Flexible Forward Trajectories for Masked Molecular Diffusion](https://arxiv.org/abs/2505.16790)


- 会议:ICLR2026

- 中文简介:将屏蔽扩散模型的元素无关屏蔽调度替换为联合学习的逐元素调度:为每个图节点分配一个可学习的嵌入(以及每条边端点嵌入的总和),通过 softplus 幂律调度对其进行映射以获得不同的损坏率,并使用直通 Gumbel-Softmax 采样一起训练降噪器和调度。

- 链接:[https://arxiv.org/abs/2505.16790](https://arxiv.org/abs/2505.16790)


## 667. [Thompson Sampling via Fine-Tuning of LLMs](https://arxiv.org/abs/2510.13328)


- 会议:ICLR2026

- 中文简介:把 prompt-conditioned 预训练 LLM 当作大离散候选空间上的 Thompson policy,用候选 reward 的线性核 GP 更新后验;以 VBOS 目标的 RLOO/标准化梯度每轮小步微调 LLM,使生成分布逼近后验最大概率分布。

- 链接:[https://arxiv.org/abs/2510.13328](https://arxiv.org/abs/2510.13328)


## 668. [Multilevel Control Functional](https://arxiv.org/abs/2305.12996)


- 会议:ICLR2026

- 中文简介:多级控制泛函 (MLCF) 将非参数 Stein/RKHS 控制泛函应用于多级保真度层次结构中的每个校正。他们分割样本以进行核拟合和估计,导出无偏估计量和方差界限,在成本预算下分配水平样本大小,并将估计器扩展到变分推理梯度。

- 链接:[https://arxiv.org/abs/2305.12996](https://arxiv.org/abs/2305.12996)


## 669. [Conjuring Semantic Similarity](https://arxiv.org/abs/2410.16431)


- 会议:ICLR2026

- 中文简介:对两段文本使用相同扩散噪声,比较各时间步条件score的平方差并Monte Carlo积分,将其解释为反向SDE上的Jeffreys语义散度,再用该分数排序文本相似度。

- 链接:[https://arxiv.org/abs/2410.16431](https://arxiv.org/abs/2410.16431)


## 670. [Fast Frank–Wolfe Algorithms with Adaptive Bregman Step-Size for Weakly Convex Functions](https://arxiv.org/abs/2504.04330)


- 会议:ICLR2026

- 中文简介:Bregman Frank–Wolfe 用相对平滑性在线估计的自适应步长替代固定 Lipschitz 步长,并以 Bregman 距离做线搜索;在多面体上再加入 away-step 活跃集更新,以获得弱凸/HEB 条件下的次线性、线性或局部线性速率。

- 链接:[https://arxiv.org/abs/2504.04330](https://arxiv.org/abs/2504.04330)


## 671. [Conformal Prediction with Corrupted Labels: Uncertain Imputation and Robust Re-weighting](https://arxiv.org/abs/2505.04733)


- 会议:ICLR2026

- 中文简介:论文先分析 privileged conformal prediction 在权重误差下何时仍覆盖,再提出 uncertain imputation:用 PI 条件模型 g 的 holdout 残差随机补全损坏标签并做 conformal calibration;最后把 naive、PCP 和 uncertain 三个集合取并集形成 triply robust prediction set。

- 链接:[https://arxiv.org/abs/2505.04733](https://arxiv.org/abs/2505.04733)


## 672. [Back to Square Roots: An Optimal Bound on the Matrix Factorization Error for Multi-Epoch Differentially Private SGD](https://arxiv.org/abs/2505.12128)


- 会议:ICLR2026

- 中文简介:BISR 把多 epoch DP-SGD 的逆相关矩阵设为带状逆平方根,从而用固定 Toeplitz 系数卷积历史高斯噪声;论文证明其多参与误差上/下界渐近匹配,并以数值优化逆矩阵系数的 BandInvMF 处理小带宽。

- 链接:[https://arxiv.org/abs/2505.12128](https://arxiv.org/abs/2505.12128)


## 673. [Conformalized Decision Risk Assessment](https://arxiv.org/abs/2505.13243)


- 会议:ICLR2026

- 中文简介:CREDO 把给定决策的 optimality 事件改写成 inverse feasible region 中的场景概率,用条件生成模型采样预测中心,并构造完全位于该区域内的 conformal balls;在 p/e/Monte-Carlo 三种半径下求最小 miscoverage,再平均 K 个样本得到决策风险。

- 链接:[https://arxiv.org/abs/2505.13243](https://arxiv.org/abs/2505.13243)


## 674. [LLM Fingerprinting via Semantically Conditioned Watermarks](https://arxiv.org/abs/2505.16723)


- 会议:ICLR2026

- 中文简介:语义条件水印仅在选定的语义域中嵌入红绿令牌水印,添加域外正偏差正则化器,并通过校正的单边 z 测试从多达 1,000 个黑盒生成中检测它。

- 链接:[https://arxiv.org/abs/2505.16723](https://arxiv.org/abs/2505.16723)


## 675. [The Polar Express: Optimal Matrix Sign Methods and their Application to the Muon Algorithm](https://arxiv.org/abs/2505.16932)


- 会议:ICLR2026

- 中文简介:Polar Express 通过在奇异值区间上贪婪地优化奇数五次多项式的系数来导出 GPU 友好的矩阵符号迭代,然后应用 bfloat16 安全因子和五到六次迭代来近似 Muon 使用的极因子。

- 链接:[https://arxiv.org/abs/2505.16932](https://arxiv.org/abs/2505.16932)


## 676. [Smooth Calibration Error: Uniform Convergence and Functional Gradient Analysis](https://arxiv.org/abs/2505.19396)


- 会议:ICLR2026

- 中文简介:平滑校准误差用平滑函数代替不连续校准误差,并导出预测变量类别上的均匀收敛边界;其函数梯度表征了增强/梯度程序如何减少平滑误差并将其与边缘条件下的错误分类联系起来。

- 链接:[https://arxiv.org/abs/2505.19396](https://arxiv.org/abs/2505.19396)


## 677. [Practical estimation of the optimal classification error with soft labels and calibration](https://arxiv.org/abs/2505.20761)


- 会议:ICLR2026

- 中文简介:该论文在没有实例特征的情况下估计了二元贝叶斯分类误差。对于平均软标签,它得出一个依赖于分离的偏差界限;对于损坏的软标签,它使用每个类/示例一个硬标签通过等渗回归来校准分数,并将校准后的概率插入到 min(p,1-p) 中,并具有噪声顺序一致性扩展。

- 链接:[https://arxiv.org/abs/2505.20761](https://arxiv.org/abs/2505.20761)


## 678. [Saddle-To-Saddle Dynamics in Deep ReLU Networks: Low-Rank Bias in the First Saddle Escape](https://arxiv.org/abs/2505.21722)


- 会议:ICLR2026

- 中文简介:Saddle-To-Saddle Dynamics 分析来自小初始化的深度无偏差 ReLU 梯度流。局部损失和范数/方向分解表征了第一个鞍座逃逸和最佳速度;该理论预测低阶第一层偏差和一系列随着深度越来越快的鞍形逃逸。

- 链接:[https://arxiv.org/abs/2505.21722](https://arxiv.org/abs/2505.21722)


## 679. [FACT: a first-principles alternative to the Neural Feature Ansatz for how networks learn representations](https://arxiv.org/abs/2507.05644)


- 会议:ICLR2026

- 中文简介:FACT 从带权重衰减的训练驻点直接把隐藏特征梯度写成权重 Gram 矩阵,得到 convergence features 的闭式关系;再用 FACT-RFM 按此关系迭代表示/分类器,对比 Neural Feature Ansatz。

- 链接:[https://arxiv.org/abs/2507.05644](https://arxiv.org/abs/2507.05644)


## 680. [ROC-n-reroll: How verifier imperfection affects test-time scaling](https://arxiv.org/abs/2507.12399)


- 会议:ICLR2026

- 中文简介:ROC-n-reroll 用 verifier 的 ROC 曲线精确表达 rejection sampling 的正确率和期望计算,证明在固定 compute、凹 ROC 下 RS 优于 Best-of-N,并给出 verifier 分数离散化与 KL-RL 极限的联系。

- 链接:[https://arxiv.org/abs/2507.12399](https://arxiv.org/abs/2507.12399)


## 681. [Is This Just Fantasy? Language Model Representations Reflect Human Judgments of Event Plausibility](https://arxiv.org/abs/2507.12553)


- 会议:ICLR2026

- 中文简介:CAA 用最小语言对的隐藏激活差向量表示 modal category,交叉验证选层并平均向量;投影/三维 logistic probe 预测人类模态判断,并用正负向量 steering 改变生成倾向。

- 链接:[https://arxiv.org/abs/2507.12553](https://arxiv.org/abs/2507.12553)


## 682. [DisTaC: Conditioning Task Vectors via Distillation for Robust Model Merging](https://arxiv.org/abs/2508.01148)


- 会议:ICLR2026

- 中文简介:DisTaC 在模型合并之前对每个任务向量进行预处理。规范调节将向量缩放到目标规范,而置信调节则提取学生温度高于教师的未标记任务数据;生成的向量一次性合并。

- 链接:[https://arxiv.org/abs/2508.01148](https://arxiv.org/abs/2508.01148)


## 683. [Graph Random Features for Scalable Gaussian Processes](https://arxiv.org/abs/2509.03691)


- 会议:ICLR2026

- 中文简介:图随机特征 (GRF) 使用稀疏重要性加权随机游走来估计图节点内核。稀疏 Gram 矩阵与共轭梯度、Hutchinson 迹估计和路径 GP 条件一起使用,以获得可扩展的 GP 回归和 Thompson 采样贝叶斯优化。

- 链接:[https://arxiv.org/abs/2509.03691](https://arxiv.org/abs/2509.03691)


## 684. [Understanding Sensitivity of Differential Attention through the Lens of Adversarial Robustness](https://arxiv.org/abs/2510.00517)


- 会议:ICLR2026

- 中文简介:分析差分注意力的单一结构规则:用两条softmax注意力分支之差再乘V,并研究负梯度对齐、深度和初始化系数如何放大输入梯度/局部Lipschitz,从而影响对抗鲁棒性。

- 链接:[https://arxiv.org/abs/2510.00517](https://arxiv.org/abs/2510.00517)


## 685. [The Curious Case of In-Training Compression of State Space Models](https://arxiv.org/abs/2510.02823)


- 会议:ICLR2026

- 中文简介:在训练中周期性提取SSM的A/B/C矩阵,求可控/可观测Gramian及Hankel奇异值,保持(1-tau)能量的最小秩后做balanced realization并截断状态,再将缩小矩阵写回模型;可用验证集回退保护。

- 链接:[https://arxiv.org/abs/2510.02823](https://arxiv.org/abs/2510.02823)


## 686. [Taming Imperfect Process Verifiers: A Sampling Perspective on Backtracking](https://arxiv.org/abs/2510.03149)


- 会议:ICLR2026

- 中文简介:提出Value-Guided Sampling with Stochastic Backtracking:在自回归生成树上按近似value加权前进或回退一步(固定自环),使随机游走叶节点平稳分布与目标倾斜策略成正比,从而避免不完美过程验证器误差随长度放大。

- 链接:[https://arxiv.org/abs/2510.03149](https://arxiv.org/abs/2510.03149)


## 687. [ParallelBench: Understanding the Trade-offs of Parallel Decoding in Diffusion LLMs](https://arxiv.org/abs/2510.04767)


- 会议:ICLR2026

- 中文简介:用条件总相关给出T步并行解码的不可约KL误差下界,并证明最优界随步数单调下降;用可解析list操作和17个真实任务构造ParallelBench,测量不同dLLM、unmasking策略的速度-质量曲线。

- 链接:[https://arxiv.org/abs/2510.04767](https://arxiv.org/abs/2510.04767)


## 688. [Detecting Data Contamination in LLMs via In-Context Learning](https://arxiv.org/abs/2510.27055)


- 会议:ICLR2026

- 中文简介:在前置一个或多个相同数据集示例后,CoDeC 根据模型平均标记对数概率的变化检测数据集级污染:当上下文增量为负时标记污染,无需生成或校准。

- 链接:[https://arxiv.org/abs/2510.27055](https://arxiv.org/abs/2510.27055)


## 689. [Splat Regression Models](https://arxiv.org/abs/2511.14042)


- 会议:ICLR2026

- 中文简介:Splat 回归模型将函数表示为各向异性、异构凹凸函数的有限混合,具有学习的输出权重、中心和尺度; Wasserstein-Fisher-Rao 梯度流提供了优化器并恢复高斯分布作为一种特殊情况。

- 链接:[https://arxiv.org/abs/2511.14042](https://arxiv.org/abs/2511.14042)


## 690. [Distribution-informed Online Conformal Prediction](https://arxiv.org/abs/2512.07770)


- 会议:ICLR2026

- 中文简介:在在线保序预测中先用乐观在线梯度下降更新分位数,再用滑动窗口ECDF或KDE估计当前分布并作校正;用校正后的分位数产生区间,并证明任意序列下的长期覆盖/遗憾保证。

- 链接:[https://arxiv.org/abs/2512.07770](https://arxiv.org/abs/2512.07770)


## 691. [TreeGrad-Ranker: Feature Ranking via $O(L)$-Time Gradients for Decision Trees](https://arxiv.org/abs/2602.11623)


- 会议:ICLR2026

- 中文简介:TreeGrad-Ranker 通过使用树的多线性扩展的 O(L) 时间梯度优化联合插入/删除目标来对决策树特征进行排序; TreeGrad-Shap 提供 Shapley 风格的基线,TreeProb 将相同的梯度思想扩展到概率树。

- 链接:[https://arxiv.org/abs/2602.11623](https://arxiv.org/abs/2602.11623)


## 692. [Mean Estimation from Coarse Data: Characterizations and Efficient Algorithms](https://arxiv.org/abs/2602.23341)


- 会议:ICLR2026

- 中文简介:对于仅通过凸粗划分观察到的高斯均值,本文描述了均值何时可识别,并使用投影 SGD 计算唯一的凸负对数似然最小化器,使用截断/对数凹采样来获取梯度;扩展涵盖分区和线性回归的混合。

- 链接:[https://arxiv.org/abs/2602.23341](https://arxiv.org/abs/2602.23341)


## 693. [Frozen Policy Iteration: Computationally Efficient RL under Linear $Q^{\\pi}$ Realizability for Deterministic Dynamics](https://arxiv.org/abs/2603.00716)


- 会议:ICLR2026

- 中文简介:冻结策略迭代通过维护每步覆盖数据集、使用椭圆置信度探索以及在覆盖所有操作后冻结策略/Q 更新,使未来数据保持有效的策略性,使在线 RL 在线性 Q^pi 可实现性和确定性动态下易于计算处理。

- 链接:[https://arxiv.org/abs/2603.00716](https://arxiv.org/abs/2603.00716)


## 694. [Stochastic Neural Networks for Causal Inference with Missing Confounders](https://arxiv.org/abs/2603.01230)


- 会议:ICLR2026

- 中文简介:CI-StoNet 使用稀疏随机神经网络模块对因果 DAG 进行编码,并使用自适应 SGHMC 从条件后验中估算缺失的混杂因素;然后,蒙特卡罗结果函数估计总因果效应,并扩展代理变量和其他 DAG。

- 链接:[https://arxiv.org/abs/2603.01230](https://arxiv.org/abs/2603.01230)


## 695. [Radiometrically Consistent Gaussian Surfels for Inverse Rendering](https://arxiv.org/abs/2603.01491)


- 会议:ICLR2026

- 中文简介:RadioGS 引入了高斯面元的辐射一致性:可微分的 2D 高斯光线追踪器蒙特卡罗在看不见的方向上渲染基于物理的辐射度,并将其 L1 残差最小化为学习的面元辐射度,然后使用相同的损失进行逆渲染和快速重新照明微调。

- 链接:[https://arxiv.org/abs/2603.01491](https://arxiv.org/abs/2603.01491)


## 696. [From Data Statistics to Feature Geometry: How Correlations Shape Superposition](https://arxiv.org/abs/2603.09972)


- 会议:ICLR2026

- 中文简介:使用受控词袋叠加 (BOWS) 来改变特征协方差/相关性,同时保持语义固定,并表明低秩相关统计量会在线性/ReLU 自动编码器中产生相长干扰,而 ReLU 会选择性地过滤残余干扰并产生非线性特征几何。

- 链接:[https://arxiv.org/abs/2603.09972](https://arxiv.org/abs/2603.09972)


## 697. [SAFETY-GUIDED FLOW (SGF): A UNIFIED FRAMEWORK FOR NEGATIVE GUIDANCE IN SAFE GENERATION](https://arxiv.org/abs/2603.13300)


- 会议:ICLR2026

- 中文简介:在每个扩散/流动步骤中,计算预测的清洁样本和负参考集之间的 RBF-MMD 能量,仅在理论上合理的早期关键窗口期间将其梯度添加为负引导向量,然后衰减/关闭引导。

- 链接:[https://arxiv.org/abs/2603.13300](https://arxiv.org/abs/2603.13300)


## 698. [Revisiting Active Sequential Prediction-Powered Mean Estimation](https://arxiv.org/abs/2604.18569)


- 会议:ICLR2026

- 中文简介:将预测驱动的逆概率校正与在线 FTRL 查询策略相结合,使用不相交的标签批次自适应地选择要查询的示例,同时保留任何时候的 Freedman 置信区间。

- 链接:[https://arxiv.org/abs/2604.18569](https://arxiv.org/abs/2604.18569)


## 699. [Gradient Testing and Estimation by Comparisons](https://arxiv.org/abs/2405.11454)


- 会议:ICML2026

- 中文简介:使用一个基于平滑度的比较查询来获得方向偏好符号,然后随机化方向和二分搜索坐标比来估计归一化梯度;量子相位回扣/QFT 变体减少了查询对维度的依赖。

- 链接:[https://arxiv.org/abs/2405.11454](https://arxiv.org/abs/2405.11454)


## 700. [Keep Everyone Happy: Online Fair Division of Numerous Items with Few Copies](https://arxiv.org/abs/2408.12845)


- 会议:ICML2026

- 中文简介:使用乐观的上下文强盗预测器估计未知的项目代理效用,并将每个到达的项目分配给代理,从而最大化历史相关的公平/效率优度函数。

- 链接:[https://arxiv.org/abs/2408.12845](https://arxiv.org/abs/2408.12845)


## 701. [Learning Rate Annealing Improves Tuning Robustness in Stochastic Optimization](https://arxiv.org/abs/2503.09411)


- 会议:ICML2026

- 中文简介:在预测 SGD 中使用学习率退火计划(余弦或多项式衰减),以便后期步骤对于最初错误指定的步长变得稳健;该论文证明了凸和平滑设置的最后迭代/收敛和鲁棒性界限。

- 链接:[https://arxiv.org/abs/2503.09411](https://arxiv.org/abs/2503.09411)


## 702. [Sharp Empirical Bernstein Inequalities for the Variance of Bounded Random Variables](https://arxiv.org/abs/2505.01987)


- 会议:ICML2026

- 中文简介:使用尖锐的经验 Bernstein 常数构建可预测均值/可预测方差指数超鞅,应用 Ville 不等式实现任意时间有效性,并插入运行估计以获得上/下方差置信序列和均值/方差区间。

- 链接:[https://arxiv.org/abs/2505.01987](https://arxiv.org/abs/2505.01987)


## 703. [Understanding the Performance Gap in Preference Learning: A Dichotomy of RLHF and DPO](https://arxiv.org/abs/2505.19770)


- 会议:ICML2026

- 中文简介:该论文给出了精确和有限样本优化下 RLHF 和 DPO 之间的理论二分法:它描述了它们的奖励/策略类别何时相等,然后表明代币级稀疏结构可以使在线 RLHF 在统计上比 DPO 更高效。

- 链接:[https://arxiv.org/abs/2505.19770](https://arxiv.org/abs/2505.19770)


## 704. [Membership Inference Attacks for Unseen Classes](https://arxiv.org/abs/2506.06488)


- 会议:ICML2026

- 中文简介:对于看不见的类成员推理,直接对目标模型分数训练分位数回归攻击,而不是在目标类上训练影子模型。攻击者估计弹球损失的分数分位数,并在未见过的类别分数超过校准阈值时声明成员资格。

- 链接:[https://arxiv.org/abs/2506.06488](https://arxiv.org/abs/2506.06488)


## 705. [Explanations are a Means to an End: Decision Theoretic Explanation Evaluation](https://arxiv.org/abs/2506.22740)


- 会议:ICML2026

- 中文简介:本文将解释评估为决策问题中的信息。给定特征、预测、动作/状态空间、效用和先验,它计算信息的理性价值,并将理​​论、人类互补和行为因果价值分开;粗化/聚类过程可估计数据生成分布,而不会出现高维过拟合。

- 链接:[https://arxiv.org/abs/2506.22740](https://arxiv.org/abs/2506.22740)


## 706. [LiMuon: Light and Fast Muon Optimizer for Large Models](https://arxiv.org/abs/2509.14562)


- 会议:ICML2026

- 中文简介:LiMuon 将 STORM 式方差减少矩阵梯度估计与 Muon 正交化相结合。选项 2 使用随机 SVD 压缩动量以对 r-hat 进行排名,而精确 SVD 或 Newton-Schulz 产生正交更新,减少优化器状态内存并证明 O(epsilon^-3) 样本复杂性。

- 链接:[https://arxiv.org/abs/2509.14562](https://arxiv.org/abs/2509.14562)


## 707. [Informed Asymmetric Actor-Critic: Leveraging Privileged Signals Beyond Full-State Access](https://arxiv.org/abs/2509.26000)


- 会议:ICML2026

- 中文简介:IAAC让history-only actor配一个可条件于任意state-dependent privileged signal的critic,并证明这种信号仍给出无偏policy gradient;训练前用残差依赖检验、训练后用return-prediction gain筛选最有用的信号或特征子集。

- 链接:[https://arxiv.org/abs/2509.26000](https://arxiv.org/abs/2509.26000)


## 708. [Even Faster Kernel Matrix Linear Algebra via Density Estimation](https://arxiv.org/abs/2510.02540)


- 会议:ICML2026

- 中文简介:把非负kernel matrix-vector product视为加权核密度估计查询,用分组/密度估计数据结构近似Gaussian/Laplacian/Exponential kernel矩阵运算,并复用于矩阵乘、带噪power method最大特征值和kernel sum。

- 链接:[https://arxiv.org/abs/2510.02540](https://arxiv.org/abs/2510.02540)


## 709. [Beyond the Final Answer: Evaluating the Reasoning Trajectories of Tool-Augmented Agents](https://arxiv.org/abs/2510.02837)


- 会议:ICML2026

- 中文简介:TRACE把ReAct每步的tool、input、observation存入evidence bank,再让LLM评估器依据该bank给出三类轨迹分数:完成任务所需的最小证据比例、thought是否有证据支撑、工具失败后是否适应并改用替代路径。

- 链接:[https://arxiv.org/abs/2510.02837](https://arxiv.org/abs/2510.02837)


## 710. [On Structured State-Space Duality](https://arxiv.org/abs/2510.04944)


- 会议:ICML2026

- 中文简介:SSD把一般diagonal SSM的kernel分解成N个1-SS masked-attention head:每个状态维度对应一个head,full-rank diagonal可实现1-SS dual;递推仍为O(TNd),并给出任意SSM拥有1-SS attention dual的充要结构条件。

- 链接:[https://arxiv.org/abs/2510.04944](https://arxiv.org/abs/2510.04944)


## 711. [Efficient Bayesian Inference from Noisy Pairwise Comparisons](https://arxiv.org/abs/2510.09333)


- 会议:ICML2026

- 中文简介:BBQ在Bradley–Terry中给每个rater一个quality q:以q概率按item skill比较、以1-q概率随机投硬币;Gamma item/Beta quality先验下引入Thurstonian arrival和隐变量,用闭式EM更新并给出后验不确定性区间。

- 链接:[https://arxiv.org/abs/2510.09333](https://arxiv.org/abs/2510.09333)


## 712. [Adversarial Vulnerability from Interference Between Features in Superposition](https://arxiv.org/abs/2510.11709)


- 会议:ICML2026

- 中文简介:在superposition argmax bottleneck中,类别k到j的最优扰动方向是W_e^T(w_k-w_j),其坐标幅度由特征干扰决定;论文用该几何公式预测攻击方向、transfer和输入相关性,并在真实分类器中做诊断。

- 链接:[https://arxiv.org/abs/2510.11709](https://arxiv.org/abs/2510.11709)


## 713. [Recontextualization Mitigates Specification Gaming Without Modifying the Specification](https://arxiv.org/abs/2512.19027)


- 会议:ICML2026

- 中文简介:保持任务规格和奖励不变,仅在on-policy训练时用更严格/不鼓励作弊的context生成样本,再把同一输出放到更宽松、鼓励完成任务的context下计算训练奖励,从而重塑策略分布。

- 链接:[https://arxiv.org/abs/2512.19027](https://arxiv.org/abs/2512.19027)


## 714. [Anytime Detection of Strategic Deviations in Multi-Agent Systems](https://arxiv.org/abs/2601.05427)


- 会议:ICML2026

- 中文简介:把相对基准策略的每轮收益差视作可下注增量,用coin-betting构造e-value并对未知偏差松弛量做混合;所得test supermartingale支持任意停止,e-BH进一步控制多玩家/多动作的FDR。

- 链接:[https://arxiv.org/abs/2601.05427](https://arxiv.org/abs/2601.05427)


## 715. [Belief Propagation Converges to Gaussian Distributions in Sparsely-Connected Factor Graphs](https://arxiv.org/abs/2601.21935)


- 会议:ICML2026

- 中文简介:该论文将信念传播分析为消息的重复卷积和乘法。在有限矩、Lindeberg 条件和平移不变成对因子下,链消息通过 CLT 变为高斯分布;接近高斯的强先验锚树/循环计算树消息,具有明确的错误/率结果和李群切线空间扩展。

- 链接:[https://arxiv.org/abs/2601.21935](https://arxiv.org/abs/2601.21935)


## 716. [Diagnosing the Reliability of LLM-as-a-Judge via Item Response Theory](https://arxiv.org/abs/2602.00521)


- 会议:ICML2026

- 中文简介:拟合分级响应项目响应模型,每个项目具有一个潜在质量和提示变异判别/阈值,然后根据拟合的潜在分数报告扰动一致性和人类对齐诊断。

- 链接:[https://arxiv.org/abs/2602.00521](https://arxiv.org/abs/2602.00521)


## 717. [What Does Vision Tool-Use Reinforcement Learning Really Learn? Disentangling Tool-Induced and Intrinsic Effects for Crop-and-Zoom](https://arxiv.org/abs/2602.01334)


- 会议:ICML2026

- 中文简介:引入配对的无工具/可用工具评估框架,将性能分解为调用/模式收益和危害,然后将净工具收益纳入质量、政策和工具质量影响。

- 链接:[https://arxiv.org/abs/2602.01334](https://arxiv.org/abs/2602.01334)


## 718. [A hitchhiker's guide to Poisson gradient estimation](https://arxiv.org/abs/2602.03896)


- 会议:ICML2026

- 中文简介:对于泊松梯度估计,本文用紧支撑立方 Hermite smoothstep 替换 sigmoid 软指标,对于 w=clamp((u+1)/2,0,1),f(u)=3w2−2w3,产生精确/受控的泊松矩,并在 EAT 式估计器中产生较低的方差。

- 链接:[https://arxiv.org/abs/2602.03896](https://arxiv.org/abs/2602.03896)


## 719. [Muon in Associative Memory Learning: Training Dynamics and Scaling Laws](https://arxiv.org/abs/2602.05725)


- 会议:ICML2026

- 中文简介:Muon 应用矩阵梯度的矩阵符号,W<-W-eta*msgn(grad);在分层关联记忆模型中,该论文表明,这种频谱预处理器与任务表示相一致,并使更新几乎各向同性,避免了 GD 频率瓶颈并产生更快的噪声缩放。

- 链接:[https://arxiv.org/abs/2602.05725](https://arxiv.org/abs/2602.05725)


## 720. [Learning Rate Scaling across LoRA Ranks and Transfer to Full Finetuning](https://arxiv.org/abs/2602.06204)


- 会议:ICML2026

- 中文简介:该论文推导了 LoRA 的排序和初始化相关的学习率定律。在 SignSGD 缩放抽象下,随机 A/零 B LoRA 的 eta 与 n^-1/2 r^{-(1-gamma)/2} 成比例,而 alpha=1 的随机 B/零 A 的 eta 与 n^-1 成比例,并转移到完全微调。

- 链接:[https://arxiv.org/abs/2602.06204](https://arxiv.org/abs/2602.06204)


## 721. [Magnitude Distance: A Geometric Measure of Dataset Similarity](https://arxiv.org/abs/2602.08859)


- 会议:ICML2026

- 中文简介:幅度距离通过包含-排除公式 2Mag(X union Y)-Mag(X)-Mag(Y) 来比较有限欧几里得数据集,其中 Mag 是反指数相似核二次形式。尺度 t 控制全局/局部敏感性; MagGN 使用归一化距离的几何表作为发电机损失。

- 链接:[https://arxiv.org/abs/2602.08859](https://arxiv.org/abs/2602.08859)


## 722. [What Does Preference Learning Recover from Pairwise Comparison Data?](https://arxiv.org/abs/2602.10286)


- 会议:ICML2026

- 中文简介:该论文描述了成对偏好学习所识别的内容:三元组/CPRD 分解提供了可表示性,Bradley-Terry 训练在错误指定下恢复了 KL 投影,图/线性连接控制了估计准确性和样本复杂性。

- 链接:[https://arxiv.org/abs/2602.10286](https://arxiv.org/abs/2602.10286)


## 723. [Asymmetric Prompt Weighting for Reinforcement Learning with Verifiable Rewards](https://arxiv.org/abs/2602.11128)


- 会议:ICML2026

- 中文简介:该论文用非对称提示权重取代了可验证奖励策略梯度中的对称有效权重:Linear-R、Plateau-R 和 Sqrt-R 按成功率重新加权提示,因此零成功提示保留了有用的梯度信号;总体对数概率常微分方程解释收敛和计算预算权衡。

- 链接:[https://arxiv.org/abs/2602.11128](https://arxiv.org/abs/2602.11128)


## 724. [Keeping a Secret Requires a Good Memory: Unconditional Streaming Lower-Bounds for Differentially Private Algorithms](https://arxiv.org/abs/2602.12209)


- 会议:ICML2026

- 中文简介:该论文通过减少通信问题(例如指纹识别和避免HeavyHitters)到CountDistinct、MaxSelect 和Quantile 类型的任务,证明了流算法的无条件用户级差分隐私下限。

- 链接:[https://arxiv.org/abs/2602.12209](https://arxiv.org/abs/2602.12209)


## 725. [SlideSparse: Fast and Flexible (2N-2):2N Structured Sparsity](https://arxiv.org/abs/2603.05232)


- 会议:ICML2026

- 中文简介:将每个(2N−2)权重块用步长2的重叠窗口无损分解为N−1个2:4块;离线完成索引重排,推理时把激活提升到窗口索引并与量化、2:4稀疏GEMM融合。

- 链接:[https://arxiv.org/abs/2603.05232](https://arxiv.org/abs/2603.05232)


## 726. [Local Constrained Bayesian Optimization](https://arxiv.org/abs/2603.07965)


- 会议:ICML2026

- 中文简介:在带噪目标与约束的GP代理上使用局部二次罚函数Qρ=f+ρ/2||c||²,以梯度不确定性构造批量采集,并在GP后验梯度下降/投影与ρ、步长调度下逐步逼近可行KKT点。

- 链接:[https://arxiv.org/abs/2603.07965](https://arxiv.org/abs/2603.07965)


## 727. [Zeroth-Order Optimization at the Edge of Stability](https://arxiv.org/abs/2604.14669)


- 会议:ICML2026

- 中文简介:该论文通过高斯对称两点估计器分析了稳定边缘附近的零阶优化。线性化二次动力学产生具有一级全局耦合的协方差算子/二阶矩递归;由此产生的均方稳定性阈值是针对 ZO-GD、ZO-GDM 和冻结预处理器 ZO-Adam 导出的,具有迹线/顶部特征值边界和经验 EoS 跟踪。

- 链接:[https://arxiv.org/abs/2604.14669](https://arxiv.org/abs/2604.14669)


## 728. [Learning to Correct: Reinforcement Learning for Multi-Attempt Chain-of-Thought](https://arxiv.org/abs/2604.17912)


- 会议:ICML2026

- 中文简介:CAL-GRPO 使用二进制验证器训练 K 次连续尝试的策略。轨迹级 GRPO 传播终端 Verification@K 奖励,而朴素尝试级奖励是有偏差的; CAL 根据留一法达到的轨迹估计每次尝试的未来成功,并通过尝试明智的 GRPO 标准化之前的后续失败概率的乘积来对尝试 i 进行加权。论文推导了梯度和 Rao--Blackwell 方差缩减结果。

- 链接:[https://arxiv.org/abs/2604.17912](https://arxiv.org/abs/2604.17912)


## 729. [Skill Neologisms: Towards Skill-based Continual Learning](https://arxiv.org/abs/2605.04970)


- 会议:ICML2026

- 中文简介:Skill neologisms 只优化冻结 LLM 词表中的一组 soft skill tokens:以每条样本都需要目标 skill、并混合已有 skills 的 skill-centered dataset 做 SFT;把 token 放在 skill 名称/操作位置,使预训练模型能在上下文中组合新 token,并可把独立学到的 token 零样本拼接。

- 链接:[https://arxiv.org/abs/2605.04970](https://arxiv.org/abs/2605.04970)


## 730. [Query-efficient model evaluation using cached responses](https://arxiv.org/abs/2605.07096)


- 会议:ICML2026

- 中文简介:用缓存参考模型在小型 query 子集上的 response embeddings 构造 Data Kernel Perspective Space(pairwise distances 加 classical MDS),在 DKPS 中回归 benchmark 分数,并按 m/M 与直接样本分数做 ensemble;可离线选取 R² 最好的 query set。

- 链接:[https://arxiv.org/abs/2605.07096](https://arxiv.org/abs/2605.07096)


## 731. [On Uniform Error Bounds for Kernel Regression under Non-Gaussian Noise](https://arxiv.org/abs/2605.09757)


- 会议:ICML2026

- 中文简介:对 RKHS 中 Hölder kernel 的 KRR/GPR,把预测误差分解为 bias 乘 posterior standard deviation 加噪声加权和;先对固定 x 做各噪声类 concentration,再用网格离散/covering 得到统一 x 的 bounds,覆盖 sub-Gaussian、bounded、sub-exponential、variance-only 及 correlated sub-Gaussian noise。

- 链接:[https://arxiv.org/abs/2605.09757](https://arxiv.org/abs/2605.09757)


## 732. [Generalized Boundary FDR Control under Arbitrary Dependence: An Approach on Closure Principle](https://arxiv.org/abs/2605.09953)


- 会议:ICML2026

- 中文简介:将 boundary FDR 泛化为 k-bFDR,按排序后的前 k 个边界发现定义风险;Domino 对每个候选 rejection set 检查包含边界 k 集的闭包交集,使用有效 k-local p/e test,取最大通过的 r。Generalized Bonferroni/Harmonic variants 将闭包实现降为可行复杂度。

- 链接:[https://arxiv.org/abs/2605.09953](https://arxiv.org/abs/2605.09953)


## 733. [FocalPolicy: Frequency-Optimized Chunking and Locally Anchored Flow Matching for Coherent Visuomotor Policy](https://arxiv.org/abs/2605.15944)


- 会议:ICML2026

- 中文简介:FocalPolicy 为一致性流视觉运动策略添加了两项训练更改:前瞻复合目标将近端时域一致性与未来动作块上的 DCT 频率损失相结合,并且局部锚定采样将流时间偏向终端区域,同时保留一步推理。

- 链接:[https://arxiv.org/abs/2605.15944](https://arxiv.org/abs/2605.15944)


## 734. [Differentiable Optimization Layers for Guaranteed Fairness in Deep Learning](https://arxiv.org/abs/2605.17118)


- 会议:ICML2026

- 中文简介:公平层通过可微的优化问题将模型输出投影到仿射公平约束上,隐式区分 KKT 解决方案以进行端到端训练,并在批量较小或流式传输时使用在线原始对偶更新。

- 链接:[https://arxiv.org/abs/2605.17118](https://arxiv.org/abs/2605.17118)


## 735. [Beyond Structural Symmetries: Linear Mode Connectivity via Neuron Identifiability](https://arxiv.org/abs/2606.04754)


- 会议:ICML2026

- 中文简介:用固定中心和逐神经元缩放的参数化W_eff=W_fixed+diag(s)⊙W,在输入子空间上破除ReLU神经元置换对称;以中心间隔/相干性定义可识别性,并证明该参数化影响神经元交换成本和线性模式连通弦偏离。

- 链接:[https://arxiv.org/abs/2606.04754](https://arxiv.org/abs/2606.04754)


## 736. [PromptDyG: Test-Time Prompt Adaptation on Dynamic Graphs](https://arxiv.org/abs/2606.22914)


- 会议:ICML2026

- 中文简介:PromptDyG 冻结动态图预测 backbone,在每个 snapshot 的节点特征加一个可学习图 prompt P_t;只用测试节点的 softmax Shannon entropy 做少量 Adam test-time adaptation,再进行 link prediction。该 wrapper 可插入多种 DTDG backbone。

- 链接:[https://arxiv.org/abs/2606.22914](https://arxiv.org/abs/2606.22914)


## 737. [Learning to Learn with Contrastive Meta-Objective](https://arxiv.org/abs/2410.05975)


- 会议:NeurIPS2025

- 中文简介:ConML 在任意 episodic meta-learner 的常规 task loss 外,采样每个任务的 K 个子集,用模型表示与 full-task 表示的距离作 intra-task alignment,再以 batch 内其它任务作 inter-task contrastive separation;对 MAML/ProtoNet/CNAP/ICL 只需定义输出表示 ψ。

- 链接:[https://arxiv.org/abs/2410.05975](https://arxiv.org/abs/2410.05975)


## 738. [Predicting the Performance of Black-box Language Models with Follow-up Queries](https://arxiv.org/abs/2501.01558)


- 会议:NeurIPS2025

- 中文简介:QueRE 通过询问一组关于原始提示和答案的固定后续是/否问题来监视黑盒语言模型。模型的“是”概率形成线性探针的特征向量,用于预测正确性、对抗性影响或模型身份;采样估计器处理没有令牌概率的 API。

- 链接:[https://arxiv.org/abs/2501.01558](https://arxiv.org/abs/2501.01558)


## 739. [A Regularized Newton Method for Nonconvex Optimization with Global and Local Complexity Guarantees](https://arxiv.org/abs/2502.04799)


- 会议:NeurIPS2025

- 中文简介:自适应正则化牛顿-CG (ARNCG) 从当前和之前的梯度比中选择三次/二次正则化(具有运行最小回退),通过共轭梯度求解上限牛顿步,同时监控负曲率,并使用线搜索来获得全局 epsilon 平稳性和二次局部收敛。

- 链接:[https://arxiv.org/abs/2502.04799](https://arxiv.org/abs/2502.04799)


## 740. [Sample-Conditional Coverage in Split-Conformal Prediction](https://arxiv.org/abs/2503.00220)


- 会议:NeurIPS2025

- 中文简介:在训练分数上拟合样本条件分位数函数,使用分割共形校准来获取具有估计条件水平的嵌套预测集,并添加随机绑定处理来获取有限样本加权/样本条件覆盖范围。

- 链接:[https://arxiv.org/abs/2503.00220](https://arxiv.org/abs/2503.00220)


## 741. [LinEAS: End-to-end Learning of Activation Steering with a Distributional Loss](https://arxiv.org/abs/2503.10679)


- 会议:NeurIPS2025

- 中文简介:LinEAS 在冻结生成模型的每个选定层学习坐标仿射干预,并使用不配对的源激活和目标激活之间的切片 Wasserstein 分布损失之和以及稀疏性/组正则化对其进行端到端训练。

- 链接:[https://arxiv.org/abs/2503.10679](https://arxiv.org/abs/2503.10679)


## 742. [Bézier Splatting for Fast and Differentiable Vector Graphics Rendering](https://arxiv.org/abs/2503.16424)


- 会议:NeurIPS2025

- 中文简介:Bézier Splatting 表示具有沿 Bézier 曲线和内部采样的可微高斯基元的矢量路径,使用 alpha splatting 渲染它们,并通过 L2/Xing 式光栅损失联合优化几何/颜色。自适应修剪和致密化使表示可用于快速光栅到矢量拟合和 SVG 导出。

- 链接:[https://arxiv.org/abs/2503.16424](https://arxiv.org/abs/2503.16424)


## 743. [ASGO: Adaptive Structured Gradient Optimization](https://arxiv.org/abs/2503.20762)


- 会议:NeurIPS2025

- 中文简介:ASGO 根据累积梯度乘积维护单边自适应矩阵预处理器,应用逆平方根更新(通过 Newton-Schulz/PolarExpress 迭代实现),并可选择添加动量。它包括矩阵形状和对角变体以及用于变压器训练的查询键头形式。

- 链接:[https://arxiv.org/abs/2503.20762](https://arxiv.org/abs/2503.20762)


## 744. [Follow-the-Perturbed-Leader Nearly Achieves Best-of-Both-Worlds for the m-Set Semi-Bandit Problems](https://arxiv.org/abs/2504.07307)


- 会议:NeurIPS2025

- 中文简介:该算法将跟随扰动领导者应用于具有 Frechet (alpha=2) 扰动的 m 集半老虎机,并使用几何重采样来估计逆动作概率。标准 FTRL 稳定性/惩罚分解产生接近两全其美目标的对抗性遗憾和对数随机遗憾。

- 链接:[https://arxiv.org/abs/2504.07307](https://arxiv.org/abs/2504.07307)


## 745. [Establishing Linear Surrogate Regret Bounds for Convex Smooth Losses via Convolutional Fenchel–Young Losses](https://arxiv.org/abs/2505.09432)


- 会议:NeurIPS2025

- 中文简介:卷积 Fenchel-Young 损失通过线性嵌入和强凸负熵的无限卷积来编码任意离散目标损失。由此产生的可微凸损失具有线性代理遗憾和 argmax 链接,从而能够在易于处理的香农熵特殊情况下实现损失感知分类和多标签预测。

- 链接:[https://arxiv.org/abs/2505.09432](https://arxiv.org/abs/2505.09432)


## 746. [Embedding Principle of Homogeneous Neural Network for Classification Problem](https://arxiv.org/abs/2505.12419)


- 会议:NeurIPS2025

- 中文简介:KKT 嵌入原理通过使用平方范数总和为 1 的非负系数分割每个神经元/通道,将正同质网络映射到更广泛的网络。该地图在规定的局部 Lipschitz/无偏差假设下保留了输出、次梯度、KKT 点、梯度流轨迹和 omega 极限集。

- 链接:[https://arxiv.org/abs/2505.12419](https://arxiv.org/abs/2505.12419)


## 747. [Differentially Private Quantiles with Smaller Error](https://arxiv.org/abs/2505.13662)


- 会议:NeurIPS2025

- 中文简介:SliceQuantiles 通过使用相关的连续计数噪声等级来创建连续的切片,然后在每个不相交的切片上使用指数机制,从而在纯差分隐私下回答多个分位数。微小的均匀输出混合物提供纯 DP 支持,而近似 DP 变体则放宽了最小分位数间隙假设。

- 链接:[https://arxiv.org/abs/2505.13662](https://arxiv.org/abs/2505.13662)


## 748. [Information Retrieval Induced Safety Degradation in AI Agents](https://arxiv.org/abs/2505.14215)


- 会议:NeurIPS2025

- 中文简介:使用受控检索干预:将对齐的模型/API 与 wiki、Web、多工具或向量 RAG 检索中包含的相同模型进行比较,然后对任务有效性和拒绝/偏见/伤害行为进行评分。研究发现,检索到的上下文通常可以改善答案,但会降低安全性。

- 链接:[https://arxiv.org/abs/2505.14215](https://arxiv.org/abs/2505.14215)


## 749. [SpectraLDS: Provable Distillation for Linear Dynamical Systems](https://arxiv.org/abs/2505.17868)


- 会议:NeurIPS2025

- 中文简介:SpectraLDS 将 STU 光谱滤波器转换为显式对称线性动力系统。它对衰减系数进行采样,使用 OMP 加上最小二乘法来保留一小组脉冲响应分量,并通过对角 LDS 状态更新来实现正/负滤波器;然后将 FlashSTU 模型提炼为最终的状态空间模型。

- 链接:[https://arxiv.org/abs/2505.17868](https://arxiv.org/abs/2505.17868)


## 750. [VeriThinker: Learning to Verify Makes Reasoning Model Efficient](https://arxiv.org/abs/2505.17941)


- 会议:NeurIPS2025

- 中文简介:监督验证微调 (SVFT) 仅根据问题和简短 CoT 解决方案的简短“是/否”正确性响应来训练语言模型,教授潜在验证并抑制冗余反射。可选的解决方案推测推理起草短 CoT,调用验证器,并仅将困难情况升级为长 CoT。

- 链接:[https://arxiv.org/abs/2505.17941](https://arxiv.org/abs/2505.17941)


## 751. [Anytime-valid, Bayes-assisted, Prediction-Powered Inference](https://arxiv.org/abs/2505.18000)


- 会议:NeurIPS2025

- 中文简介:该论文将预测驱动的推理 (PPI/PPI++) 转化为连续的置信序列。它将标记和未标记的估计视为控制变量,对时间均匀间隔使用强耦合加上 Ville/混合方法界限,通过 Minkowski 和组合样本大小和预测误差间隔,并可选择使用预测残差的先验来缩小它。

- 链接:[https://arxiv.org/abs/2505.18000](https://arxiv.org/abs/2505.18000)


## 752. [Copresheaf Topological Neural Networks: A Generalized Deep Learning Framework](https://arxiv.org/abs/2505.21251)


- 会议:NeurIPS2025

- 中文简介:Copresheaf 神经网络用局部向量空间之间的定向线性映射替换普通的邻居消息。通用的 copresheaf 消息传递/注意力更新通过其限制图传输每个邻居;学习的地图将图、网格、变压器和高阶变体恢复为特殊情况。

- 链接:[https://arxiv.org/abs/2505.21251](https://arxiv.org/abs/2505.21251)


## 753. [From Dormant to Deleted: Tamper-Resistant Unlearning Through Weight-Space Regularization](https://arxiv.org/abs/2505.22310)


- 会议:NeurIPS2025

- 中文简介:该论文通过权重空间距离/线性模式连接来诊断重新学习攻击,并提出在示例级取消学习期间权重空间分离:添加显式距离正则化,或注入权重失真,同时对保留集进行微调;还测试了连接屏障变体。

- 链接:[https://arxiv.org/abs/2505.22310](https://arxiv.org/abs/2505.22310)


## 754. [Representational Difference Explanations](https://arxiv.org/abs/2505.23917)


- 会议:NeurIPS2025

- 中文简介:通过归一化的成对距离差异来比较两个表示空间:将局部距离变化转换为有界差异分数,形成亲和力矩阵,对代表性邻域进行采样或光谱聚类,并将它们呈现为解释网格。

- 链接:[https://arxiv.org/abs/2505.23917](https://arxiv.org/abs/2505.23917)


## 755. [The Complexity of Correlated Equilibria in Generalized Games](https://arxiv.org/abs/2506.01899)


- 会议:NeurIPS2025

- 中文简介:描述具有耦合成本/安全约束的广义博弈相关均衡,将多矩阵纳什简化为 PPAD 硬度的约束相关均衡实例,并通过产品策略上的 Lipschitz 拟变分不等式对应证明隶属度。

- 链接:[https://arxiv.org/abs/2506.01899](https://arxiv.org/abs/2506.01899)


## 756. [A Tale of Two Symmetries: Exploring the Loss Landscape of Equivariant Models](https://arxiv.org/abs/2506.02269)


- 会议:NeurIPS2025

- 中文简介:描述全局神经元排列对称性如何变成受限等变对称性:隐藏的定点子空间在维度/正交性/Hessian 条件下创建临界点或虚假最小值,并且放松约束可以将不良子空间跨越到良好的排列解。

- 链接:[https://arxiv.org/abs/2506.02269](https://arxiv.org/abs/2506.02269)


## 757. [Multi-agent Markov Entanglement](https://arxiv.org/abs/2506.02385)


- 会议:NeurIPS2025

- 中文简介:将马尔可夫纠缠测量为多智能体转移矩阵与克罗内克乘积局部转移的线性组合集合的距离;使用此距离获得精确/可分离值分解、Q 误差界限和局部 Q/纠缠估计器。

- 链接:[https://arxiv.org/abs/2506.02385](https://arxiv.org/abs/2506.02385)


## 758. [Kinetics: Rethinking Test-Time Scaling Law](https://arxiv.org/abs/2506.05333)


- 会议:NeurIPS2025

- 中文简介:在测试时间扩展中考虑注意力/KV 内存成本,并使用块 top-k 稀疏注意力在固定资源预算下将计算转向更多推理试验/令牌。

- 链接:[https://arxiv.org/abs/2506.05333](https://arxiv.org/abs/2506.05333)


## 759. [Real-Time Execution of Action Chunking Flow Policies](https://arxiv.org/abs/2506.07339)


- 会议:NeurIPS2025

- 中文简介:通过冻结已提交的操作并在推理期间修复下一个块的其余部分,异步运行扩散/流操作分块策略。

- 链接:[https://arxiv.org/abs/2506.07339](https://arxiv.org/abs/2506.07339)


## 760. [Metritocracy: Representative Metrics for Lite Benchmarks](https://arxiv.org/abs/2506.09813)


- 会议:NeurIPS2025

- 中文简介:精英统治将代表性度量子集选择形式化为排名概况约束:位置表示和位置比例,对前者采用贪婪的集覆盖算法,对比例采用采样/IP 程序。

- 链接:[https://arxiv.org/abs/2506.09813](https://arxiv.org/abs/2506.09813)


## 761. [Unifying Re-Identification, Attribute Inference, and Data Reconstruction Risks in Differential Privacy](https://arxiv.org/abs/2507.06969)


- 会议:NeurIPS2025

- 中文简介:使用 f-DP/假设检验权衡曲线得出一种统一的边界形式,将 DP 保证转化为重新识别、属性推断和重建攻击成功风险,并可通过基线风险进行调整。

- 链接:[https://arxiv.org/abs/2507.06969](https://arxiv.org/abs/2507.06969)


## 762. [Better Training Data Attribution via Better Inverse Hessian-Vector Products](https://arxiv.org/abs/2507.14740)


- 会议:NeurIPS2025

- 中文简介:使用 EKFAC 作为随机 Neumann 逆 Hessian 迭代的预处理器,以改进训练数据归因的 iHVP 估计。

- 链接:[https://arxiv.org/abs/2507.14740](https://arxiv.org/abs/2507.14740)


## 763. [Explaining Similarity in Vision-Language Encoders with Weighted Banzhaf Interactions](https://arxiv.org/abs/2508.05430)


- 会议:NeurIPS2025

- 中文简介:估计图像和文本标记之间的二阶加权 Banzhaf 交互作用,以有效解释 VLE 相似度分数。

- 链接:[https://arxiv.org/abs/2508.05430](https://arxiv.org/abs/2508.05430)


## 764. [Contrastive Representations for Temporal Reasoning](https://arxiv.org/abs/2508.13113)


- 会议:NeurIPS2025

- 中文简介:改变对比采样,使正样本和负样本共享轨迹上下文,迫使表示编码时间进展而不是轨迹身份。

- 链接:[https://arxiv.org/abs/2508.13113](https://arxiv.org/abs/2508.13113)


## 765. [Test-Time Adaptation by Causal Trimming](https://arxiv.org/abs/2510.11133)


- 会议:NeurIPS2025

- 中文简介:在测试时,生成保留因果特征但改变非因果特征的增强;对它们的表示使用 PCA 来找到高方差的非因果方向;从表示和类原型中减去投影。

- 链接:[https://arxiv.org/abs/2510.11133](https://arxiv.org/abs/2510.11133)


## 766. [On the Optimal Construction of Unbiased Gradient Estimators for Zeroth-Order Optimization](https://arxiv.org/abs/2510.19953)


- 会议:NeurIPS2025

- 中文简介:通过将方向导数表示为伸缩级数并从优化分布中随机采样尺度,构建无偏零阶梯度估计器。

- 链接:[https://arxiv.org/abs/2510.19953](https://arxiv.org/abs/2510.19953)


## 767. [A Unified Approach to Submodular Maximization Under Noise](https://arxiv.org/abs/2510.21128)


- 会议:NeurIPS2025

- 中文简介:通过优化接近真实子模函数的随机代理函数,将稳健的精确子模最大化算法转换为持久噪声算法。

- 链接:[https://arxiv.org/abs/2510.21128](https://arxiv.org/abs/2510.21128)


## 768. [Informed Initialization for Bayesian Optimization and Active Learning](https://arxiv.org/abs/2510.23681)


- 会议:NeurIPS2025

- 中文简介:HIPE 是一种用于 BO/主动学习初始化的无超参数信息理论获取,可在预测不确定性降低与学习 GP 超参数之间取得平衡;并行 MC 实现可实现批量优化。

- 链接:[https://arxiv.org/abs/2510.23681](https://arxiv.org/abs/2510.23681)


## 769. [Bernstein–von Mises for Adaptively Collected Data](https://arxiv.org/abs/2511.06639)


- 会议:NeurIPS2025

- 中文简介:表明自适应收集的高斯/指数族数据下的后验在温和的特征值/稳定性条件下在总变异中收敛到代表性正态分布。

- 链接:[https://arxiv.org/abs/2511.06639](https://arxiv.org/abs/2511.06639)


## 770. [Robust Sampling for Active Statistical Inference](https://arxiv.org/abs/2511.08991)


- 会议:NeurIPS2025

- 中文简介:使用统一采样和主动采样之间的预算保留路径上的优化点来选择标签,以对冲预测驱动推理的错误指定的不确定性分数。

- 链接:[https://arxiv.org/abs/2511.08991](https://arxiv.org/abs/2511.08991)


## 771. [AvAtar: Learning to Align via Active Optimal Transport](https://arxiv.org/abs/2605.24395)


- 会议:ICML2026

- 中文简介:AvaAtar 通过熵正则化 OT 传播的梯度来估计每个候选标签如何影响全局对齐效用,从而为基于 OT 的对齐选择主动监督。

- 链接:[https://arxiv.org/abs/2605.24395](https://arxiv.org/abs/2605.24395)


## 772. [LEAP: Local ECT-Based Learnable Positional Encodings for Graphs](https://arxiv.org/abs/2510.00757)


- 会议:ICLR2026

- 中文简介:LEAP 通过将可微局部欧拉特征变换应用于归一化的 m 跳子图,添加了端到端可训练图位置编码,并具有可学习的投影方向。

- 链接:[https://arxiv.org/abs/2510.00757](https://arxiv.org/abs/2510.00757)


## 773. [NEO — No-Optimization Test-Time Adaptation through Latent Re-Centering](https://arxiv.org/abs/2510.05635)


- 会议:ICLR2026

- 中文简介:在测试时,计算分类器头之前的目标批次嵌入和最近的潜在特征的质心,调整预训练的分类器,无需梯度更新、源数据、标签或额外模块。

- 链接:[https://arxiv.org/abs/2510.05635](https://arxiv.org/abs/2510.05635)


## 774. [Prune-then-Quantize or Quantize-then-Prune? Understanding the Impact of Compression Order in Joint Model Compression](https://arxiv.org/abs/2603.18426)


- 会议:ICLR2026

- 中文简介:使用渐进强度假设:在组合压缩操作时,在更强的压缩之前应用较弱/较少扰动的压缩,通过单独的压缩当量比或性能差距进行估计。

- 链接:[https://arxiv.org/abs/2603.18426](https://arxiv.org/abs/2603.18426)


## 775. [You Need Better Attention Priors](https://arxiv.org/abs/2601.15380)


- 会议:ICML2026

- 中文简介:具有可训练先验的广义最优传输注意力(Goat)为注意力逻辑添加了一个显式的可学习先验日志,分解为傅里叶相对位置分量和仅键接收器/默认项,因此它仍然是单个 SDPA/FlashAttention 兼容的注意力调用。

- 链接:[https://arxiv.org/abs/2601.15380](https://arxiv.org/abs/2601.15380)


## 776. [Transport Clustering: Solving Low-Rank Optimal Transport via Clustering](https://arxiv.org/abs/2603.03578)


- 会议:ICML2026

- 中文简介:传输聚类通过首先用全秩传输计划注册对应关系来解决低秩 OT,然后将低秩联合聚类问题简化为这些对应关系上的广义 K 均值/聚类问题。

- 链接:[https://arxiv.org/abs/2603.03578](https://arxiv.org/abs/2603.03578)


## 777. [Manifold-Optimal Guidance: A Unified Riemannian Control View of Diffusion Guidance](https://arxiv.org/abs/2603.11509)


- 会议:ICML2026

- 中文简介:MOG 在各向异性数据流形度量下用黎曼自然梯度引导更新取代了欧几里德无分类器引导外推; Auto-MOG 通过随着时间的推移平衡引导和先验能量来设置校正强度。

- 链接:[https://arxiv.org/abs/2603.11509](https://arxiv.org/abs/2603.11509)


## 778. [Generalized Spherical Neural Operators: Green’s Function Formulation](https://arxiv.org/abs/2512.10723)


- 会议:ICLR2026

- 中文简介:通过具有相对/等变和绝对位置校正项的格林函数导出的调和算子对球形神经算子进行参数化,然后将其堆叠在分层球形网络中。

- 链接:[https://arxiv.org/abs/2512.10723](https://arxiv.org/abs/2512.10723)


## 779. [Constrained Adaptive Rejection Sampling](https://arxiv.org/abs/2510.01902)


- 会议:ICML2026

- 中文简介:维护一个发现的无效前缀的字典树,用于约束 LM 生成;原始 LM 分布中的样本由剩余的非无效概率质量重新加权,因此有效输出是精确的条件样本,并提高了接受度。

- 链接:[https://arxiv.org/abs/2510.01902](https://arxiv.org/abs/2510.01902)


## 780. [Streaming Sliced Optimal Transport](https://arxiv.org/abs/2505.06835)


- 会议:ICML2026

- 中文简介:将切片 Wasserstein 内的精确一维 Wasserstein 计算替换为从流构建的分位数草图,然后在随机投影方向上平均草图一维 Wasserstein 距离。

- 链接:[https://arxiv.org/abs/2505.06835](https://arxiv.org/abs/2505.06835)

欢迎来看我的博客喵

Ciallo~(∠・ω< )⌒☆
——因幡巡《魔女的夜宴》

About this archive

这里记录代码、设计,以及安静地把事情做好的方法。