留言
正在加载留言…

← Back to notes

从 13,107 篇最新 ICLR、ICML 与 NeurIPS,看到研究机会图谱

Sat Aug 15 2026
正文 收起
“不要听我,而要听 Logos;承认万物为一,才是智慧。”
——赫拉克利特残篇 B50


交互式图谱:打开研究机会图谱 V2

面向“方法是否简单、能否跨场景复用,以及不同论文能否自然耦合”的大规模论文分析实验。

把论文分组很容易,让分组对应可解释的研究关系要困难得多。仅凭 diffusion、confidence 等共现词,通常只能找到主题近邻。本项目选取最新一届已经举办完的三大机器学习会议——ICLR 2026、ICML 2026 和 NeurIPS 2025——构建无图片的正文 TeX 语料,逐篇阅读全文,并建立研究对象、方法机制、问题瓶颈和定向互补四张关系图。

工作围绕三个问题展开:

  1. 哪些论文的方法核心足够简单,个人研究者也有机会继续推进?
  2. 哪些方法已经超出单一 benchmark 技巧,并显示出跨任务、跨模型或跨规模的潜力?
  3. 哪两项原本分属不同方向的工作,可能形成一个接口清楚、成本可控的新课题?

项目规模

阶段 结果
三会与 arXiv 安全匹配记录 13,208 篇
通过正文与格式校验的有效 TeX 13,107 篇
作者单位信息完整且命中预设机构范围 7,878 篇
同时满足“本质简单”和“较强 generality”的核心集合 779 篇
核心集合中对个人租卡较友好的论文 513 篇
用于关系发现的背景论文 7,099 篇
研究机会候选 120 个

源文件归档的网络流量约为 88.5 GB,其中大部分空间来自图片。抽取后的原始文本约 4.25 GB;清洗并结构化后的常用正文约 1.3 GB,单独打包的 TeX 语料约 386 MiB。图片构成了主要下载成本,进入阅读流程的文字规模相对有限。

一、语料格式:以 TeX 为主

PDF 对机器阅读很不友好:双栏顺序可能错乱,公式和表格容易被拆碎,页眉、脚注和参考文献也会混进正文。Markdown 便于阅读,但在复杂公式、算法、表格和自定义宏上会损失信息。

实际保存为三种形式:

  • 规范化 TeX 是事实源,保留章节、公式、表格、算法和图注;
  • Parquet/JSONL 是机器处理层,每篇论文一行,并额外保存章节、元数据和可追溯标识;
  • Markdown 用于人工预览,规范化 TeX 保留为事实源。

清洗程序会自动寻找主文件,递归展开 \input 和 \include,保留数学与结构信息,删除图片本体、模板说明、注释和纯排版噪声。图片文件会删除,caption 会保留,因为图注经常包含实验设定和核心结论。校验环节检查未展开的输入、残留图片命令、压缩导出一致性和二进制文件签名;少量伪装成 TeX 的非文本载荷被直接排除。

这份语料有两个边界:arXiv source 可能与会议 camera-ready 存在差异;缺少 arXiv 源码或作者单位的论文没有纳入后续分析。

二、单位初筛之后,逐篇阅读正文

单位筛选以高召回为目标。程序从 TeX 首页提取明确作者单位,并与一份可审计的研究机构名单匹配,包括主要工业研究实验室和具有强机器学习研究生态的高校。单位字段没有进入后续相似度或聚类。这一步仅用于限定分析范围,不评价名单外论文的研究质量。

早期版本曾搜索 simple、training-free、model-agnostic、across tasks 等词。抽查很快暴露了问题:

  • 简单方法未必自称 simple;
  • 复杂系统也很喜欢在摘要里写 simple;
  • “在十个同类数据集上有效”仍可能局限于单一任务族;
  • model-agnostic 往往隐藏着专有数据、额外模型或逐任务调参。

这 7,878 篇候选均经过正文语义阅读。每篇至少覆盖摘要、引言、方法或理论、主要实验、消融、结论、限制,以及与判断有关的附录;参考文献列表不要求逐条阅读。阅读由并行 AI agent 完成,所有 agent 使用同一套冻结评分规范,结论必须附有正文证据。

“本质简单”如何评分

维度 核心问题
S1 原子性 核心是否能表达成一个规则、公式或局部改动?
S2 依赖负担 是否需要新模型、新数据或多阶段辅助管线?
S3 调参负担 同一规则能否直接迁移,还是每个任务都要重新搜索?
S4 资源负担 是免训练、轻量微调,还是预训练级算力?

严格的简单门槛是 S1 ≥ 3、S2 ≥ 2、S3 ≥ 2。S4 单独报告,避免把“思路简单但训练极贵”和“个人可复现”混为一谈。

“General”如何评分

先把适用范围分成 U0 到 U4:从单一 benchmark 技巧,到任务族、模型家族,再到通用机器学习机制。然后评价四件事:接口是否可迁移、实证是否覆盖独立任务或模型族、同一规则是否稳定迁移、成立是否依赖狭窄假设。

核心集合至少要求 U3、接口可迁移、存在跨设置证据,并且不过度依赖特殊权限或专有结构。本文所说的 general 有明确范围:方法具有清楚、可复用的接口,实验证据也已超出单点技巧。

评分结果为:779 篇强通过、1,055 篇次强通过、615 篇边界项、5,372 篇未通过、57 篇信息不足。强通过论文中,225 篇几乎免训练或没有额外开销,288 篇属于轻量微调或小推理开销,合计 513 篇较适合个人租卡继续研究。

三、第一次聚类为什么失败

第一版把全文阅读卡片交给 TF-IDF、字符 n-gram 和 LSA,再进行层次聚类。运行速度很快,社区结构看起来也很稳定。人工抽查发现,不少关系只来自共享名词。

这组结果的 LSA 解释方差约为 14%–16%,silhouette 约为 0.03。某些分区重复运行的 ARI 达到 0.557,抽查中的机制错配依然明显。稳定性在这里反映了算法的一致性,没有解决语义偏差。

主要问题出在表示方式。模型尺寸会影响检索质量。把研究对象、方法步骤、瓶颈和结论平均成一个向量,本身就容易得到模糊主题。第二版改用分面的多向量表示,并允许论文保持未归类状态。

四、第二版:把论文拆成四种关系

flowchart LR
    A[正文 TeX] --> B[全文语义阅读]
    B --> C[结构化机制卡]
    C --> D1[研究对象图]
    C --> D2[方法机制图]
    C --> D3[问题瓶颈图]
    D2 --> D4[方法效果 → 另一论文瓶颈]
    D3 --> D4
    D1 --> E[稳定性与反例审计]
    D2 --> E
    D3 --> E
    D4 --> F[最小实验候选]
    E --> F

每张结构化机制卡都包含:论文要解决的具体问题、输入输出、瓶颈、干预阶段、按顺序排列的原子操作、直接改变的量、接口、成立假设、直接效果和实验发现。

在此基础上分别建立四张图:

  1. 研究对象图:描述论文处理的具体问题,并把通用模型名的影响分离出去;
  2. 方法机制图:方法在系统哪个位置,依次做了哪些操作;
  3. 问题瓶颈图:它们是否面对相同的失败模式或资源约束;
  4. 定向互补图:论文 A 的直接效果,能否对应论文 B 明确写出的瓶颈。

一篇论文可以在四张图里有四种邻居。比如它在对象上属于视觉生成,在机制上属于方差缩减,在瓶颈上又可能与强化学习的估计不稳定相邻。这样的表示更适合用来设计后续实验。

比较范围与背景桥接

779 篇目标论文共有 303,031 个无序论文对,先进行全对全的低成本结构与向量评分,不用过小的 top-k 提前截断关系。7,099 篇背景论文用于近邻、密度和“桥梁”判断。两篇目标论文即使表面差异很大,只要经常连接到相似的背景工作,仍可能存在共同机制。

方法机制用一组步骤向量表示。候选边同时考虑步骤语义、覆盖率、干预位置、操作类型和接口;仅共享 Transformer、softmax、diffusion 等底层载体无法形成“同机制”边。高成本的 cross-encoder 只重排多路召回后的少量候选。

图构造使用 reciprocal kNN,要求双方互为近邻,以降低热门方向成为万能 hub 的风险;社区发现使用 Leiden,并以 HDBSCAN、bootstrap Jaccard 和结构一致性独立检查。低稳定度社区可以被标为探索项或直接拒绝,不强迫每篇论文归类。二维坐标只用于显示,不参与聚类。

五、用 CSFCube 选择表示模型

为了给模型选择提供外部尺度,我先在 CSFCube 上做模型赛马。这个基准由专家分别标注论文在 background、method 和 result 三个 facet 上的相关性,可以分别测量主题检索和方法检索能力。

下面只列最关键的 method facet:

表示方法 MAP NDCG%20 Recall@20
TF-IDF 0.179 0.336 0.283
LSA 0.186 0.336 0.273
SPECTER2 0.264 0.428 0.478
ASPIRE 多向量 0.281 0.439 0.529
Qwen3 facet embedding 0.282 0.491 0.509
Qwen3 reranker 0.330 0.498 0.559

相对于旧 LSA,Qwen3 reranker 的 method MAP 提升约 77.6%,NDCG%20 提升约 48.1%,Recall@20 提升约 104.3%。CSFCube 测量的是检索能力,这组结果为表示模型的选型提供了外部依据;自定义关系图仍需要单独审计。

实际运行时,SPECTER2 辅助研究对象关系,Qwen3 多语种 embedding 编码结构化 facet 和方法步骤,Qwen3 reranker 精排较难的机制候选。模型没有看到会议标签或作者单位。

六、耗时与本地加速

整个项目最耗时的环节是逐篇全文阅读。7,878 篇论文以最高 64 并发运行,约 19 小时完成,平均约 419 篇/小时。这个阶段需要语义判断,确实使用了生成式 AI。

后续关系分析由固定程序完成,没有逐篇或逐对调用生成式模型。结构解析、embedding、cross-encoder、建图、稳定性检验和报告生成均可重复执行。在一台 24 GB Apple Silicon 笔记本上,完整冷运行约 18–20 分钟;命中缓存后,重建图和报告约半分钟。

为了加速本地推理,我比较了原始 BF16 模型和 8-bit MLX 版本:

任务 BF16 8-bit MLX 加速 语义一致性
128 条 embedding 20.2 篇/秒 86.2 篇/秒 4.28× pairwise Spearman 0.9997,kNN@10 重合 98.4%
64 对 rerank 6.0 对/秒 26.9 对/秒 4.45× Spearman 0.9992,阈值判定一致率 100%

我还测试了一个 4-bit embedding 候选。它的邻居保持率明显下降,因而未被采用。量化选型同时参考速度和语义邻居的一致性。

七、关系图实际找到了什么

更正后的全量图在对象、机制和瓶颈三层分别保留 2,920、1,950 和 2,007 条局部图边;合并证据后得到 3,433 条论文关系、3,444 条定向互补边,并输出 120 个研究机会候选。经过 bootstrap 稳定性和结构一致性门槛后,只有 4 个对象社区、2 个机制社区和 1 个瓶颈社区被正式接受,其余均降为探索项或拒绝项。

大多数自动社区未通过正式门槛,因而被降级或拒绝。Leiden 与 HDBSCAN 的全局分区一致性很低,这种分歧不支持一棵统一的主题树。分析结论以局部稳定关系为单位,二维整图主要用于导航。

研究机会分成两类,各 60 个:

  • 跨对象机制迁移:研究对象不同,但操作步骤和接口高度相似;
  • 方法效果 → 目标瓶颈:一项工作的直接效果,恰好对应另一项工作的明确限制。

这两类候选仍需继续检查接口兼容性、因果假设和全网新颖性,并通过同预算、单因素的最小实验验证。图谱把一万多篇论文压缩成一个可以逐项审查的候选空间,后续取舍仍由研究者完成。

八、质量检查

除了 CSFCube 外部基准,还做了几组针对本项目的压力测试:

  • 中文结构化机制卡检索同篇英文方法段,Recall@1 为 0.768,Recall@20 为 0.931,中位名次为 1;
  • 十组已知正反例全部通过,包括“都写 diffusion 但干预位置不同”的 hard negative;
  • 随机打乱机制字段后,原有机制边的平均稠密相似度从 0.585 降到 0.388;
  • 标题不进入机制向量,会议和单位不进入任何相似度;
  • 社区必须通过 bootstrap Jaccard 和结构覆盖门槛,否则显示为灰色或探索项。

综合判定为 conditional exploratory pass,对应探索性用途。主要缺口是原设计中的 160 对独立人工冻结标注集尚未完成,因此本文不报告自定义机制关系的 macro-F1。现有证据由外部 benchmark、回归测试和稳定性审计组成,独立人工审稿仍然缺位。

九、方法上的取舍

  • 先定义关系类型。同对象、同机制、共享瓶颈和方法互补需要各自的特征与阈值。
  • 分开语义阅读和规模计算。AI 将正文压缩成带证据的结构卡,固定程序负责几十万论文对的比较,成本和复现路径都更清楚。
  • 稳定性需要语义基础。若 facet 设计有偏,聚类算法也会稳定地重复字面偏差。反例测试和结构证据应与稳定性一起检查。
  • 覆盖率不作为优化目标。论文可以保持未归类状态,低质量社区也可以直接拒绝。局部图因此更适合研究决策。
  • 机会边重点检查接口。低对象相似、接口清晰的组合往往更有启发性:A 领域中得到改善的作用量,可能对应 B 领域明确记录的瓶颈。

十、数据与解释边界

  • 语料只覆盖可可靠匹配到 arXiv source 的论文,范围小于三会全部录用论文;
  • arXiv 版本可能与 camera-ready 有差异;
  • 机构初筛是本项目的研究边界,会引入明显选择偏差;
  • AI 全文阅读采用统一规范并保留正文证据,理解或抽取错误仍有可能发生;
  • 研究机会只表示当前语料中的结构缺口,后续仍需全网 novelty search;
  • 每篇论文的版权和 arXiv 许可不同,再分发前需要逐篇核对授权。

参考资源


项目留下了一份可以反复更新的研究筛选协议:正文先转成可审计的结构卡,关系由固定程序计算,聚类只保留稳定局部,研究机会再落到最小实验。从一万多篇论文到几十个可实验假设,整条路径都保留了可追溯的中间证据。

FIELD NOTES ↗