从 13,107 篇最新 ICLR、ICML 与 NeurIPS,看到研究机会图谱
正文 收起
“不要听我,而要听 Logos;承认万物为一,才是智慧。”
——赫拉克利特残篇 B50
交互式图谱:打开研究机会图谱 V2
面向“方法是否简单、能否跨场景复用,以及不同论文能否自然耦合”的大规模论文分析实验。
把论文分组很容易,让分组对应可解释的研究关系要困难得多。仅凭 diffusion、confidence 等共现词,通常只能找到主题近邻。本项目选取最新一届已经举办完的三大机器学习会议——ICLR 2026、ICML 2026 和 NeurIPS 2025——构建无图片的正文 TeX 语料,逐篇阅读全文,并建立研究对象、方法机制、问题瓶颈和定向互补四张关系图。
工作围绕三个问题展开:
- 哪些论文的方法核心足够简单,个人研究者也有机会继续推进?
- 哪些方法已经超出单一 benchmark 技巧,并显示出跨任务、跨模型或跨规模的潜力?
- 哪两项原本分属不同方向的工作,可能形成一个接口清楚、成本可控的新课题?
项目规模
| 阶段 | 结果 |
|---|---|
| 三会与 arXiv 安全匹配记录 | 13,208 篇 |
| 通过正文与格式校验的有效 TeX | 13,107 篇 |
| 作者单位信息完整且命中预设机构范围 | 7,878 篇 |
| 同时满足“本质简单”和“较强 generality”的核心集合 | 779 篇 |
| 核心集合中对个人租卡较友好的论文 | 513 篇 |
| 用于关系发现的背景论文 | 7,099 篇 |
| 研究机会候选 | 120 个 |
源文件归档的网络流量约为 88.5 GB,其中大部分空间来自图片。抽取后的原始文本约 4.25 GB;清洗并结构化后的常用正文约 1.3 GB,单独打包的 TeX 语料约 386 MiB。图片构成了主要下载成本,进入阅读流程的文字规模相对有限。
一、语料格式:以 TeX 为主
PDF 对机器阅读很不友好:双栏顺序可能错乱,公式和表格容易被拆碎,页眉、脚注和参考文献也会混进正文。Markdown 便于阅读,但在复杂公式、算法、表格和自定义宏上会损失信息。
实际保存为三种形式:
- 规范化 TeX 是事实源,保留章节、公式、表格、算法和图注;
- Parquet/JSONL 是机器处理层,每篇论文一行,并额外保存章节、元数据和可追溯标识;
- Markdown 用于人工预览,规范化 TeX 保留为事实源。
清洗程序会自动寻找主文件,递归展开 \input 和 \include,保留数学与结构信息,删除图片本体、模板说明、注释和纯排版噪声。图片文件会删除,caption 会保留,因为图注经常包含实验设定和核心结论。校验环节检查未展开的输入、残留图片命令、压缩导出一致性和二进制文件签名;少量伪装成 TeX 的非文本载荷被直接排除。
这份语料有两个边界:arXiv source 可能与会议 camera-ready 存在差异;缺少 arXiv 源码或作者单位的论文没有纳入后续分析。
二、单位初筛之后,逐篇阅读正文
单位筛选以高召回为目标。程序从 TeX 首页提取明确作者单位,并与一份可审计的研究机构名单匹配,包括主要工业研究实验室和具有强机器学习研究生态的高校。单位字段没有进入后续相似度或聚类。这一步仅用于限定分析范围,不评价名单外论文的研究质量。
早期版本曾搜索 simple、training-free、model-agnostic、across tasks 等词。抽查很快暴露了问题:
- 简单方法未必自称 simple;
- 复杂系统也很喜欢在摘要里写 simple;
- “在十个同类数据集上有效”仍可能局限于单一任务族;
- model-agnostic 往往隐藏着专有数据、额外模型或逐任务调参。
这 7,878 篇候选均经过正文语义阅读。每篇至少覆盖摘要、引言、方法或理论、主要实验、消融、结论、限制,以及与判断有关的附录;参考文献列表不要求逐条阅读。阅读由并行 AI agent 完成,所有 agent 使用同一套冻结评分规范,结论必须附有正文证据。
“本质简单”如何评分
| 维度 | 核心问题 |
|---|---|
| S1 原子性 | 核心是否能表达成一个规则、公式或局部改动? |
| S2 依赖负担 | 是否需要新模型、新数据或多阶段辅助管线? |
| S3 调参负担 | 同一规则能否直接迁移,还是每个任务都要重新搜索? |
| S4 资源负担 | 是免训练、轻量微调,还是预训练级算力? |
严格的简单门槛是 S1 ≥ 3、S2 ≥ 2、S3 ≥ 2。S4 单独报告,避免把“思路简单但训练极贵”和“个人可复现”混为一谈。
“General”如何评分
先把适用范围分成 U0 到 U4:从单一 benchmark 技巧,到任务族、模型家族,再到通用机器学习机制。然后评价四件事:接口是否可迁移、实证是否覆盖独立任务或模型族、同一规则是否稳定迁移、成立是否依赖狭窄假设。
核心集合至少要求 U3、接口可迁移、存在跨设置证据,并且不过度依赖特殊权限或专有结构。本文所说的 general 有明确范围:方法具有清楚、可复用的接口,实验证据也已超出单点技巧。
评分结果为:779 篇强通过、1,055 篇次强通过、615 篇边界项、5,372 篇未通过、57 篇信息不足。强通过论文中,225 篇几乎免训练或没有额外开销,288 篇属于轻量微调或小推理开销,合计 513 篇较适合个人租卡继续研究。
三、第一次聚类为什么失败
第一版把全文阅读卡片交给 TF-IDF、字符 n-gram 和 LSA,再进行层次聚类。运行速度很快,社区结构看起来也很稳定。人工抽查发现,不少关系只来自共享名词。
这组结果的 LSA 解释方差约为 14%–16%,silhouette 约为 0.03。某些分区重复运行的 ARI 达到 0.557,抽查中的机制错配依然明显。稳定性在这里反映了算法的一致性,没有解决语义偏差。
主要问题出在表示方式。模型尺寸会影响检索质量。把研究对象、方法步骤、瓶颈和结论平均成一个向量,本身就容易得到模糊主题。第二版改用分面的多向量表示,并允许论文保持未归类状态。
四、第二版:把论文拆成四种关系
flowchart LR
A[正文 TeX] --> B[全文语义阅读]
B --> C[结构化机制卡]
C --> D1[研究对象图]
C --> D2[方法机制图]
C --> D3[问题瓶颈图]
D2 --> D4[方法效果 → 另一论文瓶颈]
D3 --> D4
D1 --> E[稳定性与反例审计]
D2 --> E
D3 --> E
D4 --> F[最小实验候选]
E --> F
每张结构化机制卡都包含:论文要解决的具体问题、输入输出、瓶颈、干预阶段、按顺序排列的原子操作、直接改变的量、接口、成立假设、直接效果和实验发现。
在此基础上分别建立四张图:
- 研究对象图:描述论文处理的具体问题,并把通用模型名的影响分离出去;
- 方法机制图:方法在系统哪个位置,依次做了哪些操作;
- 问题瓶颈图:它们是否面对相同的失败模式或资源约束;
- 定向互补图:论文 A 的直接效果,能否对应论文 B 明确写出的瓶颈。
一篇论文可以在四张图里有四种邻居。比如它在对象上属于视觉生成,在机制上属于方差缩减,在瓶颈上又可能与强化学习的估计不稳定相邻。这样的表示更适合用来设计后续实验。
比较范围与背景桥接
779 篇目标论文共有 303,031 个无序论文对,先进行全对全的低成本结构与向量评分,不用过小的 top-k 提前截断关系。7,099 篇背景论文用于近邻、密度和“桥梁”判断。两篇目标论文即使表面差异很大,只要经常连接到相似的背景工作,仍可能存在共同机制。
方法机制用一组步骤向量表示。候选边同时考虑步骤语义、覆盖率、干预位置、操作类型和接口;仅共享 Transformer、softmax、diffusion 等底层载体无法形成“同机制”边。高成本的 cross-encoder 只重排多路召回后的少量候选。
图构造使用 reciprocal kNN,要求双方互为近邻,以降低热门方向成为万能 hub 的风险;社区发现使用 Leiden,并以 HDBSCAN、bootstrap Jaccard 和结构一致性独立检查。低稳定度社区可以被标为探索项或直接拒绝,不强迫每篇论文归类。二维坐标只用于显示,不参与聚类。
五、用 CSFCube 选择表示模型
为了给模型选择提供外部尺度,我先在 CSFCube 上做模型赛马。这个基准由专家分别标注论文在 background、method 和 result 三个 facet 上的相关性,可以分别测量主题检索和方法检索能力。
下面只列最关键的 method facet:
| 表示方法 | MAP | NDCG%20 | Recall@20 |
|---|---|---|---|
| TF-IDF | 0.179 | 0.336 | 0.283 |
| LSA | 0.186 | 0.336 | 0.273 |
| SPECTER2 | 0.264 | 0.428 | 0.478 |
| ASPIRE 多向量 | 0.281 | 0.439 | 0.529 |
| Qwen3 facet embedding | 0.282 | 0.491 | 0.509 |
| Qwen3 reranker | 0.330 | 0.498 | 0.559 |
相对于旧 LSA,Qwen3 reranker 的 method MAP 提升约 77.6%,NDCG%20 提升约 48.1%,Recall@20 提升约 104.3%。CSFCube 测量的是检索能力,这组结果为表示模型的选型提供了外部依据;自定义关系图仍需要单独审计。
实际运行时,SPECTER2 辅助研究对象关系,Qwen3 多语种 embedding 编码结构化 facet 和方法步骤,Qwen3 reranker 精排较难的机制候选。模型没有看到会议标签或作者单位。
六、耗时与本地加速
整个项目最耗时的环节是逐篇全文阅读。7,878 篇论文以最高 64 并发运行,约 19 小时完成,平均约 419 篇/小时。这个阶段需要语义判断,确实使用了生成式 AI。
后续关系分析由固定程序完成,没有逐篇或逐对调用生成式模型。结构解析、embedding、cross-encoder、建图、稳定性检验和报告生成均可重复执行。在一台 24 GB Apple Silicon 笔记本上,完整冷运行约 18–20 分钟;命中缓存后,重建图和报告约半分钟。
为了加速本地推理,我比较了原始 BF16 模型和 8-bit MLX 版本:
| 任务 | BF16 | 8-bit MLX | 加速 | 语义一致性 |
|---|---|---|---|---|
| 128 条 embedding | 20.2 篇/秒 | 86.2 篇/秒 | 4.28× | pairwise Spearman 0.9997,kNN@10 重合 98.4% |
| 64 对 rerank | 6.0 对/秒 | 26.9 对/秒 | 4.45× | Spearman 0.9992,阈值判定一致率 100% |
我还测试了一个 4-bit embedding 候选。它的邻居保持率明显下降,因而未被采用。量化选型同时参考速度和语义邻居的一致性。
七、关系图实际找到了什么
更正后的全量图在对象、机制和瓶颈三层分别保留 2,920、1,950 和 2,007 条局部图边;合并证据后得到 3,433 条论文关系、3,444 条定向互补边,并输出 120 个研究机会候选。经过 bootstrap 稳定性和结构一致性门槛后,只有 4 个对象社区、2 个机制社区和 1 个瓶颈社区被正式接受,其余均降为探索项或拒绝项。
大多数自动社区未通过正式门槛,因而被降级或拒绝。Leiden 与 HDBSCAN 的全局分区一致性很低,这种分歧不支持一棵统一的主题树。分析结论以局部稳定关系为单位,二维整图主要用于导航。
研究机会分成两类,各 60 个:
- 跨对象机制迁移:研究对象不同,但操作步骤和接口高度相似;
- 方法效果 → 目标瓶颈:一项工作的直接效果,恰好对应另一项工作的明确限制。
这两类候选仍需继续检查接口兼容性、因果假设和全网新颖性,并通过同预算、单因素的最小实验验证。图谱把一万多篇论文压缩成一个可以逐项审查的候选空间,后续取舍仍由研究者完成。
八、质量检查
除了 CSFCube 外部基准,还做了几组针对本项目的压力测试:
- 中文结构化机制卡检索同篇英文方法段,Recall@1 为 0.768,Recall@20 为 0.931,中位名次为 1;
- 十组已知正反例全部通过,包括“都写 diffusion 但干预位置不同”的 hard negative;
- 随机打乱机制字段后,原有机制边的平均稠密相似度从 0.585 降到 0.388;
- 标题不进入机制向量,会议和单位不进入任何相似度;
- 社区必须通过 bootstrap Jaccard 和结构覆盖门槛,否则显示为灰色或探索项。
综合判定为 conditional exploratory pass,对应探索性用途。主要缺口是原设计中的 160 对独立人工冻结标注集尚未完成,因此本文不报告自定义机制关系的 macro-F1。现有证据由外部 benchmark、回归测试和稳定性审计组成,独立人工审稿仍然缺位。
九、方法上的取舍
- 先定义关系类型。同对象、同机制、共享瓶颈和方法互补需要各自的特征与阈值。
- 分开语义阅读和规模计算。AI 将正文压缩成带证据的结构卡,固定程序负责几十万论文对的比较,成本和复现路径都更清楚。
- 稳定性需要语义基础。若 facet 设计有偏,聚类算法也会稳定地重复字面偏差。反例测试和结构证据应与稳定性一起检查。
- 覆盖率不作为优化目标。论文可以保持未归类状态,低质量社区也可以直接拒绝。局部图因此更适合研究决策。
- 机会边重点检查接口。低对象相似、接口清晰的组合往往更有启发性:A 领域中得到改善的作用量,可能对应 B 领域明确记录的瓶颈。
十、数据与解释边界
- 语料只覆盖可可靠匹配到 arXiv source 的论文,范围小于三会全部录用论文;
- arXiv 版本可能与 camera-ready 有差异;
- 机构初筛是本项目的研究边界,会引入明显选择偏差;
- AI 全文阅读采用统一规范并保留正文证据,理解或抽取错误仍有可能发生;
- 研究机会只表示当前语料中的结构缺口,后续仍需全网 novelty search;
- 每篇论文的版权和 arXiv 许可不同,再分发前需要逐篇核对授权。
参考资源
- 三会元数据:ICLR 2026、ICML 2026、NeurIPS 2025
- arXiv 自定义批量获取说明:arXiv Bulk Data Access
- 文本型 LaTeX 补充来源:ScholarWeave arXiv-LaTeX
- 外部专家基准:CSFCube
- 科学论文表示:SPECTER2、ASPIRE
- 多语种语义模型:Qwen3 Embedding、Qwen3 Reranker
项目留下了一份可以反复更新的研究筛选协议:正文先转成可审计的结构卡,关系由固定程序计算,聚类只保留稳定局部,研究机会再落到最小实验。从一万多篇论文到几十个可实验假设,整条路径都保留了可追溯的中间证据。
留言