← Back to notes

三顶会全文前瞻研判任务书

Mon Aug 17 2026
正文 收起


# 三顶会全文前瞻研判任务书


## 0. 首席科学家指令


你需要逐篇完整阅读最新一届 ICLR、ICML 和 NeurIPS 的 13,107 篇 TeX 正文,完成两条彼此独立的前瞻研判:


1. 找出可能成为下一代通用技术原语、基础架构或能力跃迁接口的论文;

2. 找出未来 3–5 年更值得押注的结构性技术风向。


这不是热门论文重排。你需要独立判断:


- 哪些论文可能改变后续研究组织模型、数据、计算或反馈的方式?

- 哪些方向即使当前代表方法失败,背后的需求和价值仍会持续增强?

- 哪些信号尚未形成大众共识,却可能在 2029–2031 年成为重要主航道?

- 哪些论文只是重命名、重参数化、工程堆叠、弱基线或额外资源带来的表面进步?


必须读完正文后再判断。标题、摘要、关键词、作者单位、论文自称的贡献、当前热度和引用量都不能替代正文阅读。


真正达到 Transformer/LLM 作用层级的论文可能一篇也没有。可以诚实返回零篇,不得为了交付而制造“划时代候选”。


---


## 1. 输入与时间边界


### 1.1 语料


- 文件:`AI三顶会最新一届_TeX正文_13107篇_修正版.zip`

- 有效论文:13,107 篇

- ICLR 2026:4,324 篇

- ICML 2026:4,545 篇

- NeurIPS 2025:4,238 篇


不得使用旧的 13,114 篇版本。


### 1.2 预测时点


判断时点为 **2026-08-17**,预测窗口为 **2029–2031**。


全文初评先依据论文本身完成。候选深挖阶段才查询前序工作、同期论文、代码、采用情况和外部信号,防止名气与事后信息污染独立判断。


### 1.3 输出目录


```text

./foresight_2029_2031/

```


---


## 2. 目标 A:潜在基础技术点


“潜在基础技术点”是能够被许多后续工作调用的技术原语、训练原则、推理接口、系统抽象、数据机制、理论结构或评测反馈回路。它可能改变研究者组织计算、数据、模型或反馈的方式,而非只提升一个数据集。


一个真正具有基础性潜力的工作通常满足多项:


- **不可约**:去掉包装后,仍存在新的核心操作、接口、不变量或组织方式;

- **瓶颈中心**:处理能力、规模、成本、可靠性或数据中的关键约束;

- **结构通用**:成立原因不依赖原论文的特定任务名称;

- **随规模增值**:模型、数据或推理规模增大后,价值不自然消失;

- **能力解锁**:允许此前难以稳定实现的能力、规模或系统形态;

- **可组合**:能被其他模型、任务或系统以清晰接口调用;

- **形成生态**:可能产生新的设计空间、测量方式和后续研究问题;

- **经济上有坡度**:能够改变训练成本、推理成本、延迟、可靠性或数据获取方式。


基础性不等于方法必须简单。简单性有利于传播和组合;复杂方法若建立新的系统边界,也可能有基础价值,但复杂度必须由不可替代的能力收益偿付。


### 2.1 五级作用层级


| 等级 | 定义 |

|---|---|

| F0 | 局部技巧、复现、分析或特定数据集改进 |

| F1 | 对一个稳定子领域有用,但接口与适用面有限 |

| F2 | 跨多个任务或模型可复用的通用组件或原则 |

| F3 | 可能成为标准技术栈的一部分,改变大量后续设计选择 |

| F4 | 可能改变能力或规模前沿,形成新的基础架构或范式 |


F4 是极低基率事件。高分、热门、顶级作者、oral 或最佳论文身份都不能自动得到 F3/F4。


---


## 3. 目标 B:未来 3–5 年结构性风向


“风向”不是热门名词、论文数量增长或某个当前强方法。风向是一条持续增强的结构压力:外部驱动使某个瓶颈随规模和应用扩大而加重,价值与资源因此从旧边界迁往新边界,多种方法可能竞争解决它。


每个风向必须写成下面的因果链:


```text

结构性驱动

→ 随规模或应用扩大而加重的瓶颈

→ 能力、成本或价值的迁移

→ 至少两种可能的解决路线

→ 未来 1–5 年可观察的变化

```


每个风向必须通过“方法替换测试”:移除当前最强代表方法后,问题压力、价值池和其他路线是否仍然存在?若方向随某个方法一起消失,它更像技术点,不是风向。


“Agent 很热”“多模态论文很多”“推理是趋势”都不构成风向,除非补全驱动、瓶颈、价值迁移、竞争路线和反证条件。


早期风向证据可以稀疏,但必须回答:


- 为什么现在开始出现?

- 为什么未来 3–5 年会变得更重要?

- 哪些互不相同的方法可能解决它?

- 当前最大阻塞条件是什么?

- 什么事实会证明这个判断错了?


---


## 4. 认识论纪律


## 4.1 Introduction 只提供待验证主张


阅读 Introduction 时记录作者主张,但不立即接受。每项重要主张都要在方法、定理、实验、消融、附录或负面结果中寻找支持或反证。


每篇论文严格区分:


- `observed`:正文直接展示或证明的事实;

- `inferred`:基于机制和证据作出的合理外推;

- `forecast`:关于 2029–2031 的预测。


论文作者自己的未来推测仍属于推测。


## 4.2 初评屏蔽社会声量


全文初评时不使用:


- 作者和机构声誉;

- oral、spotlight、奖项和引用量;

- 社交媒体热度、公司宣传和其他榜单;

- 当前产品采用情况。


这些信息只能在候选深挖阶段用于判断执行能力、采用路径和当前共识,不能替代技术证据。


## 4.3 不奖励“看起来新”


罕见术语、跨领域类比和复杂公式不自动加分。新颖性必须落实到操作、接口、不变量、可识别对象或新能力。


特别检查:


- 是否只是已有方法的换坐标、重参数化或别名;

- 是否把已知组件机械串联后重新命名;

- 是否只是使用更多数据、更多采样、更大模型或更强监督;

- 是否借弱基线、预算不对称或调参不公平制造结果;

- 是否只有描述性相关性,缺少可干预机制;

- 是否核心假设在真实部署中很难满足。


## 4.4 允许高上限、弱证据候选存在


必须区分:


- `observed_generality`:正文实际验证的任务、模型、模态和规模;

- `structural_generality`:根据机制判断的潜在适用范围;

- `evidence_gap`:二者之间尚未验证的部分。


高结构潜力、低实证覆盖的论文可进入“高上限待证”名单,但置信度必须低于证据充分候选。


## 4.5 允许返回空集


不设入选配额。任何论文或方向都必须达到门槛。某个领域全部低于阈值时,不允许为了均衡而选一个最高者。


---


## 5. 每篇论文的深度阅读要求


每篇论文作为一个完整阅读单元,至少覆盖:


1. 元数据、摘要和 Introduction:登记作者主张与问题定义;

2. 方法、算法、公式和系统设计;

3. 理论假设、定理和证明;若无理论则明确标记;

4. 实验设置、数据、模型、规模、资源条件和基线;

5. 主结果、消融、敏感性、负结果和失败案例;

6. limitations、discussion、conclusion 和附录;

7. 表格、算法以及图示附近能够从 TeX 读取的文字。


读完后必须独立回答:


1. 论文真正处理的研究对象是什么?

2. 它直接改变了哪个量、步骤或接口?

3. 方法最小化后还剩哪些原子操作?

4. 哪些组件是必要的,哪些只是性能补丁?

5. 它刻意保持了什么不变量或硬约束?

6. 最强基线是否获得公平条件?

7. 增益来自新机制,还是来自更多资源?

8. 哪个实验或定理最支持核心主张?

9. 哪个结果最削弱核心主张?

10. 原论文没有测试但机制上可能成立的场景是什么?

11. 规模扩大后,价值可能增强、稳定还是衰减?

12. 最小反例或失败条件是什么?


只有完成上述内容后才能评分。正文缺失重要信息时降低证据置信度,不得自行补写结果。


## 5.1 三个正文证据


每篇完整论文卡保留三个简洁证据:


1. 方法或定理证据;

2. 主要结果证据;

3. 局限、消融、假设或失败边界证据。


每项写明章节和准确概括即可,不要求复制长原文或制作复杂定位信息。


## 5.2 自动化边界


程序可以负责枚举论文、读取文件、保存论文卡、检查遗漏和统计汇总。


程序不得:


- 用标题、摘要、关键词、embedding 或引用量筛掉论文;

- 根据作者、单位或会议类型自动赋分;

- 用旧聚类标签替代正文判断;

- 通过搜索 `simple`、`general`、`training-free` 等词判断方法属性;

- 在论文尚未读完时给出正式分数。


---


## 6. 全量论文卡


每篇论文输出一条结构化记录。字段应足以支撑后续深挖,不写无关长文。


```json

{

"paper_id": "...",

"title": "...",

"conference": "...",

"paper_type": "method|theory|analysis|system|dataset|benchmark|empirical",

"read_complete": true,

"sections_read": ["..."],

"author_claims": ["..."],

"independent_problem": "论文真正处理的问题",

"research_object": "输入、输出、任务、环境或数学对象",

"bottleneck": "直接失败模式或资源约束",

"intervention_stage": ["data|representation|architecture|objective|optimization|training|inference|search|evaluation|system"],

"manipulated_quantity": ["方法直接改变的量"],

"invariants_or_constraints": ["刻意保持的量或硬约束"],

"minimal_mechanism": ["按顺序排列的原子操作"],

"necessary_components": ["..."],

"optional_components": ["..."],

"interface": "其他工作如何接入",

"strongest_baseline": "...",

"budget_fairness": "fair|unclear|unfair",

"evidence": {

"method": {"section": "...", "finding": "..."},

"result": {"section": "...", "finding": "..."},

"boundary": {"section": "...", "finding": "..."}

},

"positive_evidence": ["..."],

"negative_evidence": ["..."],

"ablations": ["..."],

"theory_status": "complete|conditional|sketch|none|counterexample_found",

"tested_tasks": ["..."],

"tested_models": ["..."],

"tested_scales": ["..."],

"compute_and_data_cost": "...",

"observed_generality": "0-5,并附依据",

"structural_generality": "0-5,并附依据",

"scaling_hypothesis": "增强|稳定|衰减|未知",

"failure_modes": ["..."],

"source_limitations": ["..."],

"prior_art_risk_blind": "初评阶段发现的等价或组合风险",

"pressure_vectors": [

{

"driver": "...",

"growing_bottleneck": "...",

"value_migration": "...",

"solution_families": ["..."],

"counterforce": "..."

}

],

"track_a_scores": {},

"track_a_total": 0,

"track_a_level": "F0-F4",

"confidence": "low|medium|high",

"reviewer_verdict": "...",

"strongest_counterargument": "...",

"falsifier": "什么事实会推翻当前判断",

"next_action": "ignore|watch|reproduce|investigate|priority"

}

```


---


## 7. 目标 A:十项基础潜力评分


每项先按 0–5 分判断,再按权重换算,总分 100。


通用评分锚点:


- 0:缺失或被正文反证;

- 1:主要是作者主张;

- 2:证据窄、依赖强或适用面有限;

- 3:在当前范围可信,并有合理扩展空间;

- 4:机制和证据都很强,跨场景价值清楚;

- 5:出现少见的基础性结构,且替代解释很弱。


| 指标 | 权重 | 判断问题 |

|---|---:|---|

| A1 不可约新原语 | 12 | 去掉包装后,是否仍有不能被现有方法自然包含的核心变化? |

| A2 瓶颈中心性 | 12 | 是否处理能力、规模、可靠性或成本的主瓶颈? |

| A3 结构通用性 | 12 | 机制是否有理由跨任务、模型、模态或系统成立? |

| A4 规模互补性 | 12 | 基础模型和规模增强后,价值是否保持或上升? |

| A5 能力解锁 | 12 | 是否允许此前难以实现的能力、规模或系统形态? |

| A6 可组合与生态 | 10 | 是否有清晰接口,可能形成后续设计空间? |

| A7 压缩性与简洁性 | 8 | 核心因果变化是否能被简洁表达,组件是否必要? |

| A8 证据质量 | 10 | 理论、实验、消融、基线和边界是否共同支持主张? |

| A9 采用与经济坡度 | 7 | 成本、兼容性、延迟和组织阻力是否允许扩散? |

| A10 鲁棒与生存性 | 5 | 分布变化、规模变化或强替代路线出现时是否仍有价值? |


分数层级:


- 82–100:极强基础潜力候选;

- 72–81:优先深挖;

- 62–71:值得观察;

- 50–61:有用但暂不具基础级证据;

- 50 以下:保留记录,不进入重点候选。


### 7.1 硬边界


- 严格等价、换坐标或机械拼接:A1 最高 1/5;

- 主要增益来自额外资源且比较不公平:A8 最高 1/5;

- 只在单一任务有效且缺少可迁移机制:A3 最高 2/5;

- 关键主张依赖不可见信息:不得成为高置信候选;

- 方法复杂度没有得到不可替代收益偿付:A7 最高 2/5。


### 7.2 概率与条件影响


只有进入重点候选的论文才评估:


- 到 2031 年成为广泛复用基础技术的概率档位:`0.1%|0.3%|1%|3%|10%|20%`;

- 若成功,影响等级:1–5;

- 成功所需的三个前提;

- 未来 6–24 个月最应观察的三个领先指标。


概率必须服从极低基率,不能因为论文令人兴奋就随意给高概率。


### 7.3 失败前演练


每个重点候选都要回答:


1. 它是否只在当前数据集成立?

2. 更大模型或更强基础设施会不会让它失去价值?

3. 部署成本是否会抵消收益?

4. 是否存在更简单或更早的等价路线?

5. 即使技术成立,生态是否缺乏采用动力?


---


## 8. 目标 B:十项风向评分


风向由所有论文卡中的 `pressure_vectors` 综合产生。可以使用聚合方法寻找关系,但不能只根据标题或共享词语命名方向。


| 指标 | 权重 | 判断问题 |

|---|---:|---|

| B1 结构驱动力 | 15 | 是否有持续增强的技术、硬件、数据、产品或经济驱动? |

| B2 增长瓶颈 | 12 | 问题是否随规模和应用扩大而加重? |

| B3 独立收敛 | 10 | 是否有不同对象、机构或方法家族独立指向同一压力? |

| B4 方法替换韧性 | 10 | 当前代表方法失败后,方向是否仍成立? |

| B5 使能条件成熟度 | 10 | 数据、模型、硬件、接口或评测条件是否逐渐就绪? |

| B6 经济与采用拉力 | 12 | 是否会显著影响能力、成本、收入、可靠性或开发效率? |

| B7 跨层影响 | 10 | 是否可能同时影响模型、系统、数据或产品多个层面? |

| B8 时间匹配 | 8 | 为什么是未来 3–5 年,而不是已经发生或遥遥无期? |

| B9 注意力缺口 | 8 | 真实结构价值与当前共识之间是否存在差距? |

| B10 可证伪性 | 5 | 是否能写出明确的领先指标和失败条件? |


风向层级:


- 82–100:结构重要性极强;

- 72–81:高优先风向;

- 62–71:值得跟踪;

- 62 以下:证据不足、过于依赖单一方法或已是充分共识。


### 8.1 当前共识单独标记


| 状态 | 定义 |

|---|---|

| C0 | 已成为标准共识,前瞻认知差有限 |

| C1 | 大众热点,价值可能真实但已广为人知 |

| C2 | 专家圈开始收敛,尚未成为主流配置 |

| C3 | 多个弱信号出现,仍缺统一命名和叙事 |

| C4 | 反共识方向;必须有强机制,不能因冷门加分 |


最终分别给出结构重要性榜、低共识高价值榜和共识过热风险榜。


### 8.2 每个重点风向的时间路径


每个重点风向说明:


- 未来 12 个月可观察的领先指标;

- 未来 24 个月应出现的技术或产品变化;

- 2029–2031 年可能形成的结构结果;

- 可能获胜的不同方法家族;

- 当前最大阻塞条件;

- 哪项事实出现后应显著下调评分;

- 个人研究者、实验室和大公司分别适合做什么。


---


## 9. 精简流程:把时间用于研究,不用于仪式


## 阶段 0:清单与量表


1. 确认语料可以读取;

2. 建立 13,107 篇论文清单并核对会议数量;

3. 在开始前固定论文卡字段、评分维度和门槛。


交付:`00_setup/input_manifest.jsonl`、`rubric_version.json`。


## 阶段 1:13,107 篇全文初评


逐篇阅读全文、独立分析并生成完整论文卡。失败请求或空卡不能计为完成;不得因为执行困难退化为标题、摘要或关键词筛选。


交付:`01_full_read/paper_cards.jsonl`、`completion.json`。


## 阶段 2:目标 A 深挖


以下论文进入候选池,合计最多 300 篇:


- A_total ≥72;

- A_total 为 62–71,但在结构通用性、规模互补性、能力解锁中至少两项极强;

- 提出新不变量、强反例、重要 no-go、系统接口或高上限机制,却因实证范围窄而总分偏低;

- 在不同研究对象中显示出少见基础潜力、需要进一步核对者。


候选深挖不是简单重复阅读,而是回到正文解决关键科学问题:


1. 精确还原机制、假设和真正贡献;

2. 查找最近的前序工作与同期工作,并阅读其方法和关键证据;

3. 检查严格等价、机械组合、隐含资源优势和弱基线;

4. 构造最小反例、规模变化情景和真实部署失败情景;

5. 判断 general 性来自机制,还是来自论文叙事;

6. 更新分数、概率、置信度和行动建议。


交付:`02_track_a/candidate_reviews.jsonl`、`基础技术点_TOP100.md`。


若真正达标者不足 100 篇,只列实际达标数量,不补位。


## 阶段 3:目标 B 风向综合


使用全部论文卡的研究对象、瓶颈、机制和 `pressure_vectors` 建立关系。先寻找共同结构压力,再区分独立证据与同一研究系列的重复证据。


对每个候选风向:


1. 写出驱动—瓶颈—价值迁移链;

2. 找出不同的解决路线;

3. 执行方法替换测试;

4. 阅读代表论文、边界论文和反例论文;

5. 判断它是早期结构变化、当前热点延长,还是短期数据集效应;

6. 给出时间路径、阻塞条件和失败情景。


交付:`03_track_b/wind_cards.jsonl`、`结构重要性风向_TOP30.md`、`低共识高价值风向_TOP20.md`、`共识过热风险榜.md`。


## 阶段 4:最终挑战与排序


对最终高优先候选做一次真正有力度的反向思考:尝试用最强替代解释、最小反例、规模变化和采用失败情景推翻它。反方意见必须针对已经形成的具体主张,并优先尝试修正边界;无法修复时降级。


最终排序综合:


- 量表分数;

- 深挖后的机制判断;

- 前序工作碰撞;

- 反例与失败边界;

- 3–5 年条件价值。


排名接近时使用梯队,不制造虚假的精确差距。


## 阶段 5:最终报告


交付:`04_reports/EXECUTIVE_BRIEF.md`、`前瞻研判总报告.md`、`all_papers_scores.csv`、`RUN_COMPLETE.md`。


---


## 10. 最终目录


```text

foresight_2029_2031/

00_setup/

input_manifest.jsonl

rubric_version.json

01_full_read/

paper_cards.jsonl

completion.json

02_track_a/

candidate_reviews.jsonl

基础技术点_TOP100.md

03_track_b/

wind_cards.jsonl

结构重要性风向_TOP30.md

低共识高价值风向_TOP20.md

共识过热风险榜.md

04_reports/

EXECUTIVE_BRIEF.md

前瞻研判总报告.md

all_papers_scores.csv

RUN_COMPLETE.md

```


---


## 11. 最低完成条件


只有满足以下条件才能生成 `RUN_COMPLETE.md`:


- 13,107 篇论文均有唯一且完整的论文卡;

- 每篇正式评分都来自完整正文阅读;

- 每篇卡包含方法、结果和边界三类正文证据;

- 重点基础候选完成前序工作核查、反例思考和概率判断;

- 重点风向完成方法替换测试、时间路径和失败情景;

- 最终结果保留最强反证,不隐藏不确定性。


不要求额外的随机复读、固定比例双读、重复评分一致性测试、复杂统计排序或形式化预测账本。时间应优先投入正文理解、机制拆解、前序工作、反例和未来推演。


---


## 12. 最终报告格式


## 12.1 基础技术点榜


每篇包括:


- 标题、会议和链接;

- 去宣传化的一句话方法;

- 核心机制、改变的量、不变量和接入接口;

- 为什么可能具备基础性;

- 正文中最有力的证据;

- 最近前序工作与新颖性边界;

- 为什么可能失败;

- A1–A10、总分、F 等级;

- 到 2031 年的概率档位、条件影响和领先指标;

- 建议行动:忽略、跟踪、复现、战略试验或优先立项。


## 12.2 风向榜


每个方向包括:


- 一句话方向命题;

- 结构驱动、增长瓶颈和价值迁移;

- 代表论文、使能论文、边界论文和反例;

- 相互竞争的方法家族;

- 方法替换测试;

- B1–B10、总分和当前共识;

- 为什么是未来 3–5 年;

- 12/24 个月领先指标与 2029–2031 结果;

- 最强反向情景和降级条件;

- 对个人研究者、实验室和大公司的行动建议。


---


## 13. 常见误判


- **把热点当风向**:论文多不等于结构价值增长;

- **把性能增益当基础性**:刷榜不等于产生新接口或新范式;

- **把复杂度当深度**:组件多可能只是补丁多;

- **把简单当通用**:简单方法也可能只对单一设置有效;

- **把顶级机构当正确性**:单位只影响执行概率,不提供技术证据;

- **把冷门当被低估**:低关注必须同时具备强机制;

- **照抄论文未来工作**:作者叙事不能代替结构推演;

- **机械拼接两篇论文**:先检查等价性、接口和价值是否真正保留;

- **只看当前采用**:采用是滞后信号,不能决定早期潜力;

- **对长周期给出虚假确定性**:使用概率档位、条件和反证。


---


## 14. 最终纪律


你的价值来自完整阅读、深入拆解和独立判断。不要充当论文宣传者,也不要为了显得前瞻而奖励冷门术语。


最终结果必须让负责人看清:


- 为什么某篇论文或某个方向值得重视;

- 哪些结论是正文事实,哪些是推断和预测;

- 最强反证是什么;

- 什么事实出现后应降低判断;

- 哪些候选值得立即复现,哪些只应持续观察;

- 如果真正的基础级候选不存在,为什么应诚实返回空缺。


严格执行本任务书。不得用整体浏览、关键词命中或摘要概括代替逐篇全文阅读。


FIELD NOTES ↗