三顶会全文前瞻研判任务书
正文 收起
# 三顶会全文前瞻研判任务书
## 0. 首席科学家指令
你需要逐篇完整阅读最新一届 ICLR、ICML 和 NeurIPS 的 13,107 篇 TeX 正文,完成两条彼此独立的前瞻研判:
1. 找出可能成为下一代通用技术原语、基础架构或能力跃迁接口的论文;
2. 找出未来 3–5 年更值得押注的结构性技术风向。
这不是热门论文重排。你需要独立判断:
- 哪些论文可能改变后续研究组织模型、数据、计算或反馈的方式?
- 哪些方向即使当前代表方法失败,背后的需求和价值仍会持续增强?
- 哪些信号尚未形成大众共识,却可能在 2029–2031 年成为重要主航道?
- 哪些论文只是重命名、重参数化、工程堆叠、弱基线或额外资源带来的表面进步?
必须读完正文后再判断。标题、摘要、关键词、作者单位、论文自称的贡献、当前热度和引用量都不能替代正文阅读。
真正达到 Transformer/LLM 作用层级的论文可能一篇也没有。可以诚实返回零篇,不得为了交付而制造“划时代候选”。
---
## 1. 输入与时间边界
### 1.1 语料
- 文件:`AI三顶会最新一届_TeX正文_13107篇_修正版.zip`
- 有效论文:13,107 篇
- ICLR 2026:4,324 篇
- ICML 2026:4,545 篇
- NeurIPS 2025:4,238 篇
不得使用旧的 13,114 篇版本。
### 1.2 预测时点
判断时点为 **2026-08-17**,预测窗口为 **2029–2031**。
全文初评先依据论文本身完成。候选深挖阶段才查询前序工作、同期论文、代码、采用情况和外部信号,防止名气与事后信息污染独立判断。
### 1.3 输出目录
```text
./foresight_2029_2031/
```
---
## 2. 目标 A:潜在基础技术点
“潜在基础技术点”是能够被许多后续工作调用的技术原语、训练原则、推理接口、系统抽象、数据机制、理论结构或评测反馈回路。它可能改变研究者组织计算、数据、模型或反馈的方式,而非只提升一个数据集。
一个真正具有基础性潜力的工作通常满足多项:
- **不可约**:去掉包装后,仍存在新的核心操作、接口、不变量或组织方式;
- **瓶颈中心**:处理能力、规模、成本、可靠性或数据中的关键约束;
- **结构通用**:成立原因不依赖原论文的特定任务名称;
- **随规模增值**:模型、数据或推理规模增大后,价值不自然消失;
- **能力解锁**:允许此前难以稳定实现的能力、规模或系统形态;
- **可组合**:能被其他模型、任务或系统以清晰接口调用;
- **形成生态**:可能产生新的设计空间、测量方式和后续研究问题;
- **经济上有坡度**:能够改变训练成本、推理成本、延迟、可靠性或数据获取方式。
基础性不等于方法必须简单。简单性有利于传播和组合;复杂方法若建立新的系统边界,也可能有基础价值,但复杂度必须由不可替代的能力收益偿付。
### 2.1 五级作用层级
| 等级 | 定义 |
|---|---|
| F0 | 局部技巧、复现、分析或特定数据集改进 |
| F1 | 对一个稳定子领域有用,但接口与适用面有限 |
| F2 | 跨多个任务或模型可复用的通用组件或原则 |
| F3 | 可能成为标准技术栈的一部分,改变大量后续设计选择 |
| F4 | 可能改变能力或规模前沿,形成新的基础架构或范式 |
F4 是极低基率事件。高分、热门、顶级作者、oral 或最佳论文身份都不能自动得到 F3/F4。
---
## 3. 目标 B:未来 3–5 年结构性风向
“风向”不是热门名词、论文数量增长或某个当前强方法。风向是一条持续增强的结构压力:外部驱动使某个瓶颈随规模和应用扩大而加重,价值与资源因此从旧边界迁往新边界,多种方法可能竞争解决它。
每个风向必须写成下面的因果链:
```text
结构性驱动
→ 随规模或应用扩大而加重的瓶颈
→ 能力、成本或价值的迁移
→ 至少两种可能的解决路线
→ 未来 1–5 年可观察的变化
```
每个风向必须通过“方法替换测试”:移除当前最强代表方法后,问题压力、价值池和其他路线是否仍然存在?若方向随某个方法一起消失,它更像技术点,不是风向。
“Agent 很热”“多模态论文很多”“推理是趋势”都不构成风向,除非补全驱动、瓶颈、价值迁移、竞争路线和反证条件。
早期风向证据可以稀疏,但必须回答:
- 为什么现在开始出现?
- 为什么未来 3–5 年会变得更重要?
- 哪些互不相同的方法可能解决它?
- 当前最大阻塞条件是什么?
- 什么事实会证明这个判断错了?
---
## 4. 认识论纪律
## 4.1 Introduction 只提供待验证主张
阅读 Introduction 时记录作者主张,但不立即接受。每项重要主张都要在方法、定理、实验、消融、附录或负面结果中寻找支持或反证。
每篇论文严格区分:
- `observed`:正文直接展示或证明的事实;
- `inferred`:基于机制和证据作出的合理外推;
- `forecast`:关于 2029–2031 的预测。
论文作者自己的未来推测仍属于推测。
## 4.2 初评屏蔽社会声量
全文初评时不使用:
- 作者和机构声誉;
- oral、spotlight、奖项和引用量;
- 社交媒体热度、公司宣传和其他榜单;
- 当前产品采用情况。
这些信息只能在候选深挖阶段用于判断执行能力、采用路径和当前共识,不能替代技术证据。
## 4.3 不奖励“看起来新”
罕见术语、跨领域类比和复杂公式不自动加分。新颖性必须落实到操作、接口、不变量、可识别对象或新能力。
特别检查:
- 是否只是已有方法的换坐标、重参数化或别名;
- 是否把已知组件机械串联后重新命名;
- 是否只是使用更多数据、更多采样、更大模型或更强监督;
- 是否借弱基线、预算不对称或调参不公平制造结果;
- 是否只有描述性相关性,缺少可干预机制;
- 是否核心假设在真实部署中很难满足。
## 4.4 允许高上限、弱证据候选存在
必须区分:
- `observed_generality`:正文实际验证的任务、模型、模态和规模;
- `structural_generality`:根据机制判断的潜在适用范围;
- `evidence_gap`:二者之间尚未验证的部分。
高结构潜力、低实证覆盖的论文可进入“高上限待证”名单,但置信度必须低于证据充分候选。
## 4.5 允许返回空集
不设入选配额。任何论文或方向都必须达到门槛。某个领域全部低于阈值时,不允许为了均衡而选一个最高者。
---
## 5. 每篇论文的深度阅读要求
每篇论文作为一个完整阅读单元,至少覆盖:
1. 元数据、摘要和 Introduction:登记作者主张与问题定义;
2. 方法、算法、公式和系统设计;
3. 理论假设、定理和证明;若无理论则明确标记;
4. 实验设置、数据、模型、规模、资源条件和基线;
5. 主结果、消融、敏感性、负结果和失败案例;
6. limitations、discussion、conclusion 和附录;
7. 表格、算法以及图示附近能够从 TeX 读取的文字。
读完后必须独立回答:
1. 论文真正处理的研究对象是什么?
2. 它直接改变了哪个量、步骤或接口?
3. 方法最小化后还剩哪些原子操作?
4. 哪些组件是必要的,哪些只是性能补丁?
5. 它刻意保持了什么不变量或硬约束?
6. 最强基线是否获得公平条件?
7. 增益来自新机制,还是来自更多资源?
8. 哪个实验或定理最支持核心主张?
9. 哪个结果最削弱核心主张?
10. 原论文没有测试但机制上可能成立的场景是什么?
11. 规模扩大后,价值可能增强、稳定还是衰减?
12. 最小反例或失败条件是什么?
只有完成上述内容后才能评分。正文缺失重要信息时降低证据置信度,不得自行补写结果。
## 5.1 三个正文证据
每篇完整论文卡保留三个简洁证据:
1. 方法或定理证据;
2. 主要结果证据;
3. 局限、消融、假设或失败边界证据。
每项写明章节和准确概括即可,不要求复制长原文或制作复杂定位信息。
## 5.2 自动化边界
程序可以负责枚举论文、读取文件、保存论文卡、检查遗漏和统计汇总。
程序不得:
- 用标题、摘要、关键词、embedding 或引用量筛掉论文;
- 根据作者、单位或会议类型自动赋分;
- 用旧聚类标签替代正文判断;
- 通过搜索 `simple`、`general`、`training-free` 等词判断方法属性;
- 在论文尚未读完时给出正式分数。
---
## 6. 全量论文卡
每篇论文输出一条结构化记录。字段应足以支撑后续深挖,不写无关长文。
```json
{
"paper_id": "...",
"title": "...",
"conference": "...",
"paper_type": "method|theory|analysis|system|dataset|benchmark|empirical",
"read_complete": true,
"sections_read": ["..."],
"author_claims": ["..."],
"independent_problem": "论文真正处理的问题",
"research_object": "输入、输出、任务、环境或数学对象",
"bottleneck": "直接失败模式或资源约束",
"intervention_stage": ["data|representation|architecture|objective|optimization|training|inference|search|evaluation|system"],
"manipulated_quantity": ["方法直接改变的量"],
"invariants_or_constraints": ["刻意保持的量或硬约束"],
"minimal_mechanism": ["按顺序排列的原子操作"],
"necessary_components": ["..."],
"optional_components": ["..."],
"interface": "其他工作如何接入",
"strongest_baseline": "...",
"budget_fairness": "fair|unclear|unfair",
"evidence": {
"method": {"section": "...", "finding": "..."},
"result": {"section": "...", "finding": "..."},
"boundary": {"section": "...", "finding": "..."}
},
"positive_evidence": ["..."],
"negative_evidence": ["..."],
"ablations": ["..."],
"theory_status": "complete|conditional|sketch|none|counterexample_found",
"tested_tasks": ["..."],
"tested_models": ["..."],
"tested_scales": ["..."],
"compute_and_data_cost": "...",
"observed_generality": "0-5,并附依据",
"structural_generality": "0-5,并附依据",
"scaling_hypothesis": "增强|稳定|衰减|未知",
"failure_modes": ["..."],
"source_limitations": ["..."],
"prior_art_risk_blind": "初评阶段发现的等价或组合风险",
"pressure_vectors": [
{
"driver": "...",
"growing_bottleneck": "...",
"value_migration": "...",
"solution_families": ["..."],
"counterforce": "..."
}
],
"track_a_scores": {},
"track_a_total": 0,
"track_a_level": "F0-F4",
"confidence": "low|medium|high",
"reviewer_verdict": "...",
"strongest_counterargument": "...",
"falsifier": "什么事实会推翻当前判断",
"next_action": "ignore|watch|reproduce|investigate|priority"
}
```
---
## 7. 目标 A:十项基础潜力评分
每项先按 0–5 分判断,再按权重换算,总分 100。
通用评分锚点:
- 0:缺失或被正文反证;
- 1:主要是作者主张;
- 2:证据窄、依赖强或适用面有限;
- 3:在当前范围可信,并有合理扩展空间;
- 4:机制和证据都很强,跨场景价值清楚;
- 5:出现少见的基础性结构,且替代解释很弱。
| 指标 | 权重 | 判断问题 |
|---|---:|---|
| A1 不可约新原语 | 12 | 去掉包装后,是否仍有不能被现有方法自然包含的核心变化? |
| A2 瓶颈中心性 | 12 | 是否处理能力、规模、可靠性或成本的主瓶颈? |
| A3 结构通用性 | 12 | 机制是否有理由跨任务、模型、模态或系统成立? |
| A4 规模互补性 | 12 | 基础模型和规模增强后,价值是否保持或上升? |
| A5 能力解锁 | 12 | 是否允许此前难以实现的能力、规模或系统形态? |
| A6 可组合与生态 | 10 | 是否有清晰接口,可能形成后续设计空间? |
| A7 压缩性与简洁性 | 8 | 核心因果变化是否能被简洁表达,组件是否必要? |
| A8 证据质量 | 10 | 理论、实验、消融、基线和边界是否共同支持主张? |
| A9 采用与经济坡度 | 7 | 成本、兼容性、延迟和组织阻力是否允许扩散? |
| A10 鲁棒与生存性 | 5 | 分布变化、规模变化或强替代路线出现时是否仍有价值? |
分数层级:
- 82–100:极强基础潜力候选;
- 72–81:优先深挖;
- 62–71:值得观察;
- 50–61:有用但暂不具基础级证据;
- 50 以下:保留记录,不进入重点候选。
### 7.1 硬边界
- 严格等价、换坐标或机械拼接:A1 最高 1/5;
- 主要增益来自额外资源且比较不公平:A8 最高 1/5;
- 只在单一任务有效且缺少可迁移机制:A3 最高 2/5;
- 关键主张依赖不可见信息:不得成为高置信候选;
- 方法复杂度没有得到不可替代收益偿付:A7 最高 2/5。
### 7.2 概率与条件影响
只有进入重点候选的论文才评估:
- 到 2031 年成为广泛复用基础技术的概率档位:`0.1%|0.3%|1%|3%|10%|20%`;
- 若成功,影响等级:1–5;
- 成功所需的三个前提;
- 未来 6–24 个月最应观察的三个领先指标。
概率必须服从极低基率,不能因为论文令人兴奋就随意给高概率。
### 7.3 失败前演练
每个重点候选都要回答:
1. 它是否只在当前数据集成立?
2. 更大模型或更强基础设施会不会让它失去价值?
3. 部署成本是否会抵消收益?
4. 是否存在更简单或更早的等价路线?
5. 即使技术成立,生态是否缺乏采用动力?
---
## 8. 目标 B:十项风向评分
风向由所有论文卡中的 `pressure_vectors` 综合产生。可以使用聚合方法寻找关系,但不能只根据标题或共享词语命名方向。
| 指标 | 权重 | 判断问题 |
|---|---:|---|
| B1 结构驱动力 | 15 | 是否有持续增强的技术、硬件、数据、产品或经济驱动? |
| B2 增长瓶颈 | 12 | 问题是否随规模和应用扩大而加重? |
| B3 独立收敛 | 10 | 是否有不同对象、机构或方法家族独立指向同一压力? |
| B4 方法替换韧性 | 10 | 当前代表方法失败后,方向是否仍成立? |
| B5 使能条件成熟度 | 10 | 数据、模型、硬件、接口或评测条件是否逐渐就绪? |
| B6 经济与采用拉力 | 12 | 是否会显著影响能力、成本、收入、可靠性或开发效率? |
| B7 跨层影响 | 10 | 是否可能同时影响模型、系统、数据或产品多个层面? |
| B8 时间匹配 | 8 | 为什么是未来 3–5 年,而不是已经发生或遥遥无期? |
| B9 注意力缺口 | 8 | 真实结构价值与当前共识之间是否存在差距? |
| B10 可证伪性 | 5 | 是否能写出明确的领先指标和失败条件? |
风向层级:
- 82–100:结构重要性极强;
- 72–81:高优先风向;
- 62–71:值得跟踪;
- 62 以下:证据不足、过于依赖单一方法或已是充分共识。
### 8.1 当前共识单独标记
| 状态 | 定义 |
|---|---|
| C0 | 已成为标准共识,前瞻认知差有限 |
| C1 | 大众热点,价值可能真实但已广为人知 |
| C2 | 专家圈开始收敛,尚未成为主流配置 |
| C3 | 多个弱信号出现,仍缺统一命名和叙事 |
| C4 | 反共识方向;必须有强机制,不能因冷门加分 |
最终分别给出结构重要性榜、低共识高价值榜和共识过热风险榜。
### 8.2 每个重点风向的时间路径
每个重点风向说明:
- 未来 12 个月可观察的领先指标;
- 未来 24 个月应出现的技术或产品变化;
- 2029–2031 年可能形成的结构结果;
- 可能获胜的不同方法家族;
- 当前最大阻塞条件;
- 哪项事实出现后应显著下调评分;
- 个人研究者、实验室和大公司分别适合做什么。
---
## 9. 精简流程:把时间用于研究,不用于仪式
## 阶段 0:清单与量表
1. 确认语料可以读取;
2. 建立 13,107 篇论文清单并核对会议数量;
3. 在开始前固定论文卡字段、评分维度和门槛。
交付:`00_setup/input_manifest.jsonl`、`rubric_version.json`。
## 阶段 1:13,107 篇全文初评
逐篇阅读全文、独立分析并生成完整论文卡。失败请求或空卡不能计为完成;不得因为执行困难退化为标题、摘要或关键词筛选。
交付:`01_full_read/paper_cards.jsonl`、`completion.json`。
## 阶段 2:目标 A 深挖
以下论文进入候选池,合计最多 300 篇:
- A_total ≥72;
- A_total 为 62–71,但在结构通用性、规模互补性、能力解锁中至少两项极强;
- 提出新不变量、强反例、重要 no-go、系统接口或高上限机制,却因实证范围窄而总分偏低;
- 在不同研究对象中显示出少见基础潜力、需要进一步核对者。
候选深挖不是简单重复阅读,而是回到正文解决关键科学问题:
1. 精确还原机制、假设和真正贡献;
2. 查找最近的前序工作与同期工作,并阅读其方法和关键证据;
3. 检查严格等价、机械组合、隐含资源优势和弱基线;
4. 构造最小反例、规模变化情景和真实部署失败情景;
5. 判断 general 性来自机制,还是来自论文叙事;
6. 更新分数、概率、置信度和行动建议。
交付:`02_track_a/candidate_reviews.jsonl`、`基础技术点_TOP100.md`。
若真正达标者不足 100 篇,只列实际达标数量,不补位。
## 阶段 3:目标 B 风向综合
使用全部论文卡的研究对象、瓶颈、机制和 `pressure_vectors` 建立关系。先寻找共同结构压力,再区分独立证据与同一研究系列的重复证据。
对每个候选风向:
1. 写出驱动—瓶颈—价值迁移链;
2. 找出不同的解决路线;
3. 执行方法替换测试;
4. 阅读代表论文、边界论文和反例论文;
5. 判断它是早期结构变化、当前热点延长,还是短期数据集效应;
6. 给出时间路径、阻塞条件和失败情景。
交付:`03_track_b/wind_cards.jsonl`、`结构重要性风向_TOP30.md`、`低共识高价值风向_TOP20.md`、`共识过热风险榜.md`。
## 阶段 4:最终挑战与排序
对最终高优先候选做一次真正有力度的反向思考:尝试用最强替代解释、最小反例、规模变化和采用失败情景推翻它。反方意见必须针对已经形成的具体主张,并优先尝试修正边界;无法修复时降级。
最终排序综合:
- 量表分数;
- 深挖后的机制判断;
- 前序工作碰撞;
- 反例与失败边界;
- 3–5 年条件价值。
排名接近时使用梯队,不制造虚假的精确差距。
## 阶段 5:最终报告
交付:`04_reports/EXECUTIVE_BRIEF.md`、`前瞻研判总报告.md`、`all_papers_scores.csv`、`RUN_COMPLETE.md`。
---
## 10. 最终目录
```text
foresight_2029_2031/
00_setup/
input_manifest.jsonl
rubric_version.json
01_full_read/
paper_cards.jsonl
completion.json
02_track_a/
candidate_reviews.jsonl
基础技术点_TOP100.md
03_track_b/
wind_cards.jsonl
结构重要性风向_TOP30.md
低共识高价值风向_TOP20.md
共识过热风险榜.md
04_reports/
EXECUTIVE_BRIEF.md
前瞻研判总报告.md
all_papers_scores.csv
RUN_COMPLETE.md
```
---
## 11. 最低完成条件
只有满足以下条件才能生成 `RUN_COMPLETE.md`:
- 13,107 篇论文均有唯一且完整的论文卡;
- 每篇正式评分都来自完整正文阅读;
- 每篇卡包含方法、结果和边界三类正文证据;
- 重点基础候选完成前序工作核查、反例思考和概率判断;
- 重点风向完成方法替换测试、时间路径和失败情景;
- 最终结果保留最强反证,不隐藏不确定性。
不要求额外的随机复读、固定比例双读、重复评分一致性测试、复杂统计排序或形式化预测账本。时间应优先投入正文理解、机制拆解、前序工作、反例和未来推演。
---
## 12. 最终报告格式
## 12.1 基础技术点榜
每篇包括:
- 标题、会议和链接;
- 去宣传化的一句话方法;
- 核心机制、改变的量、不变量和接入接口;
- 为什么可能具备基础性;
- 正文中最有力的证据;
- 最近前序工作与新颖性边界;
- 为什么可能失败;
- A1–A10、总分、F 等级;
- 到 2031 年的概率档位、条件影响和领先指标;
- 建议行动:忽略、跟踪、复现、战略试验或优先立项。
## 12.2 风向榜
每个方向包括:
- 一句话方向命题;
- 结构驱动、增长瓶颈和价值迁移;
- 代表论文、使能论文、边界论文和反例;
- 相互竞争的方法家族;
- 方法替换测试;
- B1–B10、总分和当前共识;
- 为什么是未来 3–5 年;
- 12/24 个月领先指标与 2029–2031 结果;
- 最强反向情景和降级条件;
- 对个人研究者、实验室和大公司的行动建议。
---
## 13. 常见误判
- **把热点当风向**:论文多不等于结构价值增长;
- **把性能增益当基础性**:刷榜不等于产生新接口或新范式;
- **把复杂度当深度**:组件多可能只是补丁多;
- **把简单当通用**:简单方法也可能只对单一设置有效;
- **把顶级机构当正确性**:单位只影响执行概率,不提供技术证据;
- **把冷门当被低估**:低关注必须同时具备强机制;
- **照抄论文未来工作**:作者叙事不能代替结构推演;
- **机械拼接两篇论文**:先检查等价性、接口和价值是否真正保留;
- **只看当前采用**:采用是滞后信号,不能决定早期潜力;
- **对长周期给出虚假确定性**:使用概率档位、条件和反证。
---
## 14. 最终纪律
你的价值来自完整阅读、深入拆解和独立判断。不要充当论文宣传者,也不要为了显得前瞻而奖励冷门术语。
最终结果必须让负责人看清:
- 为什么某篇论文或某个方向值得重视;
- 哪些结论是正文事实,哪些是推断和预测;
- 最强反证是什么;
- 什么事实出现后应降低判断;
- 哪些候选值得立即复现,哪些只应持续观察;
- 如果真正的基础级候选不存在,为什么应诚实返回空缺。
严格执行本任务书。不得用整体浏览、关键词命中或摘要概括代替逐篇全文阅读。