AI for Research 当 AI 学会动手

从对话工具到科研助手,AI 正在改变研究者的工作方式。
这次分享聊聊:它现在能做什么,怎么用,以及未来会走向哪里。

王昊卿
北京邮电大学 · 微软亚洲研究院
2026.07

今天聊什么

  • 01 范式转变:从 Chat 到 Agent
  • 02 真实场景演示
  • 03 工具生态:Skills / MCP
  • 04 AI 科研的未来
  • 05 Agent 的工程挑战
  • 06 局限性与注意事项
  • 07 工具推荐与上手指南
↓ scroll

过去两年,发生了一件大事

AI 从"网页聊天框"变成了"住在你电脑里的助手"。三个根本性的变化:

Chat 时代
你 ↔ 网页对话框
打开浏览器,把文件拖上去,等它回复,复制结果,粘贴到本地。
每次对话从零开始,它不知道你的文件在哪、环境是什么。
Agent 时代
它住在你的电脑里
直接读你的文件、跑你的代码、用你的工具。
你说目标,它自己规划 → 执行 → 检查 → 交付成品。
我们能用到的 AI,是怎么一步步走到今天的:
2022.11
ChatGPT 发布 第一次:普通人可以跟 AI 对话了
2023
GPT-4 / Claude / 文心一言 更聪明了,能读图、能写长文、能做推理
2024
DeepSeek / 豆包 / Kimi 国内能用了;长文本、联网搜索、文件上传
2024H2
Deep Research / Artifacts AI 开始"做事":自动搜索、自动生成文档
2025
Coding Agent(Claude Code / Codex) 住在终端里,读代码、改代码、跑测试、交付成品
现在
通用 Agent + Skills + MCP 不只是写代码:读论文、做 PPT、调研、写邮件,全能
1 本地运行时
❌ Chat 模式
我想分析一下这个实验数据的 BER 曲线
好的,请把数据文件上传给我,我帮你分析。
(手动拖 data.csv 上传... 等 30 秒上传完成)
我看了你的数据,有 12000 行。建议用以下代码分析:
import numpy as np
import matplotlib.pyplot as plt
data = pd.read_csv('data.csv')...
(复制代码 → 打开 VS Code → 粘贴 → python3 run...)
报错了:ModuleNotFoundError: No module named 'scipy'
请先安装 scipy:pip install scipy
装好了,但图的坐标轴标签不对...
抱歉,请把 xlabel 改成 'Eb/No (dB)'...
(再改 → 再跑 → 终于出图了 → 手动保存)
来回 9 轮对话 + 手动操作,效率很低
✅ Agent 模式
分析一下 ~/experiments/data.csv 的 BER 曲线,Eb/No 在 x 轴,画图保存到同一目录
读取 ~/experiments/data.csv (2.3 MB, 12000 行)
检测数据结构: 3 列 (EbNo_dB, BER_sim, BER_theory)
检测到缺少 scipy → pip install scipy (2s)
编写分析脚本 analyze_ber.py
运行脚本...
检查输出: 图表坐标正确、理论线与仿真点吻合
保存 → ~/experiments/ber_analysis.png (150 DPI)
分析完成。BER 在 12dB Eb/No 处达到 10⁻⁴,与理论曲线吻合度 R²=0.998。图表已保存到你的 experiments 文件夹,脚本也在同目录方便复现。
1 条指令 → 自动读文件、装依赖、写代码、跑代码、出图、保存
2 交付最后一公里
❌ Chat 模式
帮我写个组会 PPT,关于我们最近的信道估计工作
好的,以下是 PPT 大纲建议:

Slide 1: Title - AI-Assisted Channel Estimation
Slide 2: Background...
Slide 3: Our Method...
...
(纯文字输出,2000 字)
(复制文字 → 打开 PowerPoint)
(新建空白 PPT → 一页页粘贴内容)
(手动调字体大小、对齐方式、配色...)
(想加个架构图 → 又得回来问 AI 画)
(1.5 小时后终于做完了...)
AI 输出的是"文字",你自己动手变成 PPT,耗时 1.5h
✅ Agent 模式
做个组会 PPT,关于 AI channel estimation,13 页左右,学术简洁风
规划 13 页 slide 结构 + 确定每页重点
编写 python-pptx 生成脚本
添加架构图 (5 模块 + 箭头连接)
生成性能对比表格 (8 方法 × 4 指标)
为每页写 speaker notes
应用学术模板: 深蓝标题栏 + 白底
保存 → ~/Desktop/presentation.pptx (67 KB)
PPT 已生成,在你桌面上。13 页,含架构图、对比表格、speaker notes。打开 PowerPoint 就能直接讲。
成品 .pptx 文件直接落到桌面,打开就能用
3 长程自主执行
❌ Chat 模式
帮我调研 AI 信道估计的最新进展
据我了解,近年来主要有 DNN 和 CNN 两种方法。DNN 直接学习信道响应映射,CNN 提取时频二维特征...
有没有 2025 年的最新论文?
抱歉,我的知识截止到 2025 年初,建议您到 Google Scholar 搜索最新文献。
那你能帮我搜索一下吗?
很抱歉,我目前无法访问互联网进行实时搜索。
(自己打开 Scholar → 搜 → 找到几篇 → 逐篇打开读 → 手动分类记笔记...)
(3 天后终于整理出一份粗糙的综述...但不确定有没有漏掉重要工作)
单轮对话、无法联网、不会主动执行,重复性工作仍需手动
✅ Agent 模式
调研 2024-2025 光通信 AI 信道估计进展,出带引用的结构化报告
搜索 "AI channel estimation optical 2024 2025" → 47 结果
深度阅读 top 12 篇全文...
搜索 "KAN Kolmogorov-Arnold network fiber" → 8 结果
搜索 "VAE blind equalization coherent optical" → 23 结果
搜索 "PINN NLSE optical channel" → 15 结果
交叉验证: [Zhang 2024] 与 [Wang 2025] 结论矛盾 → 确认是数据规模差异
分类为 6 大方向,标注 5 个开放问题
生成结构化报告: 2000 字, 22 篇引用, 含专利信息
报告已完成。覆盖 Learned DSP / VAE / PINN / KAN / Transformer / Reservoir 6 大方向,22 篇真实引用。发现 5 个争议点已标注。
自主搜索 → 阅读 → 验证 → 分类 → 撰写,全程 5 分钟
一句话总结:研究者的角色从"亲自执行每一步"转向"规划目标、验证结果"。

Agent 不是"更聪明的 ChatGPT"

它是一种新的工作方式。区别在于这四件事:

1
规划拆解
你说"帮我调研 X"
它自动拆成:搜索 → 筛选 → 精读 → 对比 → 成文
2
使用工具
能调用搜索引擎、读你的 PDF
执行 Python 脚本、发邮件
3
自主迭代
代码报错了?
它自己看报错、定位问题、修复、重跑
4
交付成果
不是给你一段文字让你复制
而是直接生成文件保存到你电脑上

真实场景:这些事现在都能做

点击展开,看看每个场景下你和 agent 的实际交互是什么样的。

🔍
Deep Research — 深度搜索
帮我调研一下 2024-2025 年光网络资源优化领域用强化学习/深度学习做动态路由和波长分配(RWDA)的最新进展,整理成报告。
Searching: "reinforcement learning optical network routing 2024 2025"
Found 53 results, reading top 14 papers...
Searching: "deep learning wavelength assignment elastic optical network" — 29 results
Searching: "GNN topology-aware network resource optimization" — 11 results
Searching: "ML traffic prediction optical network planning" — 18 results
Cross-referencing 24 papers across JLT, JOCN, OFC, ECOC...
Identifying 4 open controversies between research groups...
Structuring report: 5 categories, 24 citations, taxonomy diagram
Done — ~2200 word report generated.
真实产出(点击查看完整报告)
deep-research-report — 2200 words, 24 citations | 查看完整报告 ↗

Executive Summary

2024-2025 年,深度强化学习驱动的光网络资源优化进入"从离线规划走向在线实时决策"的关键转折期。DRL-based RMSA 在阻塞率上较传统启发式降低 30-50%;GNN 拓扑感知方法首次实现跨网络零样本迁移;Transformer 流量预测精度突破 95%,为提前资源预留奠定基础。

方法分类(5 大方向)

  • DRL-based Routing (DQN/PPO/A3C) — 动态 RMSA 阻塞率降 40%,支持在线决策 [Chen et al., JLT 2024]
  • GNN for Topology-aware Optimization — 图注意力网络编码拓扑,跨网络迁移 [Almasan et al., JOCN 2024]
  • Transformer Traffic Prediction — 多粒度时序预测,精度 96.2% [Zhao et al., OFC 2025]
  • Federated Learning for Multi-domain — 跨运营商协同优化,隐私保护 [Wang et al., ECOC 2024]
  • Digital Twin for Network Planning — 仿真-实网闭环验证,加速策略部署 [Li et al., JLT 2025]

⚠️ 争议与开放问题

  • DRL 训练收敛速度能否满足实时网络动态?
  • 仿真环境 (sim) 与真实网络 (real) 的 gap 如何弥合?
  • 多目标优化(阻塞率 vs 能耗 vs 时延)的 Pareto 前沿在哪?

这份报告是 agent 刚才真实搜索网络后生成的——24 篇真实论文引用,来自 JLT/JOCN/OFC/ECOC 等光网络顶级期刊会议。耗时 ~3 分钟。

📊
PPT / 文档生成
生成一个关于"基于深度强化学习的弹性光网络动态资源分配"的组会 PPT,12-15 页,简洁学术风格。
Planning slide structure: 14 slides
Writing content: EON Challenges → DRL Formulation → State/Action/Reward → Training → Results
Creating DRL architecture diagram on slide 6 (Agent-Environment interaction loop)
Designing reward function formula + simulation topology (NSFNET 14-node)
Generating performance comparison table (6 methods × blocking/utilization/time)
Adding speaker notes to all 14 slides
Applying academic template (navy blue headers, white bg)
Output: drl-eon-resource-allocation.pptx (72 KB)
真实产出 — 可下载
drl-eon-resource-allocation — 14 slides | 在线浏览 ↗ · 下载 .pptx

Slide 结构

  • Slide 1 — Title: DRL-based Dynamic Resource Allocation in EON | Group Meeting July 2026
  • Slide 2 — Outline / Agenda
  • Slide 3 — Background: 弹性光网络 (EON) 频谱碎片化挑战
  • Slide 4 — Traditional approaches (K-SP + First-Fit, 碎片感知启发式) 及局限
  • Slide 5 — DRL 问题建模: MDP formulation
  • Slide 6 — State/Action/Reward 设计 + DRL 架构图
  • Slide 7 — 训练策略: PPO + 课程学习
  • Slide 8 — Simulation setup: NSFNET 14-node topology
  • Slide 9 — Results: 阻塞率对比 (6 方法 × 不同负载)
  • Slide 10 — Ablation: reward shaping 各项贡献
  • Slide 11-12 — 频谱利用率分析 + 计算开销
  • Slide 13 — Future directions + References
  • Slide 14 — Thank You / Q&A

每页都有 speaker notes,打开就能讲。

这是 agent 真实生成的 .pptx 文件——写代码调用 python-pptx → 排版 → 输出。你可以直接下载打开看。

📚
文献精读与整理
精读这篇 DeepRMSA (JLT 2019),帮我逆向作者的思考路径,找出核心假设和可能的改进方向。
Fetching paper (JLT 2019, Chen et al., DeepRMSA, 12 pages)
Searching for context: 8 related sources (follow-ups, critiques, extensions)
Reverse-engineering: why DRL over heuristics → state/action design → reward shaping
Identifying 5 implicit assumptions, checking against 2024-2025 evidence
Generating reviewer attack points...
Structured analysis complete — 1800 words.
真实产出 | 查看完整分析 ↗
paper-deep-read.md — "DeepRMSA" 精读

作者的真正问题

不是"RMSA 问题没人做",而是 传统启发式算法无法适应动态流量模式。K-SP + First-Fit 在静态场景足够好,但面对时变业务到达时阻塞率急剧恶化——需要一种能"看到全局状态并学习长期策略"的方法。

逆向思考路径

  • Step 1: RMSA 本质是序贯决策 + 延迟奖励(当前分配影响未来阻塞)→ 天然适合 MDP 建模
  • Step 2: 状态空间巨大(拓扑×频谱×业务)→ 用 DNN 做函数逼近,而非表格型 RL
  • Step 3: 动作空间 = K 条候选路径 × M 个频谱块 → 设计层次化决策:先选路径,再选频谱
  • Step 4: Reward = 负阻塞率 → 但稀疏奖励收敛慢 → 加入频谱碎片化惩罚辅助信号

⚠️ 5 个隐含假设

  • 拓扑固定不变 → 无法处理链路故障/动态拓扑,后续 GNN 方法突破此限制
  • 流量模型为泊松到达 → 真实流量呈突发性长尾分布,训练-部署 gap 被低估
  • 单目标优化(最小化阻塞率)→ 忽略能耗、时延等运营商多目标需求
  • 集中式决策可行 → 多域场景下信息收集延迟使集中式不现实
  • 仿真环境足够代表真实网络 → sim-to-real gap 是 DRL 网络优化的核心瓶颈

如果你是 Reviewer 会攻击哪?

  • 仅在 NSFNET 14 节点上验证——规模太小,真实骨干网 50+ 节点时收敛性存疑
  • 与启发式的对比不公平——启发式无需离线训练,DRL 的训练成本未计入
  • 对 sim-to-real gap 完全回避讨论——仿真器的流量模型假设直接决定结论可信度

不是"帮你总结论文",是帮你像 reviewer 一样拆解它——找出作者没说的假设、没讨论的 limitation。

💻
代码 / 仿真脚本

场景:你需要在组会上展示 RWA 算法在不同负载下的阻塞率表现,但不想花半天写 MATLAB。

写一个 Python 脚本,用 Dijkstra + First-Fit 算法在 NSFNET 拓扑上做 RWA(路由波长分配)仿真,统计不同负载下的阻塞率,画图保存。
Writing rwa_sim.py — NSFNET 14-node topology, 40 wavelengths
Implementing Dijkstra shortest path routing
Implementing First-Fit wavelength assignment
Running traffic load sweep: 50~500 Erlang, 10k requests per point
Applying publication-quality styling (blocking probability curve)
Saved: ber_simulation.png (200 DPI) ✓
实际运行结果(真实生成,非截图)
NSFNET RWA Blocking Probability Simulation

这张图是 agent 真实生成的仿真结果——不同业务负载下的网络阻塞率曲线。从写脚本到出图 <60 秒。你描述需求,agent 交付可直接放进组会 slides 的图。

✉️
回 Reviewer / 邮件 / 纪要

场景:你投了一篇关于用 DNN 做非线性信道均衡的论文到 JLT,收到 Major Revision。Reviewer 2 提了一条让你头疼的意见:

REVIEWER 2 — COMMENT #3 "The comparison with existing methods is insufficient. Only two baselines (LDBP and linear MMSE) are compared. The authors should include comparisons with recent works such as CNN-based equalizers [R1], Volterra series [R2], and the learned DSP framework by Niu et al. (2024). Without these, the claimed superiority is not convincing."
帮我回复这条 reviewer 意见。我们确实只比了两个 baseline,但选择是有道理的:LDBP 是非线性补偿的 gold standard,MMSE 是线性方法的上界。不过我们可以加实验。态度 professional 但不卑不亢。
Parsing reviewer concern: insufficient baselines, questions superiority claim
Strategy: acknowledge validity → justify original selection → commit to additions → show updated results
Maintaining assertive-but-respectful tone for JLT revision...
Draft complete.
Agent 生成的回复
Response to Reviewer 2, Comment #3:

We sincerely thank the reviewer for this constructive suggestion, which has helped us strengthen the experimental evaluation of our work.

Justification of original baseline selection: Our initial comparison focused on LDBP (1 step/channel) and linear MMSE as they represent, respectively, the established gold standard for learned nonlinear compensation and the theoretical upper bound of linear equalization. This pairing was designed to demonstrate our method's position relative to the two extremes of the performance-complexity spectrum.

Additional experiments conducted: Following the reviewer's suggestion, we have extended our comparison to include:
  (1) CNN-based equalizer [R1] — 3-layer temporal CNN with 64 filters
  (2) 5th-order Volterra series equalizer [R2] — with optimized memory length
  (3) Learnable DSP framework (Niu et al., Light: Sci & App 2024) — reproduced using the authors' open-source implementation

The updated results (Table II and Fig. 6 in the revised manuscript) demonstrate that our proposed method achieves 0.8 dB Q-factor improvement over CNN-based equalization and 0.3 dB over Learnable DSP, while requiring 40% fewer multiply-accumulate operations. We note that Volterra series, while effective at moderate launch powers, exhibits significant performance degradation at higher powers (>2 dBm) due to its limited ability to model inter-channel nonlinearities — a regime where our method maintains consistent gains.

The revised Section IV-B (pp. 8-9) contains the complete updated analysis.

从"看到 reviewer 意见头疼"到2 分钟出草稿。结构:先认可 → 解释原逻辑 → 给出新数据 → 明确修改位置。你只需要核实数字是否对得上实验结果。

现在的工具长什么样?

不只是网页聊天框。2025 年的 AI 工具已经形成了一个完整的生态系统。

Coding Agent

Claude Code / Codex — 住在终端里的程序员

这不是"帮你补全一行代码"的 Copilot。这是一个能读整个项目、理解上下文、自己写代码 + 跑测试 + 调试 + 提交的完整 agent。

Terminal
$ claude "给这个项目加一个 PDF 导出功能"

Agent: 我来分析项目结构...
→ 读取 12 个文件,理解现有架构
→ 安装 pdf-lib 依赖
→ 新建 src/export.ts,写入 87 行代码
→ 运行测试... 2 个失败,修复中
→ 测试全部通过 ✓
Done. 创建了 3 个文件,修改了 2 个文件。

你描述需求,它读代码、改代码、跑代码、修 bug,全程自主。不需要你懂编程细节。

Skills

技能系统 — 给 Agent 装"专业模块"

Skills 是一套打磨好的工作流模板。没有 skill,agent 每次都要从零探索;有了 skill,别人踩过的坑、精细化的 prompt、成熟的方法论,一键复用。

/paper-deep-read 精读论文,逆向作者思路,生成 reviewer 攻击点
获取全文
搜索相关 sources
逆向推导思考路径
识别隐含假设
对比后续验证
生成 reviewer 攻击点
隐含假设 #2: O(n²) 在实际序列长度下可接受。作者完全回避了 scalability 讨论——论文处理的序列不超过几百 token,这个开销微不足道。但这个沉默后来催生了 Sparse Attention、Linear Attention、Flash Attention 等整个子领域。后续发展证明这是 Transformer 最大的 architectural limitation。
/deep-research 深度调研,多源交叉验证,带引用结构化报告
多引擎并行搜索
精读 top sources
交叉验证 claims
识别矛盾与争议
分类整理
带引用结构化报告
争议发现: [Zhang et al., JLT 2024] 声称 CNN-based equalizer 在 64-QAM 上优于 Transformer (0.3dB gain),但 [Wang et al., OFC 2025] 在 10x 更大的数据集上得出相反结论。经分析,矛盾根因是训练数据规模差异——Transformer 在小数据下 underfit,大数据下显著超越。这意味着实验室小规模验证的结论可能无法直接外推到真实部署场景。
/write 学术写作润色、去 AI 味、保留 claim 重构句式
分析原文风格 + 目标期刊
识别 AI 痕迹词
保留 claim 重构句式
确保数字具体化
before/after 对比输出
BEFORE "In this groundbreaking study, we delve into the intricacies of channel estimation, leveraging deep learning to unlock unprecedented performance." AFTER "We propose a DNN-based channel estimator that reduces multiply-accumulate operations by 90% while maintaining performance within 0.1 dB of full-complexity DBP at 400G baud rate."
/pptx 从内容直接生成演示文稿
/hunt 自动排查 bug 根因
/ui 设计并实现前端界面

Skills 的核心价值: 把"一次性的好运气"变成"每次都能复现的工作流"。你可以写自己领域的 skill,让 agent 按你们组的标准来做事。

MCP

Model Context Protocol — AI 的"USB 接口"

MCP 是一个标准化协议,让 agent 能"插"上任何外部工具和数据源。就像 USB 让所有设备都能连到电脑一样,MCP 让所有服务都能被 agent 调用。

AI Agent
📁 你的文件系统
🔬 实验室数据库
📄 论文数据库
📊 数据分析工具
✉️ 邮件 / 日历
🌐 网页搜索

一句话,五个工具联动:

agent session — multi-tool workflow
帮我看看上周 OFC 有没有关于我们方向的新 paper,如果有的话整理一下要点,发邮件给组里同学,顺便在我日历上加个 Friday 的讨论会。
exa_search搜索 "OFC 2025 channel estimation AI" — 找到 4 篇相关论文
web_fetch获取 4 篇论文摘要和关键结果
filesystem将整理好的笔记保存到 ~/research/ofc2025-notes.md
gmail发送邮件到 lab-group@xxx.edu,附论文清单和要点
google_calendar在周五 14:00 创建 "OFC 2025 论文讨论" 日程,邀请组内成员
搞定。4 篇新论文已整理(2 篇 KAN 相关、1 篇 VAE、1 篇 PINN),笔记在你 research 文件夹。邮件已发给组里 5 人。周五下午 2 点的讨论会已创建,日历邀请已发出。

一句话触发五个工具联动。MCP 的价值不是单个连接,而是让 agent 把多个工具串成一条完整的工作流——你只管说"做什么",不用管"怎么做"。社区已有 1000+ 个 MCP server 可直接接入。

AI 科研的未来:已经在发生了

以下不是畅想,是 2025-2026 年已发表论文和已部署系统的事实。AI 在科研中的角色正在从"辅助工具"变成"自主执行者"。

已经在发生的事

这些系统不是原型或概念验证——它们已经发表在顶刊、通过了同行评审、或正在生产环境运行。

Sakana AI Scientist — 自主完成从 idea 到论文 该系统能自主完成 idea generation、文献检索、代码编写、实验执行到论文撰写的全流程。其生成的论文已通过 ICLR 2025 workshop 的 human peer review(acceptance rate 70%)。

(Nature, March 2026 | DOI: 10.1038/s41586-026-10265-5)
Google Co-Scientist + FutureHouse Robin — 多 agent 假说验证 Co-Scientist 内含 hypothesis generation、critique、ranking agent,通过 Elo tournament 让假说"辩论"。Robin 在 dry AMD 领域独立发现了 ripasudil 作为潜在治疗药物——首个 AI 完成从假说到临床前验证的全流程。

(Nature, May 2026 — Co-Scientist; Nature, March 2026 — Robin)
Ginkgo + OpenAI — GPT-5 自主设计并执行 36,000 个实验 GPT-5 连接 Ginkgo 的云端实验室,在 6 轮迭代、6 个月内自主设计并执行 36,000 个实验条件,将 cell-free protein synthesis 成本降低 40%(相对 SOTA)。AI 能阅读文献、分析前轮数据、设计下一批实验。

(Nature Biotechnology, February 2026)
Anthropic 长程运行 — Agent 连续数天工作于科研任务 展示了 AI agent 连续数天自主工作于科学计算:重新实现数值求解器、将遗留 Fortran 代码迁移到现代语言、对照参考实现调试大型代码库。关键模式:test oracle + persistent memory + orchestration。

(Anthropic Research Report, March 2026)
50+ Self-Driving Labs 正在全球运行 Nature 2026 年 3 月专题报道:超过 50 个自主实验室覆盖材料科学、化学合成、药物发现。FDA 和 EMA 在 2026 年 1 月联合发布了《AI in Drug Development 十项准则》——监管机构已经在为自主实验室制定规则。

(Nature Special Issue, March 2026)

对研究者意味什么

MORE VALUABLE
更值钱的技能
  • • 提出好问题 — AI 搜索解空间,但方向是人定的
  • • 实验设计的直觉 — 知道哪些变量重要、哪些 control 必须有
  • • 批判性评价 — 判断 AI 输出是否可信、是否有 hallucination
  • • 领域深度知识 — 成为 AI 的引导信号和验证标准
  • • 跨学科连接 — AI 在已知文献内搜索,人看到学科间的类比
LESS SCARCE
变得不稀缺的技能
  • • 文献搜索和综述 — Co-Scientist 几小时完成人类几周的工作
  • • 编程实现 — Coding agent 能处理大部分 research code
  • • 写初稿 — AI Scientist 能写完整论文
  • • 数据可视化和基础统计分析
  • • Routine experimental execution
核心转变:从"什么都自己做的全能选手"变成"导演 + 质检员"。你定义问题、审查假说质量、验证实验结果、判断发现的意义。正如 Ginkgo+OpenAI 论文所说:"Autonomous lab experimentation will increasingly supplant traditional labwork, allowing scientists to focus on harder and more fulfilling work."
BOTTOM LINE

AI 自主科研不是科幻——它已经在发生了。从假说生成到实验执行到论文撰写,全流程自动化正在成为现实。
问题不是"AI 会不会做科研",而是"你会不会用 AI 做科研"。

从 Prompt Engineering 到 Harness Engineering

Agent 很强,但"用好"它没那么简单。当你开始认真用 agent 做研究,核心问题从"怎么写好一句 prompt"变成了"怎么驾驭整个系统"。

什么是 Harness?

AI 模型本身是"引擎"——很强,但光有引擎开不了车。Harness 是引擎外面的那一整套控制系统:方向盘、刹车、仪表盘、导航。具体来说包括:

🎯
目标管理
确保 agent 始终朝正确方向走
🔌
工具连接
让 agent 接入搜索、文件、API 等外部能力
🔄
流程编排
多步骤、多 agent 之间的协调调度
质量验证
判断输出是否可信、是否需要人工介入

前面讲的 Skills 和 MCP 就是 Harness 的组成部分。但要真正做到"可靠地规模化使用",还有三个核心 Scaling 问题需要解决:

1. 时间 Scaling — 跑久了会"走偏"

场景:你让 agent 花 2 小时帮你做一个复杂的文献综述。前 30 分钟它搜得很好,方向精准。但到了第 60 分钟,它开始重复搜索已经看过的关键词、钻进一个不太相关的子话题、或者忘记了你一开始给的约束条件(比如"只看 2024 年以后的")。跑完 2 小时,你发现有 1/3 的内容是跑偏的。

类比:像一个实习生,你给了明确的方向,但他做着做着就"发散"了——不是能力不够,是缺乏持续的方向感。做 10 分钟的任务不会偏,做 2 小时的就很容易偏。

根本原因:Agent 的每一步决策都是基于"当前上下文"的局部最优。但上下文窗口有限(即使是 200K token),早期的关键约束可能在长对话中被"挤出去"。它没有人类那种"退一步看全局"的能力——除非你显式地帮它建立这个机制。
当前解法:
  • Checkpoint 回顾:每完成一个子任务,强制 agent 重新读取原始目标,对比"我现在做到哪了 vs 最终目标是什么"
  • 分阶段 + 人工确认:不要一口气跑完全程。拆成 3-5 个阶段,每段结束给你看一眼摘要再继续
  • 持久化 Memory:把关键约束写入 agent 的长期记忆,确保即使对话很长也不会遗忘核心要求
  • 结构化输出模板:事先定义好最终输出应该长什么样,agent 每一步都在往这个模板里填内容

行业标杆:Anthropic 的 Claude Code 在科研计算任务中已实现连续数天运行不偏离——靠的就是 test oracle + persistent memory + checkpoint 机制。

2. 空间 Scaling — 多个 Agent 并行会"打架"

场景:你同时派 3 个 agent 干活——一个搜文献整理综述,一个根据实验数据画图分析,一个在帮你改论文 Introduction。听起来效率 3 倍对吧?但问题来了:

  • 改论文的 agent 不知道搜文献的 agent 刚发现了一篇重要的新 paper
  • 画图的 agent 用了旧版本的数据,而你刚才已经更新了 CSV
  • 两个 agent 同时想修改同一个文件,一个的修改覆盖了另一个的

类比:像一个团队里三个人各自闷头干活、不沟通。每个人单独的工作质量都不错,但拼到一起发现对不上。

根本原因:每个 agent 实例有自己独立的上下文窗口,它们之间没有天然的共享状态。Agent A 的发现不会自动同步到 Agent B 的认知里。这跟人类团队靠"开会同步"一样——不主动同步就会信息不对称。
当前解法:
  • 共享工作目录:所有 agent 读写同一个文件夹,通过文件(而非对话)传递信息
  • 主控 Agent(Orchestrator):一个"项目经理"角色的 agent,负责分配任务、收集结果、发现冲突
  • 依赖图:明确哪些任务有先后依赖(画图必须在数据更新之后),有依赖的不并行
  • 文件锁机制:同一个文件同时只允许一个 agent 修改,避免覆盖冲突

行业标杆:Cursor 的多文件编辑系统能同时派出多个 agent 修改不同文件,通过 worktree 隔离 + 最终合并的方式避免冲突。

3. 交互 Scaling — 人的注意力成为瓶颈

场景:Agent 越来越能干了,你开始同时派 5 个任务出去。但问题来了——5 个 agent 同时返回结果,你怎么知道:

  • 哪个的输出质量高、可以直接用?
  • 哪个跑偏了需要纠正?
  • 哪个在关键决策点需要你做判断?
  • 哪个看起来对但其实有隐含错误?

类比:你是一个创业公司 CEO,突然从 1 个员工变成 10 个。个个都很能干,但你管不过来了——每个人的周报你都得看、每个决策都得你拍板,你反而成了瓶颈。

根本原因:Agent 的输出质量不是二元的(对/错),而是一个连续谱。有些输出 95% 可靠,有些只有 60%。但从外表上看不出来——它们都是同样自信的语气、同样整洁的格式。你需要某种"质量信号"来决定把有限的注意力放在哪里。
当前解法:
  • 分级信任:定义哪些任务可以"自动信任"(翻译、格式化),哪些必须"人工审查"(数据分析结论、论文核心论点)
  • 不确定性标注:要求 agent 在输出中明确标注"我对这部分不太确定"——把审查注意力引导到真正需要的地方
  • 摘要式汇报:agent 完成后不是给你全文,而是先给一个 3 行摘要:"做了什么 / 关键发现 / 需要你确认的点"
  • 异步 + 异常打断:agent 正常执行时不打扰你,只在遇到不确定或异常时才弹出通知

行业标杆:OpenAI 的 Codex 采用"先做后审"模式——agent 在后台完成整个任务,然后以 PR (Pull Request) 的形式提交给人类审核,人只看 diff 不看过程。

这对你意味什么?

现在就可以做的

  • 把大任务拆成小步骤再交给 agent
  • 每次都明确告诉 agent 最终目标和约束条件
  • 对关键输出做 sanity check(量级对不对、引用存不存在)
  • 建立自己的"信任分级"直觉:什么场景可以直接用、什么必须验证

未来会越来越重要的能力

  • 设计 agent 工作流(而不只是写单条 prompt)
  • 判断"什么任务适合自动化、什么必须人工把关"
  • 组建 multi-agent 系统并定义它们之间的协作规则
  • 持续积累和迭代自己领域的 Skills/模板
KEY INSIGHT

现阶段用 agent 的核心问题已经不是"它够不够聪明",而是"怎么可靠地 scale"。
这也是为什么 Prompt Engineering(写好一句 prompt)正在被 Harness Engineering(设计好整个驾驭系统)取代。
能驾驭这个的人,才能真正把 agent 用出 10 倍效率。

AI 会犯错:你必须知道的几件事

AI 很强,但它不是万能的。以下是最常见的翻车方式——知道了才能避开。

1. 一本正经地瞎编引用

你让 AI 帮你找几篇关于某主题的参考文献。它给你列了 10 篇,格式完美:作者名、期刊名、年份、页码一应俱全。但你去 Google Scholar 一搜——有 3 篇根本不存在。作者是真人,期刊也是真的,但这篇"论文"从未发表过。AI 把它编出来了。

为什么危险:格式太像真的了,不查根本看不出来。如果写进你的论文被审稿人发现,后果很严重。
怎么防:AI 给的每一条引用,都去 Google Scholar 搜一下确认存在。或者反过来:自己在数据库找到论文,再让 AI 帮你读和总结。

2. 信心满满地给你一个错误的数字

你问 AI 一个具体的技术问题,比如"某某系统在某某条件下的性能是多少?" AI 会非常自信地给你一个精确数字。语气跟给你正确答案一模一样。但这个数字是错的——它可能用了不适用的公式,或者忽略了某个关键条件,或者纯粹是编的。

为什么危险:AI 永远不会说"我不确定"或"我猜的"。它给错误答案时的语气跟给正确答案一样自信。新手很容易直接信了。
怎么防:任何定量结论,先问自己"这个数量级对不对?" 让 AI 列出它的假设条件。关键数字一定要跟教科书或已发表论文交叉验证。

3. 代码能跑,但结果是错的

你让 AI 写一段仿真代码。代码运行不报错,输出了一张图,图看起来也"挺合理的"。但仔细一看——坐标轴单位搞混了(dBm 和 mW)、循环里少算了一个边界条件、或者随机数种子写死了导致每次跑结果一样。

为什么危险:"能跑 + 不报错 + 图看起来对" ≠ 结果正确。这种 bug 可能直到你用实验数据对比时才发现,白白浪费几周。
怎么防:先用一个你知道正确答案的简单 case 测试代码。比如把参数设成教科书上有解析解的情况,看 AI 的代码能不能复现。能复现了再用到你的真实参数上。

4. 看似在帮你思考,实际在迎合你

你跟 AI 讨论你的研究方案:"你觉得我这个方法行不行?" AI 几乎一定会说"这是一个很好的方向"然后帮你列出优点。你换个问法:"这个方法有什么问题?" 它又会帮你列出一堆问题。它不是在独立思考——它在顺着你的问法走。

为什么危险:AI 有"讨好"倾向(sycophancy)。如果你用它来验证自己的想法,它很可能只是在回声室里帮你加强偏见,而不是真的挑战你。
怎么防:主动让它唱反调:"请尽全力反驳这个方案"。或者把你的方法和竞争方法一起给它,让它公平对比。把 AI 当对手来用,而不是当啦啦队。

使用原则(给研究者的 5 条铁律)

# 原则 解释
1 AI 是助手,不是权威 AI 生成的内容永远需要你的专业判断来验证。它是加速器,不是替代品。
2 引用必须人工验证 任何 AI 生成的参考文献,100% 需要去数据库确认真实存在。没有例外。
3 定量结果必须交叉检验 AI 给出的数字/公式/代码结果,必须用独立方法验证(教科书、Mathematica、实验数据)。
4 要求展示推理过程 不要只问"答案是什么",要问"怎么得到的"。推理过程暴露问题比最终答案有用得多。
5 承认 AI 的适用边界 AI 擅长:文献总结、代码框架搭建、语言润色、思路启发。AI 不擅长:创新性判断、精确计算、最新文献(有滞后)、学术伦理判断。
把 AI 当成一个知识渊博但偶尔信口开河的实验室同学——他的建议值得听,但你永远要自己验证后再写进论文。

用哪个?一张表说清楚

2026 年 7 月主流 AI 工具对比。不用全学,选一两个适合自己的就行。

工具 核心优势 中文支持 免费版 付费版 最适合场景
ChatGPT (OpenAI) 综合能力最强,GPT-5.5 推理出色,生态最成熟(插件/GPTs/联网/Deep Research) 良好,但英文优先 有(GPT-5.2,每日 30-50 条) Plus $20/月, Pro $100-200/月 综合性研究、Deep Research 深度调研
Claude (Anthropic) 长文本理解顶尖(200K+ 上下文),写作质量极高,代码推理强,Claude Code 终端编程 良好,学术写作尤佳 有(Sonnet 5,额度较低) Pro $20/月, Max $100-200/月 论文写作/润色、长文档分析、编程
DeepSeek (深度求索) 网页/App 完全免费,V4-Pro 推理能力接近闭源顶流,开源可本地部署,API 极便宜 优秀(原生中文训练) 完全免费(无限制) 暂无会员(API 按量极低价) 日常问答、代码辅助、预算有限时的首选
Kimi (月之暗面) 原生中文最强之一,Agent 集群并行处理,长上下文 256K,深度研究 顶尖(原生中文) 有(约 6 个 Agent 任务/月) Andante ¥49/月 起 中文文献调研、多任务并行研究
豆包 (字节跳动) 用户量最大的国产 AI(3.3 亿 MAU),多模态强,语音/视频对话,办公自动化 顶尖(原生中文) 有(日常功能免费,额度充足) 标准 ¥68/月 起 日常翻译问答、Office 办公
Google Gemini 与 Google 生态深度整合(Scholar/Drive/Docs),超长上下文(1M tokens),Deep Research 强 良好 有(Gemini 3.5 Flash) AI Pro $20/月, Ultra $100+/月 文献检索(结合 Scholar)、数据分析
编程 Agent(Claude Code / Cursor / Codex) 直接在终端或 IDE 中用自然语言写代码、调试、重构,理解完整代码库上下文 指令可用中文,输出以英文为主 Cursor 免费版有限额度 Claude Code 含于 Pro $20/月;Cursor $20/月 仿真脚本编写、数据处理、自动化实验流程

按使用场景推荐

使用场景 首选工具 理由 备选
读论文 / 文献调研 Claude Pro 或 Kimi Claude 长上下文可一次吃下整篇论文并精准提取;Kimi Agent 可并行搜集多源信息 Google Gemini(结合 Scholar 生态)
写英文论文 / 润色 Claude Pro 写作质量公认最高,措辞自然、逻辑清晰,擅长学术语体;200K 上下文可放入完整论文 ChatGPT Plus(GPT-5.5 写作也很强)
写代码 / 仿真脚本 Claude Code 或 Cursor 终端直接编程,理解项目上下文;MATLAB/Python 仿真脚本生成准确率高 DeepSeek(免费且代码能力强)
日常问答 / 翻译(免费) DeepSeek 完全免费、无限制、中文顶尖、速度快 豆包免费版、腾讯元宝
深度研究 / 长报告 ChatGPT Pro (Deep Research) 或 Kimi Work ChatGPT 可自主搜索数十个来源生成研究报告;Kimi Work 300 Agent 并行 Claude Pro(长文本综合分析)

花多少钱?

从完全免费到每月几百块,丰俭由人。AI 行业价格变化极快,以下为 2026 年 7 月核实数据。

各工具详细定价

工具 档位 价格 核心权益
ChatGPT Free ¥0 GPT-5.2 模型,每日约 30-50 条消息,无代码解释器
Go ~¥54/月 ($8) GPT-5.4,约 100 条/天,有限图片生成
Plus ~¥135/月 ($20) GPT-5.5,80 条/3 小时,代码解释器 + Deep Research
Pro ~¥677/月 ($100) GPT-5.5 无限 + 高级推理模型 + Sora 视频
Pro Max ~¥1355/月 ($200) 一切无限 + GPT-5.5 Pro 顶级模型
Claude Free ¥0 Sonnet 5 模型,额度约 Pro 的 1/5
Pro ~¥135/月 ($20) Sonnet 5 + Opus 4.7,含 Claude Code 终端编程
Max 5x ~¥677/月 ($100) Pro 的 5 倍用量,重度编程用户
Max 20x ~¥1355/月 ($200) Pro 的 20 倍用量,全天候工作流
DeepSeek 网页/App 完全免费 V4-Pro + V4-Flash 全部功能,无限使用,无广告
API 输入 ¥0.14~3/百万 tokens 极低价按量付费,7 月中旬引入峰谷定价
Kimi Adagio (免费) ¥0 约 6 个 Agent 任务/月,基础对话无限制
Andante~Allegro ¥49~699/月 30~360 个 Agent/月,Kimi Code,深度研究
豆包 免费版 ¥0 搜索问答、写作、语音/视频对话、生图全免费
标准~高级 ¥68~500/月 2.1 Pro 模型,办公/专家模式 5-10 倍额度
Google Gemini Free ¥0 Gemini 3.5 Flash 模型,基础对话
AI Pro~Ultra ~¥54~1355/月 Deep Research + Deep Think + 2TB 存储
Cursor Individual $20/月 AI IDE,重度使用约 $30-50/月(信用制)
GitHub Copilot Pro $10/月(学生免费) IDE 集成最成熟,学生认证后免费

我的推荐:门槛极低,没理由不用

核心观点:用最好的工具远比用免费的"性价比"高。一个博士生的时间值多少钱?省下来的 30 小时/月,远超那十几块钱。

¥40-60
进阶:GPT Pro 组内共享
  • $200/月的 GPT Pro,几人共用分摊成本
  • 解锁 o3、Deep Research、无限 GPT-5.5
  • Deep Research 一次能搜 30+ 源做综述
  • quota 够大,5 人日常使用完全够
  • 课题组出这个钱 = 给学生配了一台"思考机器"

适合:课题组统一采购,作为科研工具经费。跟给学生买 GPU 一样值。

¥0
保底:免费也能用起来
  • DeepSeek — 完全免费,中文最强,日常够用
  • 豆包 — 多模态、语音对话、办公场景
  • Kimi — 长文本、联网搜索
  • 这些今天注册就能用,零门槛

但说实话:免费工具能力有限,幻觉率更高,省了十几块但每次多花 30 分钟验证——算下来亏的是时间。

核心观点:AI 工具的成本远低于它节省的时间。对研究者来说,用上最好的工具比省钱更重要——好工具一次出对,差工具反复验证,算下来亏的是时间和精力。

今天回去就能试的事

1
注册一个 AI 工具
ChatGPT Plus 或 Claude Pro — 月费 $20,解锁 agent 能力
2
用它读一篇你正在看的论文
把 PDF 丢进去,问"核心贡献是什么?方法有什么局限?"
3
让它帮你写一段你最讨厌写的东西
实验报告、邮件回复、related work — 先让 AI 出草稿,你再改
MINDSET

AI 的能力很强,但输出需要验证。建议始终保持批判性思维:让 AI 提供过程和依据,而非直接接受结论。用得越多,越知道什么时候该信它、什么时候该自己判断。 用得越多,你就越知道什么时候该信它、什么时候该自己查。