从对话工具到科研助手,AI 正在改变研究者的工作方式。
这次分享聊聊:它现在能做什么,怎么用,以及未来会走向哪里。
王昊卿
北京邮电大学 · 微软亚洲研究院
2026.07
今天聊什么
AI 从"网页聊天框"变成了"住在你电脑里的助手"。三个根本性的变化:
import numpy as np
import matplotlib.pyplot as plt
data = pd.read_csv('data.csv')...pip install scipy它是一种新的工作方式。区别在于这四件事:
点击展开,看看每个场景下你和 agent 的实际交互是什么样的。
2024-2025 年,深度强化学习驱动的光网络资源优化进入"从离线规划走向在线实时决策"的关键转折期。DRL-based RMSA 在阻塞率上较传统启发式降低 30-50%;GNN 拓扑感知方法首次实现跨网络零样本迁移;Transformer 流量预测精度突破 95%,为提前资源预留奠定基础。
这份报告是 agent 刚才真实搜索网络后生成的——24 篇真实论文引用,来自 JLT/JOCN/OFC/ECOC 等光网络顶级期刊会议。耗时 ~3 分钟。
每页都有 speaker notes,打开就能讲。
这是 agent 真实生成的 .pptx 文件——写代码调用 python-pptx → 排版 → 输出。你可以直接下载打开看。
不是"RMSA 问题没人做",而是 传统启发式算法无法适应动态流量模式。K-SP + First-Fit 在静态场景足够好,但面对时变业务到达时阻塞率急剧恶化——需要一种能"看到全局状态并学习长期策略"的方法。
不是"帮你总结论文",是帮你像 reviewer 一样拆解它——找出作者没说的假设、没讨论的 limitation。
场景:你需要在组会上展示 RWA 算法在不同负载下的阻塞率表现,但不想花半天写 MATLAB。
这张图是 agent 真实生成的仿真结果——不同业务负载下的网络阻塞率曲线。从写脚本到出图 <60 秒。你描述需求,agent 交付可直接放进组会 slides 的图。
场景:你投了一篇关于用 DNN 做非线性信道均衡的论文到 JLT,收到 Major Revision。Reviewer 2 提了一条让你头疼的意见:
从"看到 reviewer 意见头疼"到2 分钟出草稿。结构:先认可 → 解释原逻辑 → 给出新数据 → 明确修改位置。你只需要核实数字是否对得上实验结果。
不只是网页聊天框。2025 年的 AI 工具已经形成了一个完整的生态系统。
这不是"帮你补全一行代码"的 Copilot。这是一个能读整个项目、理解上下文、自己写代码 + 跑测试 + 调试 + 提交的完整 agent。
你描述需求,它读代码、改代码、跑代码、修 bug,全程自主。不需要你懂编程细节。
Skills 是一套打磨好的工作流模板。没有 skill,agent 每次都要从零探索;有了 skill,别人踩过的坑、精细化的 prompt、成熟的方法论,一键复用。
/paper-deep-read
精读论文,逆向作者思路,生成 reviewer 攻击点
/deep-research
深度调研,多源交叉验证,带引用结构化报告
/write
学术写作润色、去 AI 味、保留 claim 重构句式
/pptx 从内容直接生成演示文稿/hunt 自动排查 bug 根因/ui 设计并实现前端界面Skills 的核心价值: 把"一次性的好运气"变成"每次都能复现的工作流"。你可以写自己领域的 skill,让 agent 按你们组的标准来做事。
MCP 是一个标准化协议,让 agent 能"插"上任何外部工具和数据源。就像 USB 让所有设备都能连到电脑一样,MCP 让所有服务都能被 agent 调用。
一句话,五个工具联动:
一句话触发五个工具联动。MCP 的价值不是单个连接,而是让 agent 把多个工具串成一条完整的工作流——你只管说"做什么",不用管"怎么做"。社区已有 1000+ 个 MCP server 可直接接入。
以下不是畅想,是 2025-2026 年已发表论文和已部署系统的事实。AI 在科研中的角色正在从"辅助工具"变成"自主执行者"。
这些系统不是原型或概念验证——它们已经发表在顶刊、通过了同行评审、或正在生产环境运行。
Agent 很强,但"用好"它没那么简单。当你开始认真用 agent 做研究,核心问题从"怎么写好一句 prompt"变成了"怎么驾驭整个系统"。
AI 模型本身是"引擎"——很强,但光有引擎开不了车。Harness 是引擎外面的那一整套控制系统:方向盘、刹车、仪表盘、导航。具体来说包括:
前面讲的 Skills 和 MCP 就是 Harness 的组成部分。但要真正做到"可靠地规模化使用",还有三个核心 Scaling 问题需要解决:
场景:你让 agent 花 2 小时帮你做一个复杂的文献综述。前 30 分钟它搜得很好,方向精准。但到了第 60 分钟,它开始重复搜索已经看过的关键词、钻进一个不太相关的子话题、或者忘记了你一开始给的约束条件(比如"只看 2024 年以后的")。跑完 2 小时,你发现有 1/3 的内容是跑偏的。
类比:像一个实习生,你给了明确的方向,但他做着做着就"发散"了——不是能力不够,是缺乏持续的方向感。做 10 分钟的任务不会偏,做 2 小时的就很容易偏。
行业标杆:Anthropic 的 Claude Code 在科研计算任务中已实现连续数天运行不偏离——靠的就是 test oracle + persistent memory + checkpoint 机制。
场景:你同时派 3 个 agent 干活——一个搜文献整理综述,一个根据实验数据画图分析,一个在帮你改论文 Introduction。听起来效率 3 倍对吧?但问题来了:
类比:像一个团队里三个人各自闷头干活、不沟通。每个人单独的工作质量都不错,但拼到一起发现对不上。
行业标杆:Cursor 的多文件编辑系统能同时派出多个 agent 修改不同文件,通过 worktree 隔离 + 最终合并的方式避免冲突。
场景:Agent 越来越能干了,你开始同时派 5 个任务出去。但问题来了——5 个 agent 同时返回结果,你怎么知道:
类比:你是一个创业公司 CEO,突然从 1 个员工变成 10 个。个个都很能干,但你管不过来了——每个人的周报你都得看、每个决策都得你拍板,你反而成了瓶颈。
行业标杆:OpenAI 的 Codex 采用"先做后审"模式——agent 在后台完成整个任务,然后以 PR (Pull Request) 的形式提交给人类审核,人只看 diff 不看过程。
现在就可以做的
未来会越来越重要的能力
AI 很强,但它不是万能的。以下是最常见的翻车方式——知道了才能避开。
你让 AI 帮你找几篇关于某主题的参考文献。它给你列了 10 篇,格式完美:作者名、期刊名、年份、页码一应俱全。但你去 Google Scholar 一搜——有 3 篇根本不存在。作者是真人,期刊也是真的,但这篇"论文"从未发表过。AI 把它编出来了。
你问 AI 一个具体的技术问题,比如"某某系统在某某条件下的性能是多少?" AI 会非常自信地给你一个精确数字。语气跟给你正确答案一模一样。但这个数字是错的——它可能用了不适用的公式,或者忽略了某个关键条件,或者纯粹是编的。
你让 AI 写一段仿真代码。代码运行不报错,输出了一张图,图看起来也"挺合理的"。但仔细一看——坐标轴单位搞混了(dBm 和 mW)、循环里少算了一个边界条件、或者随机数种子写死了导致每次跑结果一样。
你跟 AI 讨论你的研究方案:"你觉得我这个方法行不行?" AI 几乎一定会说"这是一个很好的方向"然后帮你列出优点。你换个问法:"这个方法有什么问题?" 它又会帮你列出一堆问题。它不是在独立思考——它在顺着你的问法走。
| # | 原则 | 解释 |
|---|---|---|
| 1 | AI 是助手,不是权威 | AI 生成的内容永远需要你的专业判断来验证。它是加速器,不是替代品。 |
| 2 | 引用必须人工验证 | 任何 AI 生成的参考文献,100% 需要去数据库确认真实存在。没有例外。 |
| 3 | 定量结果必须交叉检验 | AI 给出的数字/公式/代码结果,必须用独立方法验证(教科书、Mathematica、实验数据)。 |
| 4 | 要求展示推理过程 | 不要只问"答案是什么",要问"怎么得到的"。推理过程暴露问题比最终答案有用得多。 |
| 5 | 承认 AI 的适用边界 | AI 擅长:文献总结、代码框架搭建、语言润色、思路启发。AI 不擅长:创新性判断、精确计算、最新文献(有滞后)、学术伦理判断。 |
2026 年 7 月主流 AI 工具对比。不用全学,选一两个适合自己的就行。
| 工具 | 核心优势 | 中文支持 | 免费版 | 付费版 | 最适合场景 |
|---|---|---|---|---|---|
| ChatGPT (OpenAI) | 综合能力最强,GPT-5.5 推理出色,生态最成熟(插件/GPTs/联网/Deep Research) | 良好,但英文优先 | 有(GPT-5.2,每日 30-50 条) | Plus $20/月, Pro $100-200/月 | 综合性研究、Deep Research 深度调研 |
| Claude (Anthropic) | 长文本理解顶尖(200K+ 上下文),写作质量极高,代码推理强,Claude Code 终端编程 | 良好,学术写作尤佳 | 有(Sonnet 5,额度较低) | Pro $20/月, Max $100-200/月 | 论文写作/润色、长文档分析、编程 |
| DeepSeek (深度求索) | 网页/App 完全免费,V4-Pro 推理能力接近闭源顶流,开源可本地部署,API 极便宜 | 优秀(原生中文训练) | 完全免费(无限制) | 暂无会员(API 按量极低价) | 日常问答、代码辅助、预算有限时的首选 |
| Kimi (月之暗面) | 原生中文最强之一,Agent 集群并行处理,长上下文 256K,深度研究 | 顶尖(原生中文) | 有(约 6 个 Agent 任务/月) | Andante ¥49/月 起 | 中文文献调研、多任务并行研究 |
| 豆包 (字节跳动) | 用户量最大的国产 AI(3.3 亿 MAU),多模态强,语音/视频对话,办公自动化 | 顶尖(原生中文) | 有(日常功能免费,额度充足) | 标准 ¥68/月 起 | 日常翻译问答、Office 办公 |
| Google Gemini | 与 Google 生态深度整合(Scholar/Drive/Docs),超长上下文(1M tokens),Deep Research 强 | 良好 | 有(Gemini 3.5 Flash) | AI Pro $20/月, Ultra $100+/月 | 文献检索(结合 Scholar)、数据分析 |
| 编程 Agent(Claude Code / Cursor / Codex) | 直接在终端或 IDE 中用自然语言写代码、调试、重构,理解完整代码库上下文 | 指令可用中文,输出以英文为主 | Cursor 免费版有限额度 | Claude Code 含于 Pro $20/月;Cursor $20/月 | 仿真脚本编写、数据处理、自动化实验流程 |
| 使用场景 | 首选工具 | 理由 | 备选 |
|---|---|---|---|
| 读论文 / 文献调研 | Claude Pro 或 Kimi | Claude 长上下文可一次吃下整篇论文并精准提取;Kimi Agent 可并行搜集多源信息 | Google Gemini(结合 Scholar 生态) |
| 写英文论文 / 润色 | Claude Pro | 写作质量公认最高,措辞自然、逻辑清晰,擅长学术语体;200K 上下文可放入完整论文 | ChatGPT Plus(GPT-5.5 写作也很强) |
| 写代码 / 仿真脚本 | Claude Code 或 Cursor | 终端直接编程,理解项目上下文;MATLAB/Python 仿真脚本生成准确率高 | DeepSeek(免费且代码能力强) |
| 日常问答 / 翻译(免费) | DeepSeek | 完全免费、无限制、中文顶尖、速度快 | 豆包免费版、腾讯元宝 |
| 深度研究 / 长报告 | ChatGPT Pro (Deep Research) 或 Kimi Work | ChatGPT 可自主搜索数十个来源生成研究报告;Kimi Work 300 Agent 并行 | Claude Pro(长文本综合分析) |
从完全免费到每月几百块,丰俭由人。AI 行业价格变化极快,以下为 2026 年 7 月核实数据。
| 工具 | 档位 | 价格 | 核心权益 |
|---|---|---|---|
| ChatGPT | Free | ¥0 | GPT-5.2 模型,每日约 30-50 条消息,无代码解释器 |
| Go | ~¥54/月 ($8) | GPT-5.4,约 100 条/天,有限图片生成 | |
| Plus | ~¥135/月 ($20) | GPT-5.5,80 条/3 小时,代码解释器 + Deep Research | |
| Pro | ~¥677/月 ($100) | GPT-5.5 无限 + 高级推理模型 + Sora 视频 | |
| Pro Max | ~¥1355/月 ($200) | 一切无限 + GPT-5.5 Pro 顶级模型 | |
| Claude | Free | ¥0 | Sonnet 5 模型,额度约 Pro 的 1/5 |
| Pro | ~¥135/月 ($20) | Sonnet 5 + Opus 4.7,含 Claude Code 终端编程 | |
| Max 5x | ~¥677/月 ($100) | Pro 的 5 倍用量,重度编程用户 | |
| Max 20x | ~¥1355/月 ($200) | Pro 的 20 倍用量,全天候工作流 | |
| DeepSeek | 网页/App | 完全免费 | V4-Pro + V4-Flash 全部功能,无限使用,无广告 |
| API | 输入 ¥0.14~3/百万 tokens | 极低价按量付费,7 月中旬引入峰谷定价 | |
| Kimi | Adagio (免费) | ¥0 | 约 6 个 Agent 任务/月,基础对话无限制 |
| Andante~Allegro | ¥49~699/月 | 30~360 个 Agent/月,Kimi Code,深度研究 | |
| 豆包 | 免费版 | ¥0 | 搜索问答、写作、语音/视频对话、生图全免费 |
| 标准~高级 | ¥68~500/月 | 2.1 Pro 模型,办公/专家模式 5-10 倍额度 | |
| Google Gemini | Free | ¥0 | Gemini 3.5 Flash 模型,基础对话 |
| AI Pro~Ultra | ~¥54~1355/月 | Deep Research + Deep Think + 2TB 存储 | |
| Cursor | Individual | $20/月 | AI IDE,重度使用约 $30-50/月(信用制) |
| GitHub Copilot | Pro | $10/月(学生免费) | IDE 集成最成熟,学生认证后免费 |
核心观点:用最好的工具远比用免费的"性价比"高。一个博士生的时间值多少钱?省下来的 30 小时/月,远超那十几块钱。
适合:每个研究生都值得有一个,投入极低但收益显著。
适合:课题组统一采购,作为科研工具经费。跟给学生买 GPU 一样值。
但说实话:免费工具能力有限,幻觉率更高,省了十几块但每次多花 30 分钟验证——算下来亏的是时间。