方法手册 · 用 AI 辅助研究陌生领域

从“什么都不懂”到“做出有证据的决定”:九步调研法

这是一份操作手册。它教你在一个完全陌生的领域里,用 AI 做助手,在约 6–8 周内:先看懂这个领域,再找出值得研究的问题,主动查证自己的想法是不是已经有人做过、能不能成立,最后拿出一份可以支撑决策的结论——这个方向做,还是不做。

适合谁

要进入新领域的研究者;做科研选题的人;做技术或行业调研、需要判断方向的人。不限学科:从理工、医学到社科、人文等传统领域都适用,附录有分学科的对照。

你最终得到什么

一份 1–2 页的决策备忘录、一个 90 天行动计划、一套随时可以查证的证据库。

为什么不直接问 AI

AI 的回答流畅但可能出错,甚至编造文献;而且它倾向迎合你的想法。直接采信,选题会建在沙子上。

不适合什么

不是论文写作指南,也不是某个具体学科的教材;它解决的是“这个方向值不值得做”。

全篇只有三条核心思想

  1. AI 负责“加速和扩视野”,证据核验和最终取舍由人负责。
  2. 先把领域看懂,再提问题;先找问题,再想题目。
  3. 从一开始就设法证明自己错:找已有工作,做能否定课题的小实验。
第一部分

先弄清楚:研究到底要找什么

很多调研失败,是因为一开始就把目标搞错了。下面是这套方法的出发点。

研究的真正目标

  • 不是找一个“没人做过”的方法或概念组合。
  • 而是找到一个重要、尚未解决的问题,证明现有最好的方法仍有缺口,并确认你有条件去解决它。
  • 创新可以来自新问题、新机制、新方法、新数据、新评价方式或新的约束条件,不等于把方法或概念名词拼在一起。
  • 终点是一份决策备忘录(做 / 收缩 / 转向 / 放弃)加 90 天计划,而不是一篇论文。

五个最常见的误区

  • 文献空白 ≠ 研究问题。没人做,可能只是没人觉得值得,或者做不出来。
  • 高引论文 ≠ 前沿。新方向往往还没来得及积累引用。
  • “没搜到” ≠ “不存在”。只能说“在某数据库、某检索式、某时间窗下未发现”。
  • AI 会编造文献。它能帮你生成想法,不能替你确认事实和价值。
  • 多个 AI 说法一致 ≠ 已验证。它们可能共享相似的训练数据和偏差。
第二部分

九步总览

按顺序走。每一步都有明确的产出和过关标准,没过关就不要进入下一步。点任意方框可跳到详解。

参考节奏:兼职约 6–8 周,全职约一半时间(经验估计,见第三部分“时间与停止规则”)。

第三部分

九阶段详解

每个阶段先看“一句话”,再看“要做什么”和“过关标准”。

0

问题定义与资源盘点

先写清“要解决什么问题、我手里有什么牌”,不要先选方法或工具。

可用的 AI 提示词:附录 C2 · 阶段 0

  1. 写一页 Research Brief:研究对象、目标、已知现象、现有做法、为什么值得研究、成功标准。
  2. 建立 Resource Ledger(资源清单):列出你手头能用的资源,例如独有的资料或数据(档案、案例、田野点、样本)、访问权限、设备或场地、专家和同行网络、团队能力、时间与经费。其中别人难以复制的部分,就是你的优势。
  3. 写明“不预设答案”:此阶段先不决定用哪种理论、方法或技术路线,也不预设结论,只描述问题本身。
  4. 确定时间预算与决策人:这次调研要在多久内支撑谁做什么决定。
过关标准:不用任何解决方案的词,就能说清问题、受影响对象和成功标准;并能写出“如果结论是放弃,也算成功交付”这句话。
1

领域入门新增

先成为合格的外行,再让 AI 帮你扩展。

可用的 AI 提示词:附录 C2 · 阶段 1

进入陌生领域,最大的风险是“不知道自己不知道”:不懂术语,就搜不全,也看不出哪些结论重要;这时如果完全依赖 AI 的讲解,更难判断它说得对不对——AI 的叙述总是很流畅,但可能有误。所以先花一点时间读几份权威材料,拿到这个领域的基本框架,后面才能有判断力地使用 AI。

  1. 找 1–2 本教材或手册、2–3 篇近三年高质量综述,通读一遍,不求细节。
  2. 建术语表:30–50 个核心术语,写明同义词、旧称、缩写。后面所有检索式都从这里取词。
  3. 记下领域骨架:子方向、主流方法、常用数据或材料、公认评价标准、核心期刊会议和团队。
  4. 列出 3–5 个公认争议:各学派分歧在哪,各自依据是什么。
  5. 让 AI 当考官:基于你读过的材料出 10 道理解题,你答完再让它指出漏洞。AI 讲的事实性内容要回教材核对。
  6. 访谈 2–3 位领域人士(教授、从业者、博士生均可),固定问五个问题(见附录 C1)。
过关标准:能不看资料向外行讲 10 分钟;能说出 3 个公认难题、2 个争论、常用方法和评价标准;专家看过你的术语表和结构图,没指出重大遗漏。
2

双地图扫描

同时画两张图:现实里哪里有问题,文献里已经做到哪。

可用的 AI 提示词:附录 C2 · 阶段 2

先写检索方案(Search Protocol)

  • 记录:检索库、检索式(用术语表里的同义词、旧称、缩写)、时间窗、语言范围、纳入和排除标准、检索日期。
  • 语言至少覆盖中英文;若重要成果在其他语种,需补充。
  • 来源类型包括期刊、会议、预印本、学位论文、专利、技术报告。预印本等未评审文献要标注。

Problem Map(问题地图)要回答

  • 哪些问题最常出现、影响最大?
  • 障碍来自理论、数据、方法、测量、系统约束、外部环境,还是评价方式本身?
  • 现在通常怎么处理?为什么仍不够?(要有证据,不能只是“据说”)

Literature Map(文献地图)分四层

层内容
Foundational定义问题、经典范式,不限近 3–5 年
Representative主要技术路线与代表性工作
Frontier最近 12–24 个月的论文、预印本、Workshop
Negative / Limits失败结果、边界条件、被撤稿或被质疑的工作
过关标准:两张地图能互相对应;每个主要分支都有“现实问题—代表方法—当前边界”三件套;别人按你的检索方案能重跑出近似结果。
3

建证据库

把“读过很多”变成“随时能查证”。

可用的 AI 提示词:附录 C2 · 阶段 3

  1. 建文献库,核心来源取得全文。
  2. 填证据矩阵(字段见下表),每条标注证据等级和核验状态。
  3. 建断言台账(Claim Ledger):把准备写进报告的每个关键判断记成一行——断言内容、类型(事实 / 作者结论 / 你的推断)、来源与原文位置、证据等级、核验状态、核验人与日期。报告只能引用“已核验”的断言。
  4. 按饱和度停止,而不是按篇数:新检索的 10–20 条相关结果里几乎不再出现新的核心工作或新方法类别,且核心论文的参考文献与施引文献大部分已在库内。通常核心集合在几十到一百篇量级,视领域而定。

证据矩阵字段

类别字段
基本信息标题 / 年份 / 出处 / DOI 或链接 / 作者 / 文献类型(期刊·会议·预印本·专利…)
问题研究问题 / 场景 / 假设
方法方法或理论 / 基线 / 干预 / 对比对象
证据数据 / 样本 / 指标 / 结果 / 统计或定性证据
可验证性数据、材料或代码(如有)的可得性 / 许可 / 环境 / 是否被独立复现 / 是否被撤稿或更正
判断贡献 / 局限 / 相关度 / 证据等级 A–D / 核验状态
过关标准:随便指一个关键断言,1–2 分钟内能追溯到原始来源与原文位置;核心集合已达饱和;核验协议(第四部分)已执行。
4

从现象到研究问题,再选题

别让 AI 直接“编题目”,也别凭感觉选题。

可用的 AI 提示词:附录 C2 · 阶段 4

固定推理链:现象 → 异常 → 疑问 → 假设 → 研究问题 → 候选题目。

  1. 从 Problem Map 里选高价值的现象或知识缺口,不从某个方法或概念名词出发。
  2. 让一个模型生成多个解释或机制假设,并要求每个给出可证伪条件。
  3. 让另一个模型或独立会话当 Critic:找替代解释、隐含前提、已有相近工作。
  4. 留下 5–8 个研究问题(RQ),每个写成一句话,并回答“为什么是现在”——什么变了(数据、工具、理论、需求)。
  5. 用选题评分表(见附录 C1)打分,筛到 ≤3 个候选方向。评分由人填,AI 只提供依据。
过关标准:每个候选题都是“问题 + 假设 + 可观察的成败条件”,不是“方法 A + 方法 B”;评分理由能追溯到证据库。
5

撞车审查(Prior Art)

主动证明“这个想法可能并不新”,找最接近的已有工作。

可用的 AI 提示词:附录 C2 · 阶段 5

检索范围:论文、预印本、专利、代码仓库、数据集、基准、标准、商业产品、基金项目库。

  1. 每个研究问题设计 3 组以上检索式:当前术语、同义词或旧称、机制词或任务词。
  2. 做向前、向后的引文追踪,并记录数据库、时间窗和纳排标准。
  3. 让研究型 AI 专门输出:最接近的 10 项工作、重合点、真正差异、三项最大风险。
  4. 独立审查:换一个模型和不同提示,且不看前一个结论;并且至少有一条非大模型路径——引文图谱、数据库直检,或人工同行 / 领域专家。
  5. 人读最接近的 5–10 项原文(不是摘要),逐项写出“它做了什么、没做什么、我的差异是什么”。

“没人做过”的标准写法

在 [数据库]、[检索日期]、[时间窗]、[检索式] 下,按 [纳排标准] 筛选, 未发现与本课题直接重合的工作;最接近的是 [X],差异在于 [Y]。 结论强度:[较强 / 一般 / 较弱],理由:[覆盖范围、语言、专家意见]。
过关标准:任何“近年无直接相同工作”的说法都附上述四要素,写不出就不写;最接近的工作原文有书面比较。
6

小实验证伪(Killer Experiment)

用最小代价,认真尝试杀死自己的课题。

可用的 AI 提示词:附录 C2 · 阶段 6

适用边界:并非所有学科都能“做实验”。按附录的学科适配表选验证形式:复现与小实验、回顾性数据分析、预实验、案例与访谈、关键反例推演。

每个候选方向必须写清四件事

要素含义
最强基线当前最强或最合理的现成方案(传统领域即“目前公认最好的做法或解释”),给予与新方案同等的条件和资源预算
最小实验用最少的数据、材料或步骤验证核心假设(可以是小实验、小样本调查、个案分析或推演)
证伪标准出现什么结果就说明假设不成立
决策规则事先写好:继续 / 收缩 / 转向 / 放弃

防止自欺的六条规则

  • 先写后做:假设、指标、成败阈值在运行前写入设计并留档,避免事后改标准。
  • 基线要公平:不能拿弱基线对比。
  • 先确认“测得出来”:加入阳性对照或已知结论的样例;否则失败可能只是实验做坏了。
  • 说明样本与功效:样本太小得出的“无效”不是决定性否定,要标注结论强度。
  • 限时:设时间盒(例如 1–2 周),到期按规则决策。
  • 留全部记录:包括失败的。
过关标准:如果结果失败,你真的愿意砍掉或收缩这个方向——否则它不是证伪实验;实验设计在运行前已留档。
7

决策与计划

先给出 1–2 页结论和 90 天计划,再谈长期路线。

可用的 AI 提示词:附录 C2 · 阶段 7

决策备忘录必须包含

  • 结论:做 / 收缩 / 转向 / 放弃,一句话。
  • 选定方向的问题陈述、核心假设、与最接近工作的差异。
  • 支撑证据清单(指向断言台账条目)和证据强度。
  • Kill Log:被放弃的方向和原因,避免日后重复论证。
  • 主要风险、未解决的不确定性、所需资源与合规事项。

下一步计划

  • 90 天计划(必须):目标、里程碑、产出、负责人、检查点、止损条件。
  • 12–36 个月路线图(可选,仅当结论为“做”):主问题、2–4 个子问题、数据来源、对照与指标、稳健性检查、备选路线。粗线条即可,随证据更新。
过关标准:找 2 位没参与过的人审阅,他们能复述你的结论与理由,且提不出你完全没想过的致命反例;90 天计划每个里程碑都可测。
8

写作与持续跟踪

报告只是当前证据状态的快照,要持续更新。

可用的 AI 提示词:附录 C2 · 阶段 8

  1. 用文献管理器统一管理全文、标签、笔记和引用。
  2. 按“断言 → 证据”逐节起草,只用台账里已核验的断言;让另一个模型或人工当 Reviewer 独立审查。
  3. 按需披露 AI 使用情况(目标期刊或机构有要求时)。
  4. 设置跟踪:保存检索式并设提醒;每周看新增,每月完整重跑一次检索式。
  5. 重大节点(立项、投稿、重大决策)前,做一次完整的新颖性复查。

出现下面任一情况,立即重新评估

  • 出现与你的差异点高度重合的新工作。
  • 最强基线明显提升。
  • 关键数据、工具或政策条件改变。
  • 核心依据的论文被更正或撤稿。
过关标准:报告中的创新点、路线和风险都能被证据库直接支持;新工作出现后,一天内能判断是否改变课题边界。
第四部分

三个贯穿全程的机制

这三件事不属于某一个阶段,但决定调研是否可信。

机制一:核验协议——怎样真正防幻觉

“防幻觉”必须有可执行的规则,而不是一句提醒。

证据等级

等级含义
A多个独立来源一致,或被独立复现;或权威系统综述、指南、标准
B经同行评审的单一研究,数据或方法披露充分
C预印本、会议摘要、单一来源无数据披露、专家个人意见
DAI 生成摘要、二手转述、网页博客、未核实内容——只能当线索,不可当结论依据

结论强度不得超过其证据等级;工程或临床决策对等级的要求高于探索性判断。

核验规则(经验阈值,可按风险调整)

  • AI 给出的任何文献,先确认真实存在(数据库或 DOI 解析)再入库。
  • 核心文献取得全文;引用具体数字或结论时,记录原文位置(页码、章节、图表)。
  • 进入最终报告的断言,100% 核验。
  • 证据矩阵每批随机抽检约 20%,与原文逐项比对;错误率超过约 10%,整批重检。
  • 检查撤稿与更正、可疑期刊、论文工厂风险。
  • 独立互审:不同模型 + 不同提示 + 不看前一结论,并至少一条非大模型路径。模型间一致只能提高置信度,不能替代核验。

要警惕的偏差

  • 发表偏倚(阴性结果不发表)、引用偏倚、幸存者偏差、语言偏倚。
  • 检索偏差:只用熟悉的术语,漏掉旧称和相邻领域的说法。
  • AI 偏差:倾向给出流畅、自洽、迎合提问方向的叙述。

机制二:角色分工与工具使用

Generator → Critic → Judge:Generator 提出假设与方案;Critic 在独立上下文里专门找问题;Judge(人,必要时加领域专家)基于原始证据裁决。三个角色不由同一次对话承担。

  • 按能力选工具,不按品牌:同一工具可以跨阶段使用,但关键结论要让不同工具或路径互相复核(具体工具见附录 A)。
  • 留工具使用日志:记录工具、版本或日期、关键提示词、检索式、输出文件。换工具后重要结论应能复现。
  • 注意合规:未经许可,不要把公司保密资料、受保护数据或带版权的全文上传到外部 AI;注意数据与代码许可证、伦理审批,以及目标期刊或机构对 AI 使用披露的规定。

机制三:时间预算与停止规则

防止调研无限延伸。以下是经验估计,按领域和投入强度调整。

周次(兼职)阶段当周主要产出
第 1 周0 + 1 前半Research Brief、Resource Ledger、教材综述阅读、术语表初稿
第 2 周1 后半 + 2专家访谈、领域结构图、检索方案、两张地图初稿
第 3–4 周3证据矩阵、断言台账、核验抽检
第 5 周4 + 5 前半RQ 列表、评分表、撞车审查启动
第 6 周5 后半 + 6最接近工作的原文比较、实验设计留档、最小实验
第 7 周7 + 8决策备忘录、90 天计划、跟踪机制

全职投入通常可压缩到约一半。某阶段到期未达过关标准,要么缩小范围,要么明确承担风险继续,并在备忘录里写明。

三条停止规则

  • 检索停止:达到证据库的饱和条件就停,不追求“读完”。
  • 选题停止:候选方向收敛到 ≤3 个就停止发散。
  • 实验停止:时间盒一到,按事先写好的规则决策。
第五部分

照着做一次:分步检查表

□ 是要做的动作,◆ 是必须通过的关卡。全部完成,才算完成一次可用于决策、并具备继续推进基础的调研。

阶段 0 问题与资源

产出:Research Brief、Resource Ledger

  • 写完一页 Research Brief,没有预设方法或结论。
  • 列出 Resource Ledger,标出真正难以复制的资源。
  • 确定本次调研服务的决策、决策人和截止时间。
  • 确认合规边界:保密数据、版权全文、许可证、伦理要求。
  • 关卡:不用方案词,就能说清问题、对象、成功标准。

阶段 1 领域入门

产出:术语表、领域结构图、争议清单、专家访谈记录

  • 找到并通读 1–2 本教材或手册、2–3 篇近三年综述。
  • 整理 30–50 个术语,含同义词、旧称、缩写。
  • 画出子方向、主流方法、评价标准、核心期刊会议与团队。
  • 列出 3–5 个公认争议及各方依据。
  • 用 AI 出 10 道理解题自测,错题回教材核对。
  • 访谈 2–3 位领域人士,使用“专家访谈五问”。
  • 关卡:能向外行讲清这个领域 10 分钟;专家未指出重大遗漏。

阶段 2 双地图扫描

产出:检索方案、Problem Map、Literature Map

  • 写下检索方案:库、检索式、时间窗、语言、纳排标准、日期。
  • 至少使用两个学术库,并补充预印本、专利、代码、数据集来源。
  • 完成 Problem Map,标出 5–10 个高价值的失败问题或障碍。
  • 完成 Literature Map 四层:foundational / representative / frontier / limits。
  • 每个主要分支写出“现实问题—代表方法—当前边界”。
  • 关卡:别人按检索方案能重跑出近似结果;两张地图可互相对应。

阶段 3 证据库

产出:证据矩阵、断言台账、核验记录

  • 建立文献库,核心来源取得全文。
  • 录入证据矩阵,字段完整,标注证据等级与核验状态。
  • AI 给出的每条文献,先核实真实存在再入库。
  • 检查撤稿、更正、可疑期刊。
  • 随机抽检约 20% 条目对照原文;错误率超约 10% 则整批重检。
  • 达到饱和条件:新检索几乎不再出现新核心工作,核心论文的引文网络大部分已覆盖。
  • 关卡:任选一个关键断言,1–2 分钟内追溯到原文位置。

阶段 4 研究问题与选题

产出:RQ 列表、选题评分表

  • 用“现象→异常→疑问→假设→RQ”链条,生成 5–8 个研究问题。
  • 每个 RQ 写一句问题陈述、可证伪条件、“为什么是现在”。
  • 用独立会话的 Critic 找替代解释与隐含前提。
  • 人工填写选题评分表,每项写依据。
  • 收敛到 ≤3 个候选方向。
  • 关卡:候选方向都是“问题 + 假设”,而不是方法或概念名词的组合。

阶段 5 撞车审查

产出:撞车审查报告、最接近工作的比较表

  • 每个 RQ 设计 ≥3 组检索式(当前术语 / 同义旧称 / 机制任务词)。
  • 覆盖论文、预印本、专利、代码、数据集、基准、标准、商业产品。
  • 做前向与后向引文追踪并记录。
  • 独立审查:另一模型 + 不同提示 + 不看前一结论。
  • 至少一条非大模型路径:引文图谱、数据库直检或人工同行 / 专家。
  • 人读最接近的 5–10 项原文,写出做了什么、没做什么、差异是什么。
  • 新颖性声明按标准格式书写,含库、日期、时间窗、检索式、结论强度。
  • 关卡:每个候选方向都有书面的“最接近工作”比较,并据此调整了问题边界。

阶段 6 小实验证伪

产出:实验设计(运行前留档)、实验日志、判定结果

  • 为每个候选方向写:最强基线、最小实验、证伪标准、决策规则。
  • 运行前把假设、指标、阈值留档并标注日期。
  • 确认基线公平(同等预算与调参)。
  • 加入阳性对照或已知结论样例,确认实验有能力发现效应。
  • 说明样本量与结论强度;设定时间盒。
  • 执行并保留全部运行记录,包括失败的。
  • 按事先规则做出:继续 / 收缩 / 转向 / 放弃。
  • 关卡:至少一个方向经过了真正可能被否决的验证。

阶段 7 决策与计划

产出:决策备忘录、Kill Log、90 天计划(结论为“做”时加路线图)

  • 写 1–2 页决策备忘录,结论一句话先行。
  • 记录 Kill Log:放弃的方向与原因。
  • 写 90 天计划:里程碑、产出、负责人、检查点、止损条件。
  • 若结论为“做”,补充 12–36 个月粗线条路线图与备选路线。
  • 请 2 位未参与者审阅,记录质疑并回应。
  • 关卡:审阅者能复述结论与理由;计划每个里程碑可测。

阶段 8 写作与持续跟踪

产出:调研报告、跟踪机制

  • 按“断言 → 证据”起草,只用台账中已核验的断言。
  • 独立 Reviewer(另一模型或人)审查报告,逐条回应。
  • 按要求披露 AI 使用情况。
  • 保存检索式,设置提醒;每周看新增,每月重跑一次。
  • 写明重评触发条件,并在重大节点前做新颖性复查。
  • 关卡:报告的每条创新点、路线、风险都能被证据库支持。

最终交付物核对

缺任何一项,下一步工作的基础就不完整。

  • Research Brief + Resource Ledger
  • 术语表 + 领域结构图 + 专家访谈记录
  • 检索方案 + 检索日志
  • Problem Map + Literature Map
  • 证据矩阵 + 断言台账 + 核验记录
  • RQ 列表 + 选题评分表
  • 撞车审查报告 + 最接近工作比较表
  • 实验设计 + 日志 + 结果
  • 决策备忘录 + Kill Log + 90 天计划
  • 跟踪机制(检索提醒、月度重跑、重评条件)
附录

查阅资料

需要时再翻,不必通读。

附录 A 工具按“能力角色”怎么选

先定义任务,再选工具;先看证据链,再看模型“聪明程度”。具体产品只是示例,可按学科、预算、隐私、地区可用性替换,方法本身不依赖任何单一工具。

能力角色用来做什么选型标准建议的工具
研究型 AI多来源检索、来源引用、反向证伪覆盖范围、引用可追溯、来源可控********
通用推理大模型问题重构、假设生成、批判审查、写作担任 Generator / Critic 时用独立会话********
学术检索论文发现、引文追踪覆盖率、元数据质量、引文关系;至少用两个库交叉********
专利 / 代码 / 数据集非论文形态的已有工作可检索、可导出、含许可信息********
代码 / 数据 Agent调用 API、清洗去重、构建引文图和证据矩阵、复现实验产出可复现;任务存在可程序化部分时才用********
知识管理全文、引用、笔记、证据定位可追溯、可搜索、长期可维护********
批判复核找反例、替代解释、最接近工作独立上下文;至少一条非大模型路径********

附录 B 学科适配表

手册里的“基线”“实验”“基准”等术语来自工程和实证研究。换学科时按此表替换。

领域类型“最强基线”相当于撞车审查额外来源最小验证特别注意
计算 / AI / 软件当前最强公开方法,同预算调参arXiv、GitHub、榜单、工业博客小数据集上复现基线并检验假设基线调参不足、数据泄漏、榜单过拟合
实验科学(物理 / 化学 / 生物)标准实验方案与对照组专利、方法学期刊、预印本、试剂仪器文档可行性预实验、阳性与阴性对照可重复性、批次效应、样本量、伦理与安全审批
社会科学 / 管理 / 经济主流理论解释与经典识别策略工作论文、政策报告、公开微观数据现有数据的描述性检验、小样本访谈或案例预研因果识别、测量效度、样本代表性
医学 / 临床标准治疗 / 现行指南临床试验注册库、指南、系统综述回顾性数据分析、系统综述式预检、专家共识访谈证据等级、偏倚风险、伦理;预印本不能当临床依据
人文 / 历史 / 理论主要学派的既有解释与史料依据档案、馆藏目录、多语种文献、专著书评关键反例推演、史料可得性核查、个案细读语言与档案可及性;“新材料”或“新框架”才是新颖性来源
产业技术 / 工程现有商业方案、行业标准、专利先例专利、标准、产品文档、招标与竞品资料样机 / 仿真 / 现场小规模试验自由实施(FTO)风险、成本与可靠性约束、合规

附录 C1 要你自己填写的工作表

这些是你自己写、自己判断的文档。AI 可以帮你起草或查漏,但内容和结论由你负责。需要让 AI 帮忙的环节,见 C2。

1. Research Brief(阶段 0)自己填
研究场景: 现实问题: 受影响对象: 当前解决方式: 最主要失败模式: 成功标准: 这次调研服务于哪个决策、谁来决定、期限: 我已有的独特资源(Resource Ledger 摘要): 时间 / 预算 / 设备场地 / 合规约束: 明确暂不预设的理论、方法或技术方案:
2. 专家访谈五问(阶段 1)自己问真人
1. 这个领域目前最难、最卡的三件事是什么? 2. 哪些看起来诱人、但已经被证明走不通或不值得做? 3. 必读的论文、人、数据集有哪些? 4. 业内公认的评价标准和“强基线”是什么? 5. 我这个初步想法,最可能死在哪里?
3. 选题评分表(阶段 4,权重为示例,可调整)自己填
每项 1–5 分,需写一句依据并指向证据库条目。 重要性(解决后谁受益、多大) 权重 25% 缺口真实性(现有最强方案确实不足) 权重 20% 可证伪性(能设计出能杀死它的验证) 权重 15% 可行性与资源优势(数据 / 能力 / 时间) 权重 20% 新颖性(暂估,待撞车审查修正) 权重 10% 风险可控(合规、依赖、被抢先) 权重 10% 总分 = 加权和。低于 3.0,或“可证伪性”低于 3 的方向,不进入小实验。
4. 小实验模板(阶段 6)自己填
研究问题: 核心假设: 最强基线(及其预算): 最小数据 / 材料 / 样本: 最小实施方案(实验步骤、调查设计、代码或推演): 主要指标: 阳性对照 / 有效性检查: 支持假设的最低结果: 直接否定假设的结果: 样本量与功效说明: 时间盒与成本: 决策规则:继续 / 收缩 / 转向 / 放弃 (以上内容在运行前留档,日期:____)
5. 断言台账一行示例(阶段 3 起)自己填
编号 | 断言 | 类型(事实/作者结论/我的推断) | 来源与原文位置 | 证据等级 | 核验状态 | 核验人/日期 C-012 | 方法 X 在数据集 Y 上达到 Z | 作者结论 | 论文 P, 表 3, 第 7 页 | B | 已核验 | 某某 / 2026-xx-xx
6. 决策备忘录骨架(阶段 7)自己填
结论:做 / 收缩 / 转向 / 放弃(一句话) 问题陈述与核心假设: 与最接近工作的差异: 关键证据(断言编号列表)与强度: 被放弃的方向及原因(Kill Log): 主要风险与不确定性: 所需资源与合规事项: 未来 90 天计划(里程碑 / 产出 / 检查点 / 止损): 重评触发条件:
7. 推荐的文件夹结构自己整理
research/ ├── 00_brief/ Research Brief、Resource Ledger ├── 01_domain/ 术语表、领域结构图、专家访谈记录 ├── 02_queries/ 检索方案、检索式与日志 ├── 03_papers/ 全文与来源 ├── 04_evidence/ papers.csv、evidence_matrix.csv、claim_ledger.csv ├── 05_prior_art/ 撞车审查报告 ├── 06_experiments/ 设计、日志、结果 ├── 07_decisions/ 选题评分、Kill Log、决策备忘录 └── 08_report/

附录 C2 可直接给 AI 的提示词

几乎每个阶段都能用到 AI。下面按阶段 0–8 各给出可直接使用的提示词,方括号【 】里换成你自己的内容。

使用前先记住四点

  • 先贴通用规则。每次新开对话,先粘贴下面的“通用规则”,再贴具体提示词。
  • 喂材料,别让它凭记忆。凡是要求“只根据材料”的,一定要把原文贴进去;让 AI 凭记忆回答的内容,一律当作线索。
  • 角色分开。生成想法(Generator)和批评想法(Critic)要在不同的对话里做;带“新开对话”标注的,务必新开。
  • 输出要核验。AI 的输出进入证据库前,按“核验协议”核对;提示词本身也可以按你的领域修改。
通用规则每次新开对话先贴
####(稍后发表)

阶段 0 · 问题与资源

0 · 问题澄清:让 AI 当访谈者通用大模型
####(稍后发表)

用途:帮你把问题说清楚,不是让 AI 替你定题。

阶段 1 · 领域入门

1a · 术语表初稿通用大模型
####(稍后发表)

用途:生成后你要对照原文检查一遍,再作为后续检索的词表。

1b · 理解自测:让 AI 当考官通用大模型
####(稍后发表)

阶段 2 · 双地图扫描

2a · 检索式设计通用大模型
####(稍后发表)

用前先在数据库里试跑;检索语法以数据库官方说明为准。

2b · 领域扫描研究型 AI(需联网)
####(稍后发表)

用途:宽幅摸底。得到的论文和数据必须回原始来源核对,不能直接入库。

阶段 3 · 建证据库

3a · 从文献抽取证据矩阵通用大模型
####(稍后发表)

每批抽检约 20% 对照原文(见“核验协议”)。

3b · 参考文献清单初筛通用大模型
####(稍后发表)

这只是初筛。每条是否真实存在,必须在数据库或 DOI 解析中亲自核对,AI 的判断不能代替。

阶段 4 · 研究问题与选题

4a · 假设生成(Generator)通用大模型
####(稍后发表)

在一个对话里生成;批评放到另一个对话(4b)。

4b · 假设批评(Critic)通用大模型(新开对话)
####(稍后发表)
4c · 选题评分依据通用大模型
####(稍后发表)

阶段 5 · 撞车审查

5a · 撞车审查研究型 AI(需联网)
####(稍后发表)
5b · 独立盲审另一个模型(新开对话)
####(稍后发表)

拿到结果后,与 5a 对比,再加上一条非大模型路径(引文图谱、数据库直检或人工同行)。

5c · 与最接近工作逐项比较通用大模型
####(稍后发表)

阶段 6 · 小实验证伪

6a · 实验设计审查通用大模型(新开对话)
####(稍后发表)

要在运行前使用,并把修改后的版本留档。

6b · 结果判定防自欺通用大模型
####(稍后发表)

阶段 7 · 决策与计划

7 · 备忘录红队审查通用大模型(新开对话)
####(稍后发表)

阶段 8 · 写作与持续跟踪

8a · 按“断言—证据”起草通用大模型
####(稍后发表)
8b · 报告审稿通用大模型(新开对话)
####(稍后发表)
8c · 增量跟踪研究型 AI(需联网)
####(稍后发表)

建议每月运行一次,结果记入证据库。

附录 D 十条研究底线

01问题先于技术不从“我想用某方法 / 某技术”倒推问题。
02先懂再问未建立领域基本认识前,不下结论。
03AI 是线索,不是证据AI 输出必须回到论文、数据、代码或实验。
04证据分级结论强度不超过其证据等级。
05留存检索方案数据库、检索式、时间窗、纳排标准可复查。
06真正独立互审模型一致不算核验,需含非大模型路径。
07先做反证主动找最接近工作与最强基线。
08先写判据再做实验杜绝事后改标准。
09允许砍题“放弃”必须是真实选项。
10人来拍板价值、新颖性、可行性与责任归研究者。

文中具体产品名称仅作能力示例,不构成必选工具或推荐顺序。20% 抽检、10% 错误率、时间盒与周次、评分权重等数字为经验性建议,应按领域风险与资源调整。回到顶部 ↑