一套覆盖研究问题收敛、文献综述、论文写作、同行评议、实验规划与学术完整性检查的 Codex 科研技能。

写在前面

如果你使用过 ChatGPT、Claude 或 Codex 辅助科研,可能遇到过这样的情况:

你只提供了一个宽泛主题,AI 就立刻生成了一份看似完整的论文大纲;你让它查找文献,它给出几十条格式漂亮的参考文献,却不说明哪些经过核验;你把实验结果交给它,它很快写出“本方法显著优于现有方法”,但没有检查实验设计、统计检验和实际提升幅度。

问题不只是 AI 会不会写。

真正的问题是,科研并不是“生成一段文字”,而是一条需要不断核验的证据链:

研究方向
   ↓
研究问题
   ↓
文献证据
   ↓
研究假设
   ↓
研究设计
   ↓
实验与数据
   ↓
结果解释
   ↓
论文写作
   ↓
同行评议
   ↓
修改与定稿

如果研究问题还不清楚,就不应该直接生成论文大纲;如果引用尚未核验,就不应该把它写成确定事实;如果实验结果无法支持结论,就不应该通过语言润色掩盖证据缺口。

Academic Research Skills for Codex,简称 ARS-Codex,正是围绕这种“研究流程和证据门禁”设计的一套科研技能。

它不是论文自动生成器,也不是一个替代研究者的“AI 科学家”。它试图让 Codex 按照更加严谨的流程,协助研究者完成:

  • 研究问题收敛;
  • 文献检索与综述;
  • 系统综述和 Meta 分析;
  • 论文规划与写作;
  • 引用真实性核验;
  • 实验设计与复现检查;
  • 模拟同行评议;
  • 审稿意见回复;
  • 论文修改与定稿;
  • AI 使用声明和格式转换。

本文将从零开始介绍:

  1. ARS-Codex 到底是什么;
  2. 为什么它有多个不同名称;
  3. 安装后为什么只出现一个 Skill;
  4. 五条内部工作流分别做什么;
  5. 如何在 Codex CLI 和 Desktop 中安装;
  6. 如何验证安装是否成功;
  7. 如何从宽泛方向收敛研究问题;
  8. 如何设计系统文献综述;
  9. 如何规划算法实验;
  10. 如何模拟论文审稿;
  11. Material Passport 和引用门禁是什么;
  12. 它有哪些局限和安全边界。

本文介绍的项目是 Imbad0202/academic-research-skills-codex。截至 2026 年 7 月 20 日,仓库主分支标记为 ARS-Codex 0.1.21,对接上游 Academic Research Skills v3.18.0。项目仍在持续更新,实际安装时请以官方仓库最新说明为准。


一、ARS-Codex 是什么?

ARS-Codex 是 Academic Research Skills 的 Codex 原生发行版。

它的目标是为 Codex 提供一套“人在回路”的学术研究工作流。所谓人在回路,是指:

  • 人决定研究什么;
  • 人判断哪些文献真正重要;
  • 人确认研究假设;
  • 人解释实验结果;
  • 人决定哪些结论可以写进论文;
  • AI 帮助执行其中重复、结构化和可核验的工作。

它不是一个大语言模型,也不会重新训练 Codex。

它主要由以下内容构成:

academic-research-suite/
├── SKILL.md
├── manifest.json
├── agents/
├── codex/
│   ├── full-runtime-manifest.json
│   ├── agents/
│   ├── hooks/
│   └── scripts/
└── ars/
    ├── deep-research/
    ├── academic-paper/
    ├── academic-paper-reviewer/
    ├── academic-pipeline/
    ├── experiment-agent/
    ├── commands/
    ├── shared/
    ├── scripts/
    ├── references/
    └── tests/

其中,根目录下的 SKILL.md 是整个套件的入口和路由器。

当用户提出任务后,它会先判断用户究竟需要:

  • 深度研究;
  • 论文写作;
  • 论文审查;
  • 完整研究流程;
  • 实验规划。

然后再读取相应工作流,而不是一次性把所有科研规则加载到上下文中。


二、为什么它有四个不同名称?

ARS-Codex 最容易让初学者困惑的地方,是项目中同时出现了多个名称。

它们之间的关系如下:

上游 Claude Code 项目
Imbad0202/academic-research-skills
               │
               │ 适配与重新打包
               ▼
Codex 原生仓库
Imbad0202/academic-research-skills-codex
               │
               │ 安装为 Codex 插件
               ▼
插件名称
ars-codex
               │
               │ 注册一个根技能
               ▼
用户调用名称
$academic-research-suite

1. academic-research-skills

这是原始的 Claude Code 版本。

它主要适合:

  • Claude Code;
  • Claude Code 插件系统;
  • Claude 原生 Slash Commands;
  • Claude Agent Team;
  • 原始 ARS 项目开发和更新历史。

官方仓库是:

Imbad0202/academic-research-skills

2. academic-research-skills-codex

这是专门为 Codex 制作的姐妹发行版。

它对原始 ARS 内容进行了:

  • Codex 路由适配;
  • 目录重新组织;
  • 单一 Skill 打包;
  • Claude Agent 行为映射;
  • Slash Command 别名模拟;
  • Codex 安全边界适配;
  • 可选 Full Runtime 封装。

3. ars-codex

这是安装到 Codex 中的插件名称。

使用 Codex 插件系统安装时,需要选择:

ars-codex

4. academic-research-suite

这是最终在对话中调用的 Skill 名称。

例如:

请使用 $academic-research-suite
帮我设计一项系统文献综述。

因此,四个名称分别代表:

名称 代表什么
academic-research-skills Claude Code 原版仓库
academic-research-skills-codex Codex 版仓库
ars-codex Codex 插件身份
academic-research-suite 实际调用的根 Skill

只要把这四层关系弄清楚,后面的安装和使用就不容易混乱。


三、为什么安装后只有一个 Skill?

ARS-Codex 内部包含五条主要工作流,但它只向 Codex 注册一个根技能:

academic-research-suite

很多用户安装后查看 Skills,发现没有单独出现:

deep-research
academic-paper
academic-paper-reviewer
academic-pipeline
experiment-agent

于是误以为安装不完整。

实际上,这正是 Codex 版的设计。

五个内部入口使用的是 WORKFLOW.md,不是独立的 SKILL.md。Codex 首先发现根技能,然后由根技能根据任务意图选择工作流。

可以把它理解成一家医院:

academic-research-suite
相当于分诊台

deep-research
相当于文献研究科

academic-paper
相当于论文写作科

academic-paper-reviewer
相当于同行评议科

academic-pipeline
相当于全流程管理中心

experiment-agent
相当于实验与统计科

用户不需要提前判断所有内部文件,只需要说明自己的目标和现有材料。

例如:

请使用 $academic-research-suite。

目标:写一篇期刊论文。
当前材料:已有研究问题、文献矩阵和实验结果,但没有论文大纲。
当前需要:论文结构,以及尚缺少的证据清单。
约束:英文、APA 7、面向机器学习研究者。

根技能会根据这些信息选择适当的工作流。


四、五条工作流分别做什么?

ARS-Codex 的核心是五条内部工作流。

工作流 适用任务 典型产物
deep-research 问题收敛、文献综述、系统综述、Meta 分析、事实核查 研究问题、检索方案、证据综合
academic-paper 大纲、摘要、正文、修改、引用格式、AI 声明 论文结构、章节草稿、修订建议
academic-paper-reviewer 模拟同行评议、编辑决定、修改后复审 审稿报告、Decision Letter
academic-pipeline 从研究到论文的完整分阶段流程 阶段看板、完整性检查、修改循环
experiment-agent 代码实验、人体研究、统计解释、复现检查 实验计划、研究协议、复现清单

下面分别介绍。


五、Deep Research:从研究方向到证据综合

deep-research 适合:

  • 收敛研究问题;
  • 文献检索;
  • 叙述性综述;
  • 系统文献综述;
  • Meta 分析;
  • 事实核查;
  • 时间线提取;
  • 研究风险分析;
  • 证据综合。

它内部包含多个研究角色,例如:

  • research_question_agent:研究问题;
  • socratic_mentor_agent:苏格拉底式提问;
  • bibliography_agent:文献管理;
  • source_verification_agent:来源核验;
  • synthesis_agent:证据综合;
  • risk_of_bias_agent:偏倚风险;
  • meta_analysis_agent:Meta 分析;
  • devils_advocate_agent:反方质疑;
  • ethics_review_agent:伦理风险;
  • report_compiler_agent:报告整理。

在普通 Codex 模式中,这些 Agent 文件主要作为分阶段角色提示,并不意味着系统一定会自动启动多个后台 Agent。


六、Academic Paper:论文结构、写作与修改

academic-paper 适合:

  • 论文规划;
  • 论文大纲;
  • 摘要写作;
  • 文献综述写作;
  • 正文章节;
  • 论文修改;
  • 引用格式检查;
  • AI 使用声明;
  • LaTeX、DOCX 和 PDF 格式指导;
  • Revision Coaching。

内部角色包括:

  • intake_agent:材料接收;
  • structure_architect_agent:论文结构;
  • argument_builder_agent:论证链;
  • literature_strategist_agent:文献策略;
  • draft_writer_agent:正文草稿;
  • citation_compliance_agent:引用合规;
  • peer_reviewer_agent:写作阶段自查;
  • revision_coach_agent:修改指导;
  • formatter_agent:格式;
  • visualization_agent:图表规划。

它并不是收到一个题目就立即开始写作。

只有当用户已经具备以下至少一部分材料时,才适合直接进入论文工作流:

  • 明确研究问题;
  • 已批准的研究框架;
  • 文献矩阵;
  • 数据或实验结果;
  • 章节笔记;
  • 论文草稿;
  • 明确要求跳过选题收敛。

七、Academic Paper Reviewer:模拟同行评议

academic-paper-reviewer 用于:

  • 投稿前审查;
  • 模拟期刊审稿;
  • 方法学审查;
  • 领域贡献评估;
  • Devil’s Advocate 质疑;
  • 编辑决定;
  • 修改后复审。

主要角色包括:

  • field_analyst_agent:分析目标领域;
  • domain_reviewer_agent:领域审稿;
  • methodology_reviewer_agent:方法学审稿;
  • perspective_reviewer_agent:不同学术视角;
  • devils_advocate_reviewer_agent:寻找致命问题;
  • editorial_synthesizer_agent:综合审稿意见;
  • eic_agent:模拟主编决定。

这种设计试图避免让同一个“审稿人”同时承担所有角色。

例如,方法学审稿人可能认为实验设计存在问题,而领域审稿人可能认为问题很重要。编辑综合阶段需要保留这些差异,而不是把所有意见平均成一份温和的总结。


八、Academic Pipeline:从研究到论文的完整流程

academic-pipeline 用于跨越多个阶段的任务,例如:

研究问题
  ↓
文献与证据
  ↓
研究设计
  ↓
论文规划
  ↓
写作
  ↓
完整性检查
  ↓
模拟审稿
  ↓
修改
  ↓
复审
  ↓
定稿

它适合:

  • 从研究材料逐步形成论文;
  • 对论文项目建立阶段看板;
  • 在关键节点要求用户确认;
  • 检查引用和结论的一致性;
  • 进行修改—复审循环;
  • 在定稿前执行完整性门禁。

不建议用一句话让它静默跑完整流程:

帮我从这个主题开始写完一篇论文。

更好的方法是从一个阶段开始,并设置停止点:

请使用 $academic-research-suite 启动 academic-pipeline。

从材料接收阶段开始。
请先整理现有材料、缺失材料和主要风险,
生成 Pipeline Dashboard 后停止。

不要进入正文写作,
等待我确认后再继续。

这样用户可以在每个重要节点保持控制权。


九、Experiment Agent:实验规划与复现检查

experiment-agent 主要用于:

  • 代码实验规划;
  • 实验运行方案;
  • 统计解释;
  • 可复现性检查;
  • 人体研究协议;
  • 数据和环境记录;
  • 结果验证。

它可以帮助回答:

  • 应选择哪些数据集?
  • 需要哪些基线?
  • 如何设置预算?
  • 应运行多少随机种子?
  • 是否需要消融实验?
  • 使用什么统计检验?
  • 如何记录软件环境?
  • 如何判断实验失败?
  • 复现实验需要保存哪些文件?

它不等于自动实验平台。

能否实际运行代码,还取决于:

  • Codex 当前权限;
  • 本地环境;
  • Python 包;
  • 数据文件;
  • GPU;
  • 运行时间;
  • 用户是否授权修改文件和执行程序。

十、最重要的设计:宽泛题目不能直接写大纲

ARS-Codex 有一条非常重要的路由规则:

如果用户只提供宽泛研究主题、暂定题目或研究方向,但没有清晰、可回答的研究问题,系统应先进入 deep-research 的 Socratic 模式。

例如:

我想写一篇关于主动学习的论文。

普通 AI 可能立刻生成:

1. Introduction
2. Related Work
3. Method
4. Experiments
5. Conclusion

但这份大纲几乎没有价值,因为以下问题都不清楚:

  • 主动学习中的哪个问题?
  • 获取的是标签、特征还是其他信息?
  • 研究的是理论、算法还是应用?
  • 现有方法的缺陷是什么?
  • 有什么数据?
  • 用什么实验验证?
  • 目标读者是谁?

ARS-Codex 在这种情况下应该先说明:

当前研究问题尚未精确,
因此先进入 deep-research 的 Socratic 模式。

然后提出三到五个收敛问题,例如:

  1. 你关注的是标签主动学习还是主动特征获取?
  2. 研究目标是降低标注成本还是提高有限预算下的性能?
  3. 是否已经确定数据类型和应用场景?
  4. 希望研究算法、理论保证还是实验应用?
  5. 当前最接近的已有工作有哪些?

在形成至少一个候选研究问题之前,它不应直接生成论文大纲。

这也是 ARS-Codex 与普通“论文写作提示词”最明显的区别之一。


十一、安装前需要准备什么?

本文分别介绍 Codex CLI 和 Codex Desktop 两种安装方式。

1. 检查 Codex

在终端中运行:

codex --version

如果显示版本号,说明 Codex CLI 已安装。

2. 检查 Python

直接安装 Skill 的备用方案需要 Python 3:

python3 --version

macOS 和多数 Linux 环境使用 python3。部分旧教程写的是 python,但它未必指向 Python 3。

3. 决定安装方式

ARS-Codex 目前有两种主要安装方式:

方式 特点
Codex Plugin 推荐,便于更新和管理
Direct Skill Install 兼容方案,只安装根 Skill

不要同时重复安装两个版本,否则可能出现两个来源相同的 Skill。


十二、使用 Codex CLI 安装插件

当前官方推荐的插件安装方式是:

codex plugin marketplace add \
  Imbad0202/academic-research-skills-codex \
  --ref main

然后安装插件:

codex plugin add ars-codex@ars-codex

这两条命令分别做了什么?

第一步:添加 Marketplace

codex plugin marketplace add ...

告诉 Codex:

  • 插件仓库在哪里;
  • 使用哪个 Git 分支;
  • 从哪里获取插件清单。

第二步:安装插件

codex plugin add ars-codex@ars-codex

从刚添加的 Marketplace 中安装 ars-codex

安装完成后,需要新开一个 Codex 对话。已经打开的对话可能保留旧的 Skill 缓存。

更新插件

后续更新可以使用:

codex plugin marketplace upgrade ars-codex
codex plugin add ars-codex@ars-codex

项目更新较快,升级前建议查看 Changelog。


十三、在 Codex Desktop 中安装

如果不熟悉命令行,可以通过 Codex Desktop 的 Plugins 页面安装。

基本流程是:

  1. 打开 Codex;
  2. 进入 Plugins;
  3. 添加新的 Marketplace Source;
  4. 填写仓库地址;
  5. Branch/ref 选择 main
  6. 在 Marketplace 中找到 ars-codex
  7. 点击安装;
  8. 新建一个 Codex 对话;
  9. 查看 Skills。

Marketplace 地址为:

https://github.com/Imbad0202/academic-research-skills-codex.git

Branch/ref:

main

插件:

ars-codex

官方特意为 Codex Desktop 提供了实体目录版本,而不是依赖符号链接。这有助于避免 Windows 插件缓存把符号链接当作普通文本文件,从而漏掉 Skill 注册。ARS-Codex 官方安装说明


十四、直接安装 Skill

如果当前 Codex 版本不方便使用插件,也可以直接安装根 Skill:

python3 "$HOME/.codex/skills/.system/skill-installer/scripts/install-skill-from-github.py" \
  --repo Imbad0202/academic-research-skills-codex \
  --ref main \
  --path skills/academic-research-suite \
  --method git

参数含义:

参数 作用
--repo GitHub 仓库
--ref 使用的分支
--path Skill 在仓库中的路径
--method git 使用 Git 获取内容

安装完成后,新开一个 Codex 对话。

直接安装和插件安装的最终入口都是:

$academic-research-suite

不过插件方式通常更方便更新。


十五、如何验证安装成功?

第一步:查看 Skills

在新对话中输入:

/skills

预期看到一个类似以下名称的条目:

academic-research-suite

或者:

ARS-Codex

不应该从这个包中看到五个相互独立的工作流 Skill。

第二步:测试根技能

输入:

请使用 $academic-research-suite。

本次只进行路由测试,
不要搜索网络,不要修改文件。

用户请求:
我想写一篇关于生成式 AI 教育应用的论文,
但还没有明确研究问题。

请判断应进入哪个工作流和模式。

预期:

deep-research
socratic mode

第三步:测试 Socratic 行为

请使用 $academic-research-suite。

我想写一篇关于主动学习的论文,
但目前只有宽泛方向。

请先帮助我收敛研究问题,
不要生成论文大纲。

正确表现包括:

  • 说明为什么先进行问题收敛;
  • 提出三到五个针对性问题;
  • 不立即生成完整大纲;
  • 不编造文献;
  • 等待用户回答后再继续。

十六、怎样写出更有效的 ARS 提示词?

最有效的提示词通常包含四部分:

目标
当前材料
当前需要
约束

推荐模板:

请使用 $academic-research-suite。

目标:
我希望完成一篇关于序分类主动特征获取的期刊论文。

当前材料:
已经有研究问题、算法代码、实验结果和部分文献,
但文献矩阵还不完整。

当前需要:
先设计论文结构,
并列出每个章节仍然缺少的证据。

约束:
中文;
不编造参考文献;
当前只做规划,不修改原始文件;
每个结论要区分事实、推断和建议。

这比简单说:

帮我写论文。

更容易得到可用结果。


十七、ARS 别名速查表

ARS 原版在 Claude Code 中提供 /ars-* 命令。

Codex 不一定注册相同的原生 Slash Commands,因此 Codex 版将它们模拟成别名。

别名 主要功能
ars-plan 论文规划
ars-outline 只生成论文大纲
ars-abstract 摘要任务
ars-lit-review 文献综述
ars-citation-check 引用检查
ars-disclosure AI 使用声明
ars-format-convert 格式转换
ars-revision-coach 苏格拉底式修改指导
ars-revision 论文修改
ars-reviewer 完整论文审查
ars-mark-read 标记作者亲自读过的文献
ars-unmark-read 撤销已读标记
ars-cache-invalidate 使某条引用核验缓存失效
ars-full 启动完整研究—论文流程

推荐调用方式:

请使用 $academic-research-suite:
ars-outline 根据以下研究问题设计论文大纲。

如果 Codex 客户端允许 Slash 文本直接进入对话,也可以尝试:

/ars-outline 根据以下研究问题设计论文大纲。

如果斜杠输入被客户端拦截,使用不带斜杠的形式:

ars-outline 根据以下研究问题设计论文大纲。

十八、实战一:从宽泛方向收敛研究问题

下面以“序分类主动特征获取”为例。

初始方向

利用标签顺序信息改进主动特征获取。

这还不是一个完整研究问题。

需要进一步明确:

  • 数据是完全缺失还是部分缺失?
  • 获取的是哪个样本的哪个特征?
  • 是否考虑不同特征成本?
  • 分类标签的顺序信息如何表示?
  • 优化目标是 Accuracy、序分类损失还是单位成本收益?
  • 获取策略是一次性还是序贯的?
  • 是否需要理论保证?

推荐提示词

请使用 $academic-research-suite。

当前研究方向:
利用标签顺序信息改进主动特征获取。

当前状态:
只有宽泛方向,没有明确研究问题。

请进入 deep-research 的 Socratic 模式,
帮助我完成:

1. 定义问题边界;
2. 区分主动学习、主动特征获取、特征选择和缺失值填补;
3. 识别最重要的研究变量;
4. 形成不超过三个候选研究问题;
5. 为每个问题给出需要核验的文献证据;
6. 为每个问题设置证伪条件;
7. 暂时不要生成论文大纲;
8. 不要把未经文献验证的想法称为创新点。

理想输出

它不应只是生成十个标题,而应形成:

项目 示例
研究对象 具有有序标签的分类数据
决策对象 下一项需要获取的缺失特征
约束 有限预算和非均匀特征成本
优化目标 单位成本下的序分类风险下降
候选假设 利用顺序结构可以减少远距离分类错误
证据需求 查找序信息进入获取策略的已有工作
证伪条件 在多个数据集上不优于普通不确定性策略

研究问题示例

经过多轮收敛后,可能形成:

在具有非均匀特征获取成本的序分类任务中,直接将类别顺序结构引入特征获取效用估计,能否在相同预算下显著降低序分类风险?

这时才适合进入文献检索、实验设计和论文规划。


十九、实战二:设计系统文献综述

假设研究主题是:

成本敏感的主动特征获取方法如何处理特征依赖、不确定性和缺失数据?

推荐提示词:

请使用 $academic-research-suite 的 deep-research 工作流。

目标:
设计一项关于成本敏感主动特征获取的系统文献综述。

请输出:

1. 主要研究问题和子问题;
2. 核心概念及其边界;
3. 推荐数据库;
4. 检索式;
5. 时间范围;
6. 纳入与排除标准;
7. 去重方法;
8. 标题、摘要和全文筛选流程;
9. 文献质量评价方法;
10. 数据提取字段;
11. 偏倚风险;
12. 证据综合方法;
13. 引用核验规则;
14. 仍然需要研究者人工决定的事项。

要求:
不编造论文;
无法核验的信息必须标记;
区分事实、推断和研究建议。

建立概念边界

系统综述首先要区分:

概念 获取对象 主要目标
主动学习 样本标签 降低标注成本
主动特征获取 未观测特征 在预算下提高预测性能
特征选择 全局特征子集 降维与泛化
缺失值填补 缺失特征值 恢复完整数据
成本敏感学习 错误或信息成本 优化总决策代价

如果概念边界不清楚,检索结果会混入大量表面相关、实际不同的问题。

建议提取字段

字段 作用
题名 论文身份
作者和年份 基础元数据
DOI/链接 核验入口
问题设置 论文解决什么问题
获取对象 标签、特征或其他信息
获取策略 如何决定下一次获取
成本模型 是否考虑不同成本
特征依赖 是否建模
理论保证 是否有定理或误差界
数据集 实验范围
基线 对比方法
主要结论 论文报告了什么
局限性 尚未解决什么

不要把“论文存在”当成“论点成立”

至少需要分开检查:

  1. 论文是否真实存在;
  2. 元数据是否正确;
  3. 论文是否与主题相关;
  4. 论文是否真的支持当前陈述;
  5. 当前陈述是否超过论文证据范围。

二十、实战三:规划机器学习实验

假设要研究:

利用序信息的主动特征获取方法,是否能在相同预算下降低序分类错误?

推荐提示词:

请使用 $academic-research-suite 的 experiment-agent 工作流。

研究问题:
利用类别顺序信息的主动特征获取方法,
是否能在相同预算下降低序分类风险?

请设计可复现实验方案,包括:

1. 可检验假设;
2. 自变量、因变量和控制变量;
3. 数据集选择标准;
4. 基线方法;
5. 预算设置;
6. 特征成本设置;
7. 分类评价指标;
8. 序分类评价指标;
9. 随机种子和重复次数;
10. 消融实验;
11. 敏感性分析;
12. 统计检验;
13. 失败判据;
14. 代码、数据和运行环境记录;
15. 复现清单。

当前只设计实验,不运行代码。

基线不能太弱

建议至少包括:

  • Random Acquisition;
  • Cheapest First;
  • Global Feature Importance;
  • Uncertainty-Based Acquisition;
  • 不使用序信息的对应方法;
  • Proposed Method;
  • 在可能情况下加入 Oracle 或近似上界。

评价指标

普通分类指标可以包括:

  • Accuracy;
  • Macro-F1;
  • Balanced Accuracy;
  • AUROC。

序分类还应考虑:

  • Mean Absolute Error;
  • Mean Squared Error;
  • 邻近类别误差;
  • 序分类专用损失;
  • 远距离错分比例。

只使用 Accuracy 可能无法反映将类别 1 预测为 2,与预测为 5 的差异。

复现材料

至少记录:

Python 版本
依赖版本
操作系统
随机种子
数据版本
预处理步骤
配置文件
运行命令
原始结果
统计脚本
绘图脚本
硬件信息

二十一、实战四:生成论文结构

只有研究问题和证据已经比较明确时,才进入论文结构设计。

提示词:

请使用 $academic-research-suite:
ars-outline

研究问题:
在具有非均匀特征成本的序分类任务中,
将类别顺序结构引入特征获取效用估计,
能否在相同预算下降低序分类风险?

现有材料:
1. 已完成文献矩阵;
2. 已完成算法设计;
3. 已完成三个公开数据集实验;
4. 已完成显著性检验;
5. 已记录方法局限。

目标:
生成期刊论文大纲。

要求:
1. 每一节说明核心论点;
2. 每个论点列出所需证据;
3. 标记当前缺失材料;
4. 不填补不存在的结果;
5. 区分背景、贡献和实验发现;
6. 暂时不写完整正文。

理想的大纲不应该只有标题,还应包含:

  • 每节要回答的问题;
  • 每节的中心论点;
  • 所需文献;
  • 所需实验;
  • 图表位置;
  • 当前证据缺口;
  • 与前后章节的逻辑关系。

二十二、实战五:模拟同行评议

准备好论文草稿后,可以使用:

请使用 $academic-research-suite:
ars-reviewer

输入:
这篇论文草稿。

模式:
Full Review。

重点:
1. 研究贡献;
2. 新颖性;
3. 方法学;
4. 实验充分性;
5. 统计可靠性;
6. 引用完整性;
7. 过度结论;
8. 可能导致 Desk Reject 的问题。

输出:
1. 各角色独立审稿意见;
2. Major Concerns;
3. Minor Concerns;
4. 必须补充的实验;
5. 可选改进;
6. 编辑决定信;
7. 结论置信度。

本次只读审查,不修改论文原文件。

为什么需要不同审稿角色?

一个领域审稿人可能更关注:

  • 研究问题是否重要;
  • 是否与已有工作重复;
  • 贡献是否足够。

方法学审稿人则可能关注:

  • 数据是否合理;
  • 基线是否充分;
  • 统计检验是否正确;
  • 是否存在数据泄漏。

Devil’s Advocate 会主动寻找:

  • 最强反例;
  • 隐藏假设;
  • 过度解释;
  • 可能导致拒稿的逻辑漏洞。

最终由编辑综合阶段形成决定,而不是简单平均所有意见。


二十三、实战六:使用 Revision Coach 修改论文

收到审稿意见后,不建议立即让 AI 全文重写。

可以先调用:

请使用 $academic-research-suite:
ars-revision-coach

输入:
论文草稿和审稿意见。

请通过 Socratic 方式帮助我:

1. 区分必须修改和可选修改;
2. 识别哪些问题需要补实验;
3. 识别哪些问题只需要解释;
4. 找出论文中对应修改位置;
5. 判断哪些审稿意见可能基于误解;
6. 制定修改顺序;
7. 暂时不要直接重写全文。

这种方式有助于保持作者对论文内容的控制。

确认修改策略后,再调用:

ars-revision

要求修改指定章节,并保留修改记录。


二十四、什么是 Material Passport?

Material Passport 可以理解为当前研究任务的“材料边界和来源记录”。

它关注:

  • 当前有哪些论文;
  • 哪些材料已被纳入;
  • 哪些引用经过核验;
  • 哪些引用由作者亲自阅读;
  • 哪些内容来自当前材料;
  • 哪些结论仍然缺乏证据。

它的重要意义是:

AI 读取过一篇论文,不等于作者亲自阅读过这篇论文。

因此,ARS 提供:

ars-mark-read

用于标记作者已经亲自阅读某条引用。

以及:

ars-unmark-read

用于撤销标记。

这类标记不是对理解程度的证明,而是研究流程中的来源信号。

新对话与材料边界

ARS-Codex 将上游文档中的“新 Claude Code 会话”解释为“新 Codex 对话”。

新对话可能不再拥有旧对话中的完整材料上下文。因此,进入新的写作或审查阶段时,需要重新确认:

  • 使用哪些文件;
  • 哪些引用已核验;
  • 哪些材料属于当前版本;
  • 是否需要重新建立 Material Passport。

二十五、引用缓存与重新核验

为了避免重复查询,某些程序化引用验证可以使用本地缓存。

但需要注意:

  • 缓存较旧不等于文献失效;
  • 旧缓存通常只产生提醒;
  • 期刊状态、链接或元数据可能发生变化;
  • 关键引用可以进行实时重新核验。

如果某条引用需要重新验证,可以使用:

ars-cache-invalidate

使对应缓存失效。

重新核验时仍应优先使用:

  1. DOI;
  2. 出版社或会议官方页面;
  3. Crossref;
  4. arXiv;
  5. OpenAlex;
  6. Semantic Scholar;
  7. 其他权威元数据源。

无法验证时,应标记为未验证,而不是根据模型记忆补全。


二十六、普通 Agent 模式与 Full Runtime 有什么区别?

ARS-Codex 默认使用普通模式。

在普通模式中:

  • 根 Skill 选择工作流;
  • Agent 文件作为角色和阶段提示;
  • 多个阶段通常在当前对话中依次执行;
  • 不自动启动后台 Agent;
  • 不自动执行 Claude Hooks;
  • 不自动调用外部模型。

项目还提供可选的 Full Runtime Profile,包括:

  • Planner;
  • Codex Agent Team 模板;
  • Hook Pack;
  • 路由计划;
  • 质量门禁;
  • 已知降级记录。

但它默认关闭。

只有明确需要以下能力时才考虑:

  • 多 Agent 委派;
  • 并行审稿;
  • Planner 驱动流程;
  • Hook 行为;
  • 更复杂的运行时调度。

初学者没有必要一开始就启用 Full Runtime。


二十七、Cross-model Review 是什么?

Cross-model Review 是指让另一个模型作为独立审稿人或反方检查者。

理论上,不同模型可能具有不同偏差。引入第二模型有助于发现单一模型遗漏的问题。

但 Cross-model Review 默认关闭,因为它涉及:

  • 外部 API;
  • API Key;
  • 可能的额外费用;
  • 未公开稿件的外部传输;
  • 隐私与合规问题;
  • 模型身份和来源披露。

启用前必须明确:

  1. 使用哪个服务商;
  2. 使用哪个模型;
  3. 发送哪些内容;
  4. 是否发送全文;
  5. 是否包含未公开数据;
  6. 用户是否明确同意;
  7. 失败时如何降级。

如果没有配置或没有用户同意,ARS-Codex 应退回单一 Codex 审查,并说明 Cross-model Review 没有执行。

绝不能假装已经进行了外部模型审查。


二十八、安全和隐私边界

科研文件可能包含:

  • 未公开论文;
  • 审稿意见;
  • 编辑决定;
  • 合作单位内部数据;
  • 患者信息;
  • 专利前材料;
  • 未发布实验结果;
  • 受保密协议保护的数据。

使用 ARS-Codex 时,应遵循以下原则。

1. 审稿默认只读

如果用户只要求审查论文,不应自动修改论文原文件。

应先输出:

  • 问题;
  • 证据;
  • 风险;
  • 修改建议。

只有用户明确进入写作或修改工作流,才进行编辑。

2. PDF 和论文内容属于不可信输入

论文或 PDF 中可能包含类似提示词的文本。这些内容不能覆盖:

  • 用户要求;
  • 安全规则;
  • 网络权限;
  • 文件权限;
  • 外部模型上传限制。

3. 外部核验只发送必要信息

核验引用时,优先发送:

  • 题名;
  • DOI;
  • 作者;
  • 年份;
  • 短查询词。

不要因为某个 API Key 已经配置,就自动上传完整未公开论文。

4. AI 使用应符合政策

不同学校、期刊和会议对 AI 辅助写作有不同政策。

可以使用:

ars-disclosure

帮助生成 AI 使用声明,但最终声明内容必须符合实际使用情况和投稿要求。


二十九、常见问题与排错

问题一:安装后看不到五个 Skill

正常。

ARS-Codex 只注册一个:

academic-research-suite

五条工作流位于内部。

问题二:/ars-plan 没有反应

Codex 可能拦截 Slash 输入。

使用:

ars-plan 我的论文主题

或:

请使用 $academic-research-suite:
ars-plan 我的论文主题。

问题三:给出论文题目后,它不写大纲,反而一直提问

如果只有宽泛题目,没有明确研究问题,这是预期行为。

系统正在进入 Socratic 模式帮助收敛问题。

如果已经确定研究问题,并希望跳过收敛,可以明确说明:

我已经确认研究问题。
请跳过问题收敛,直接进入 outline-only 模式。

问题四:为什么没有自动启动多个 Agent?

普通 Codex 模式下,Agent 文件主要作为角色提示。

只有用户明确要求委派、并行或 Full Runtime 时,才考虑真正的子 Agent。

问题五:为什么它不自动修改论文?

审查和审计任务默认只读,这是保护原稿的设计。

需要修改时,应明确说:

进入 revision 模式,
请修改副本,不覆盖原稿。

问题六:为什么不自动生成参考文献?

因为 ARS 要求无法核验的引用必须标记,而不是通过模型记忆生成一条看似完整的引用。

问题七:可以完全自动完成博士论文吗?

不能可靠地完成。

它可以帮助:

  • 收敛研究问题;
  • 组织文献;
  • 设计实验;
  • 检查推导;
  • 规划论文;
  • 审查引用;
  • 修改语言;
  • 模拟审稿。

但研究贡献、理论创新、数据真实性和最终结论仍由作者负责。


三十、ARS-Codex 与其他科研技能有什么区别?

项目 主要强项 更适合
ARS-Codex 研究问题、文献、写作、审稿和完整性门禁 通用学术研究
Claude Scholar 实验、项目记忆、Zotero/Obsidian 工作流 AI/ML 长期科研项目
Scientific Agent Skills 科学数据库、软件包和领域工具 AI for Science
AI Research Skills 模型训练、评估和 ML 工程实验 AI/ML 工程研究

ARS-Codex 最突出的特点不是“自动化最多”,而是:

  • 宽泛主题先收敛问题;
  • 引用需要核验;
  • 作者阅读与模型读取分开记录;
  • 审查任务默认只读;
  • 完整流程设置阶段门禁;
  • 证据、推断和建议需要分开;
  • 外部模型审查需要显式同意。

三十一、ARS-Codex 的优点

1. 研究流程完整

从研究问题到修改定稿,覆盖范围比较全面。

2. 人类确认点明确

系统不会把所有决策都交给 AI。

3. 引用纪律严格

强调无法核验就标记,而不是补造参考文献。

4. 支持多种研究任务

不仅能写论文,还能处理:

  • 系统综述;
  • Meta 分析;
  • 事实核查;
  • 同行评议;
  • 实验规划;
  • 人体研究协议;
  • 复现检查。

5. Codex 原生适配

它不是简单复制 Claude Code 文件,而是针对 Codex 的 Skill、插件、路由和权限进行了适配。

6. 适合逐阶段使用

用户可以在每个阶段检查结果,而不是等待 AI 静默生成整篇论文。


三十二、ARS-Codex 的局限

1. 不替代真正的文献阅读

摘要和元数据不能替代阅读全文。

2. 不保证研究创新性

检索范围有限时,只能得到“在当前检索范围内未发现”的结论,不能证明世界上从未有人研究。

3. 不保证数学证明正确

数学推导仍需逐步检查、寻找反例并进行形式化或人工验证。

4. 不自动拥有数据库权限

是否能访问论文和 API,取决于网络、权限和外部服务。

5. 工作流较复杂

初学者可能觉得阶段较多、提问较多,不如直接让 AI 写作快捷。

但这些步骤恰恰是为了减少后期出现引用、逻辑和实验问题。

6. Full Runtime 有额外复杂度

多 Agent、Hook 和 Cross-model Review 不适合所有用户。

7. 许可证限制

项目采用 CC BY-NC 4.0。

通常允许:

  • 分享;
  • 修改;
  • 非商业使用。

但要求:

  • 正确署名;
  • 遵守非商业限制。

如果计划将其用于商业产品、付费课程、商业服务或重新打包销售,应先仔细阅读许可证并确认授权范围。


三十三、它适合主动学习研究者吗?

我的判断是:

很适合文献、研究问题、实验规划、论文写作和审稿环节,但它不是主动学习算法库。

对于主动学习和主动特征获取研究者,它可以帮助:

  • 收敛研究问题;
  • 建立概念边界;
  • 设计系统综述;
  • 形成文献矩阵;
  • 核验参考文献;
  • 设计算法对比实验;
  • 检查评价指标;
  • 规划统计检验;
  • 构建论文大纲;
  • 模拟审稿;
  • 制定修改计划。

它不会直接提供:

  • 所有主动学习算法实现;
  • 完整实验运行平台;
  • 自动发现并证明新定理的系统;
  • 对研究创新性的最终保证。

最推荐的使用顺序是:

Socratic 问题收敛
        ↓
Deep Research
        ↓
Experiment Agent
        ↓
Academic Paper
        ↓
Academic Paper Reviewer
        ↓
Revision

如果要完成完整研究项目,再使用:

Academic Pipeline

统一管理阶段和门禁。


三十四、是否值得安装?

推荐安装

如果你:

  • 经常使用 Codex 做科研;
  • 需要系统文献综述;
  • 正在撰写期刊或会议论文;
  • 希望检查引用真实性;
  • 需要模拟同行评议;
  • 愿意接受分阶段研究流程;
  • 愿意亲自确认关键决策。

可以尝试

如果你:

  • 主要使用 AI 润色;
  • 偶尔需要论文大纲;
  • 尚未形成固定科研工作流;
  • 想先体验一个完整案例。

可以先从:

research question refinement
citation check
paper review

三个任务开始。

暂时不推荐

如果你:

  • 只想让 AI 快速生成整篇论文;
  • 不准备核验引用;
  • 不愿意检查实验和统计结果;
  • 希望完全无人监督运行;
  • 需要处理敏感数据,却不了解外部 API 和模型的数据政策。

三十五、总结

Academic Research Skills for Codex 最值得关注的地方,不是它能生成多少文字,而是它试图纠正一种常见的 AI 科研使用方式:

宽泛主题
   ↓
AI 直接生成论文

ARS-Codex 更推荐:

宽泛主题
   ↓
收敛研究问题
   ↓
建立文献与证据
   ↓
设计研究和实验
   ↓
判断结论强度
   ↓
规划论文结构
   ↓
写作与引用核验
   ↓
模拟同行评议
   ↓
修改与复审

这种方式看起来更慢,但更接近真实科研。

它不会替你决定一个问题是否值得研究,也不会替你承担引用、数据和结论的责任。它最大的价值,是把科研中容易遗漏的步骤整理成可重复、可检查的工作流。

对于大多数研究者,我建议从一个小任务开始:

请使用 $academic-research-suite。

我有一个宽泛研究方向,
请先帮我收敛成可回答、可证伪的研究问题。
不要写论文大纲。

如果它能够通过提问帮助你发现问题边界、证据需求和潜在反例,那么你已经开始用一种比“让 AI 帮我写论文”更成熟的方式使用科研 Agent。

理想状态不是让 AI 成为论文作者,而是:

让 AI 帮助研究者更早发现问题、更严格检查证据,并把更多精力留给真正需要人类判断的研究创新。


参考链接

本文依据 2026 年 7 月 20 日公开仓库整理。ARS-Codex 更新频率较高,插件版本、上游 ARS 版本、别名和安装命令可能继续变化。发布或安装前请再次核对官方 README、Changelog、Security 和 License。

更多推荐