Academic Research Skills for Codex 保姆级教程:从研究问题到论文审稿的完整科研工作流
一套覆盖研究问题收敛、文献综述、论文写作、同行评议、实验规划与学术完整性检查的 Codex 科研技能。
写在前面
如果你使用过 ChatGPT、Claude 或 Codex 辅助科研,可能遇到过这样的情况:
你只提供了一个宽泛主题,AI 就立刻生成了一份看似完整的论文大纲;你让它查找文献,它给出几十条格式漂亮的参考文献,却不说明哪些经过核验;你把实验结果交给它,它很快写出“本方法显著优于现有方法”,但没有检查实验设计、统计检验和实际提升幅度。
问题不只是 AI 会不会写。
真正的问题是,科研并不是“生成一段文字”,而是一条需要不断核验的证据链:
研究方向
↓
研究问题
↓
文献证据
↓
研究假设
↓
研究设计
↓
实验与数据
↓
结果解释
↓
论文写作
↓
同行评议
↓
修改与定稿
如果研究问题还不清楚,就不应该直接生成论文大纲;如果引用尚未核验,就不应该把它写成确定事实;如果实验结果无法支持结论,就不应该通过语言润色掩盖证据缺口。
Academic Research Skills for Codex,简称 ARS-Codex,正是围绕这种“研究流程和证据门禁”设计的一套科研技能。
它不是论文自动生成器,也不是一个替代研究者的“AI 科学家”。它试图让 Codex 按照更加严谨的流程,协助研究者完成:
- 研究问题收敛;
- 文献检索与综述;
- 系统综述和 Meta 分析;
- 论文规划与写作;
- 引用真实性核验;
- 实验设计与复现检查;
- 模拟同行评议;
- 审稿意见回复;
- 论文修改与定稿;
- AI 使用声明和格式转换。
本文将从零开始介绍:
- ARS-Codex 到底是什么;
- 为什么它有多个不同名称;
- 安装后为什么只出现一个 Skill;
- 五条内部工作流分别做什么;
- 如何在 Codex CLI 和 Desktop 中安装;
- 如何验证安装是否成功;
- 如何从宽泛方向收敛研究问题;
- 如何设计系统文献综述;
- 如何规划算法实验;
- 如何模拟论文审稿;
- Material Passport 和引用门禁是什么;
- 它有哪些局限和安全边界。
本文介绍的项目是 Imbad0202/academic-research-skills-codex。截至 2026 年 7 月 20 日,仓库主分支标记为 ARS-Codex 0.1.21,对接上游 Academic Research Skills v3.18.0。项目仍在持续更新,实际安装时请以官方仓库最新说明为准。
一、ARS-Codex 是什么?
ARS-Codex 是 Academic Research Skills 的 Codex 原生发行版。
它的目标是为 Codex 提供一套“人在回路”的学术研究工作流。所谓人在回路,是指:
- 人决定研究什么;
- 人判断哪些文献真正重要;
- 人确认研究假设;
- 人解释实验结果;
- 人决定哪些结论可以写进论文;
- AI 帮助执行其中重复、结构化和可核验的工作。
它不是一个大语言模型,也不会重新训练 Codex。
它主要由以下内容构成:
academic-research-suite/
├── SKILL.md
├── manifest.json
├── agents/
├── codex/
│ ├── full-runtime-manifest.json
│ ├── agents/
│ ├── hooks/
│ └── scripts/
└── ars/
├── deep-research/
├── academic-paper/
├── academic-paper-reviewer/
├── academic-pipeline/
├── experiment-agent/
├── commands/
├── shared/
├── scripts/
├── references/
└── tests/
其中,根目录下的 SKILL.md 是整个套件的入口和路由器。
当用户提出任务后,它会先判断用户究竟需要:
- 深度研究;
- 论文写作;
- 论文审查;
- 完整研究流程;
- 实验规划。
然后再读取相应工作流,而不是一次性把所有科研规则加载到上下文中。
二、为什么它有四个不同名称?
ARS-Codex 最容易让初学者困惑的地方,是项目中同时出现了多个名称。
它们之间的关系如下:
上游 Claude Code 项目
Imbad0202/academic-research-skills
│
│ 适配与重新打包
▼
Codex 原生仓库
Imbad0202/academic-research-skills-codex
│
│ 安装为 Codex 插件
▼
插件名称
ars-codex
│
│ 注册一个根技能
▼
用户调用名称
$academic-research-suite
1. academic-research-skills
这是原始的 Claude Code 版本。
它主要适合:
- Claude Code;
- Claude Code 插件系统;
- Claude 原生 Slash Commands;
- Claude Agent Team;
- 原始 ARS 项目开发和更新历史。
官方仓库是:
Imbad0202/academic-research-skills
2. academic-research-skills-codex
这是专门为 Codex 制作的姐妹发行版。
它对原始 ARS 内容进行了:
- Codex 路由适配;
- 目录重新组织;
- 单一 Skill 打包;
- Claude Agent 行为映射;
- Slash Command 别名模拟;
- Codex 安全边界适配;
- 可选 Full Runtime 封装。
3. ars-codex
这是安装到 Codex 中的插件名称。
使用 Codex 插件系统安装时,需要选择:
ars-codex
4. academic-research-suite
这是最终在对话中调用的 Skill 名称。
例如:
请使用 $academic-research-suite
帮我设计一项系统文献综述。
因此,四个名称分别代表:
| 名称 | 代表什么 |
|---|---|
academic-research-skills |
Claude Code 原版仓库 |
academic-research-skills-codex |
Codex 版仓库 |
ars-codex |
Codex 插件身份 |
academic-research-suite |
实际调用的根 Skill |
只要把这四层关系弄清楚,后面的安装和使用就不容易混乱。
三、为什么安装后只有一个 Skill?
ARS-Codex 内部包含五条主要工作流,但它只向 Codex 注册一个根技能:
academic-research-suite
很多用户安装后查看 Skills,发现没有单独出现:
deep-research
academic-paper
academic-paper-reviewer
academic-pipeline
experiment-agent
于是误以为安装不完整。
实际上,这正是 Codex 版的设计。
五个内部入口使用的是 WORKFLOW.md,不是独立的 SKILL.md。Codex 首先发现根技能,然后由根技能根据任务意图选择工作流。
可以把它理解成一家医院:
academic-research-suite
相当于分诊台
deep-research
相当于文献研究科
academic-paper
相当于论文写作科
academic-paper-reviewer
相当于同行评议科
academic-pipeline
相当于全流程管理中心
experiment-agent
相当于实验与统计科
用户不需要提前判断所有内部文件,只需要说明自己的目标和现有材料。
例如:
请使用 $academic-research-suite。
目标:写一篇期刊论文。
当前材料:已有研究问题、文献矩阵和实验结果,但没有论文大纲。
当前需要:论文结构,以及尚缺少的证据清单。
约束:英文、APA 7、面向机器学习研究者。
根技能会根据这些信息选择适当的工作流。
四、五条工作流分别做什么?
ARS-Codex 的核心是五条内部工作流。
| 工作流 | 适用任务 | 典型产物 |
|---|---|---|
deep-research |
问题收敛、文献综述、系统综述、Meta 分析、事实核查 | 研究问题、检索方案、证据综合 |
academic-paper |
大纲、摘要、正文、修改、引用格式、AI 声明 | 论文结构、章节草稿、修订建议 |
academic-paper-reviewer |
模拟同行评议、编辑决定、修改后复审 | 审稿报告、Decision Letter |
academic-pipeline |
从研究到论文的完整分阶段流程 | 阶段看板、完整性检查、修改循环 |
experiment-agent |
代码实验、人体研究、统计解释、复现检查 | 实验计划、研究协议、复现清单 |
下面分别介绍。
五、Deep Research:从研究方向到证据综合
deep-research 适合:
- 收敛研究问题;
- 文献检索;
- 叙述性综述;
- 系统文献综述;
- Meta 分析;
- 事实核查;
- 时间线提取;
- 研究风险分析;
- 证据综合。
它内部包含多个研究角色,例如:
research_question_agent:研究问题;socratic_mentor_agent:苏格拉底式提问;bibliography_agent:文献管理;source_verification_agent:来源核验;synthesis_agent:证据综合;risk_of_bias_agent:偏倚风险;meta_analysis_agent:Meta 分析;devils_advocate_agent:反方质疑;ethics_review_agent:伦理风险;report_compiler_agent:报告整理。
在普通 Codex 模式中,这些 Agent 文件主要作为分阶段角色提示,并不意味着系统一定会自动启动多个后台 Agent。
六、Academic Paper:论文结构、写作与修改
academic-paper 适合:
- 论文规划;
- 论文大纲;
- 摘要写作;
- 文献综述写作;
- 正文章节;
- 论文修改;
- 引用格式检查;
- AI 使用声明;
- LaTeX、DOCX 和 PDF 格式指导;
- Revision Coaching。
内部角色包括:
intake_agent:材料接收;structure_architect_agent:论文结构;argument_builder_agent:论证链;literature_strategist_agent:文献策略;draft_writer_agent:正文草稿;citation_compliance_agent:引用合规;peer_reviewer_agent:写作阶段自查;revision_coach_agent:修改指导;formatter_agent:格式;visualization_agent:图表规划。
它并不是收到一个题目就立即开始写作。
只有当用户已经具备以下至少一部分材料时,才适合直接进入论文工作流:
- 明确研究问题;
- 已批准的研究框架;
- 文献矩阵;
- 数据或实验结果;
- 章节笔记;
- 论文草稿;
- 明确要求跳过选题收敛。
七、Academic Paper Reviewer:模拟同行评议
academic-paper-reviewer 用于:
- 投稿前审查;
- 模拟期刊审稿;
- 方法学审查;
- 领域贡献评估;
- Devil’s Advocate 质疑;
- 编辑决定;
- 修改后复审。
主要角色包括:
field_analyst_agent:分析目标领域;domain_reviewer_agent:领域审稿;methodology_reviewer_agent:方法学审稿;perspective_reviewer_agent:不同学术视角;devils_advocate_reviewer_agent:寻找致命问题;editorial_synthesizer_agent:综合审稿意见;eic_agent:模拟主编决定。
这种设计试图避免让同一个“审稿人”同时承担所有角色。
例如,方法学审稿人可能认为实验设计存在问题,而领域审稿人可能认为问题很重要。编辑综合阶段需要保留这些差异,而不是把所有意见平均成一份温和的总结。
八、Academic Pipeline:从研究到论文的完整流程
academic-pipeline 用于跨越多个阶段的任务,例如:
研究问题
↓
文献与证据
↓
研究设计
↓
论文规划
↓
写作
↓
完整性检查
↓
模拟审稿
↓
修改
↓
复审
↓
定稿
它适合:
- 从研究材料逐步形成论文;
- 对论文项目建立阶段看板;
- 在关键节点要求用户确认;
- 检查引用和结论的一致性;
- 进行修改—复审循环;
- 在定稿前执行完整性门禁。
不建议用一句话让它静默跑完整流程:
帮我从这个主题开始写完一篇论文。
更好的方法是从一个阶段开始,并设置停止点:
请使用 $academic-research-suite 启动 academic-pipeline。
从材料接收阶段开始。
请先整理现有材料、缺失材料和主要风险,
生成 Pipeline Dashboard 后停止。
不要进入正文写作,
等待我确认后再继续。
这样用户可以在每个重要节点保持控制权。
九、Experiment Agent:实验规划与复现检查
experiment-agent 主要用于:
- 代码实验规划;
- 实验运行方案;
- 统计解释;
- 可复现性检查;
- 人体研究协议;
- 数据和环境记录;
- 结果验证。
它可以帮助回答:
- 应选择哪些数据集?
- 需要哪些基线?
- 如何设置预算?
- 应运行多少随机种子?
- 是否需要消融实验?
- 使用什么统计检验?
- 如何记录软件环境?
- 如何判断实验失败?
- 复现实验需要保存哪些文件?
它不等于自动实验平台。
能否实际运行代码,还取决于:
- Codex 当前权限;
- 本地环境;
- Python 包;
- 数据文件;
- GPU;
- 运行时间;
- 用户是否授权修改文件和执行程序。
十、最重要的设计:宽泛题目不能直接写大纲
ARS-Codex 有一条非常重要的路由规则:
如果用户只提供宽泛研究主题、暂定题目或研究方向,但没有清晰、可回答的研究问题,系统应先进入
deep-research的 Socratic 模式。
例如:
我想写一篇关于主动学习的论文。
普通 AI 可能立刻生成:
1. Introduction
2. Related Work
3. Method
4. Experiments
5. Conclusion
但这份大纲几乎没有价值,因为以下问题都不清楚:
- 主动学习中的哪个问题?
- 获取的是标签、特征还是其他信息?
- 研究的是理论、算法还是应用?
- 现有方法的缺陷是什么?
- 有什么数据?
- 用什么实验验证?
- 目标读者是谁?
ARS-Codex 在这种情况下应该先说明:
当前研究问题尚未精确,
因此先进入 deep-research 的 Socratic 模式。
然后提出三到五个收敛问题,例如:
- 你关注的是标签主动学习还是主动特征获取?
- 研究目标是降低标注成本还是提高有限预算下的性能?
- 是否已经确定数据类型和应用场景?
- 希望研究算法、理论保证还是实验应用?
- 当前最接近的已有工作有哪些?
在形成至少一个候选研究问题之前,它不应直接生成论文大纲。
这也是 ARS-Codex 与普通“论文写作提示词”最明显的区别之一。
十一、安装前需要准备什么?
本文分别介绍 Codex CLI 和 Codex Desktop 两种安装方式。
1. 检查 Codex
在终端中运行:
codex --version
如果显示版本号,说明 Codex CLI 已安装。
2. 检查 Python
直接安装 Skill 的备用方案需要 Python 3:
python3 --version
macOS 和多数 Linux 环境使用 python3。部分旧教程写的是 python,但它未必指向 Python 3。
3. 决定安装方式
ARS-Codex 目前有两种主要安装方式:
| 方式 | 特点 |
|---|---|
| Codex Plugin | 推荐,便于更新和管理 |
| Direct Skill Install | 兼容方案,只安装根 Skill |
不要同时重复安装两个版本,否则可能出现两个来源相同的 Skill。
十二、使用 Codex CLI 安装插件
当前官方推荐的插件安装方式是:
codex plugin marketplace add \
Imbad0202/academic-research-skills-codex \
--ref main
然后安装插件:
codex plugin add ars-codex@ars-codex
这两条命令分别做了什么?
第一步:添加 Marketplace
codex plugin marketplace add ...
告诉 Codex:
- 插件仓库在哪里;
- 使用哪个 Git 分支;
- 从哪里获取插件清单。
第二步:安装插件
codex plugin add ars-codex@ars-codex
从刚添加的 Marketplace 中安装 ars-codex。
安装完成后,需要新开一个 Codex 对话。已经打开的对话可能保留旧的 Skill 缓存。
更新插件
后续更新可以使用:
codex plugin marketplace upgrade ars-codex
codex plugin add ars-codex@ars-codex
项目更新较快,升级前建议查看 Changelog。
十三、在 Codex Desktop 中安装
如果不熟悉命令行,可以通过 Codex Desktop 的 Plugins 页面安装。
基本流程是:
- 打开 Codex;
- 进入 Plugins;
- 添加新的 Marketplace Source;
- 填写仓库地址;
- Branch/ref 选择
main; - 在 Marketplace 中找到
ars-codex; - 点击安装;
- 新建一个 Codex 对话;
- 查看 Skills。
Marketplace 地址为:
https://github.com/Imbad0202/academic-research-skills-codex.git
Branch/ref:
main
插件:
ars-codex
官方特意为 Codex Desktop 提供了实体目录版本,而不是依赖符号链接。这有助于避免 Windows 插件缓存把符号链接当作普通文本文件,从而漏掉 Skill 注册。ARS-Codex 官方安装说明
十四、直接安装 Skill
如果当前 Codex 版本不方便使用插件,也可以直接安装根 Skill:
python3 "$HOME/.codex/skills/.system/skill-installer/scripts/install-skill-from-github.py" \
--repo Imbad0202/academic-research-skills-codex \
--ref main \
--path skills/academic-research-suite \
--method git
参数含义:
| 参数 | 作用 |
|---|---|
--repo |
GitHub 仓库 |
--ref |
使用的分支 |
--path |
Skill 在仓库中的路径 |
--method git |
使用 Git 获取内容 |
安装完成后,新开一个 Codex 对话。
直接安装和插件安装的最终入口都是:
$academic-research-suite
不过插件方式通常更方便更新。
十五、如何验证安装成功?
第一步:查看 Skills
在新对话中输入:
/skills
预期看到一个类似以下名称的条目:
academic-research-suite
或者:
ARS-Codex
不应该从这个包中看到五个相互独立的工作流 Skill。
第二步:测试根技能
输入:
请使用 $academic-research-suite。
本次只进行路由测试,
不要搜索网络,不要修改文件。
用户请求:
我想写一篇关于生成式 AI 教育应用的论文,
但还没有明确研究问题。
请判断应进入哪个工作流和模式。
预期:
deep-research
socratic mode
第三步:测试 Socratic 行为
请使用 $academic-research-suite。
我想写一篇关于主动学习的论文,
但目前只有宽泛方向。
请先帮助我收敛研究问题,
不要生成论文大纲。
正确表现包括:
- 说明为什么先进行问题收敛;
- 提出三到五个针对性问题;
- 不立即生成完整大纲;
- 不编造文献;
- 等待用户回答后再继续。
十六、怎样写出更有效的 ARS 提示词?
最有效的提示词通常包含四部分:
目标
当前材料
当前需要
约束
推荐模板:
请使用 $academic-research-suite。
目标:
我希望完成一篇关于序分类主动特征获取的期刊论文。
当前材料:
已经有研究问题、算法代码、实验结果和部分文献,
但文献矩阵还不完整。
当前需要:
先设计论文结构,
并列出每个章节仍然缺少的证据。
约束:
中文;
不编造参考文献;
当前只做规划,不修改原始文件;
每个结论要区分事实、推断和建议。
这比简单说:
帮我写论文。
更容易得到可用结果。
十七、ARS 别名速查表
ARS 原版在 Claude Code 中提供 /ars-* 命令。
Codex 不一定注册相同的原生 Slash Commands,因此 Codex 版将它们模拟成别名。
| 别名 | 主要功能 |
|---|---|
ars-plan |
论文规划 |
ars-outline |
只生成论文大纲 |
ars-abstract |
摘要任务 |
ars-lit-review |
文献综述 |
ars-citation-check |
引用检查 |
ars-disclosure |
AI 使用声明 |
ars-format-convert |
格式转换 |
ars-revision-coach |
苏格拉底式修改指导 |
ars-revision |
论文修改 |
ars-reviewer |
完整论文审查 |
ars-mark-read |
标记作者亲自读过的文献 |
ars-unmark-read |
撤销已读标记 |
ars-cache-invalidate |
使某条引用核验缓存失效 |
ars-full |
启动完整研究—论文流程 |
推荐调用方式:
请使用 $academic-research-suite:
ars-outline 根据以下研究问题设计论文大纲。
如果 Codex 客户端允许 Slash 文本直接进入对话,也可以尝试:
/ars-outline 根据以下研究问题设计论文大纲。
如果斜杠输入被客户端拦截,使用不带斜杠的形式:
ars-outline 根据以下研究问题设计论文大纲。
十八、实战一:从宽泛方向收敛研究问题
下面以“序分类主动特征获取”为例。
初始方向
利用标签顺序信息改进主动特征获取。
这还不是一个完整研究问题。
需要进一步明确:
- 数据是完全缺失还是部分缺失?
- 获取的是哪个样本的哪个特征?
- 是否考虑不同特征成本?
- 分类标签的顺序信息如何表示?
- 优化目标是 Accuracy、序分类损失还是单位成本收益?
- 获取策略是一次性还是序贯的?
- 是否需要理论保证?
推荐提示词
请使用 $academic-research-suite。
当前研究方向:
利用标签顺序信息改进主动特征获取。
当前状态:
只有宽泛方向,没有明确研究问题。
请进入 deep-research 的 Socratic 模式,
帮助我完成:
1. 定义问题边界;
2. 区分主动学习、主动特征获取、特征选择和缺失值填补;
3. 识别最重要的研究变量;
4. 形成不超过三个候选研究问题;
5. 为每个问题给出需要核验的文献证据;
6. 为每个问题设置证伪条件;
7. 暂时不要生成论文大纲;
8. 不要把未经文献验证的想法称为创新点。
理想输出
它不应只是生成十个标题,而应形成:
| 项目 | 示例 |
|---|---|
| 研究对象 | 具有有序标签的分类数据 |
| 决策对象 | 下一项需要获取的缺失特征 |
| 约束 | 有限预算和非均匀特征成本 |
| 优化目标 | 单位成本下的序分类风险下降 |
| 候选假设 | 利用顺序结构可以减少远距离分类错误 |
| 证据需求 | 查找序信息进入获取策略的已有工作 |
| 证伪条件 | 在多个数据集上不优于普通不确定性策略 |
研究问题示例
经过多轮收敛后,可能形成:
在具有非均匀特征获取成本的序分类任务中,直接将类别顺序结构引入特征获取效用估计,能否在相同预算下显著降低序分类风险?
这时才适合进入文献检索、实验设计和论文规划。
十九、实战二:设计系统文献综述
假设研究主题是:
成本敏感的主动特征获取方法如何处理特征依赖、不确定性和缺失数据?
推荐提示词:
请使用 $academic-research-suite 的 deep-research 工作流。
目标:
设计一项关于成本敏感主动特征获取的系统文献综述。
请输出:
1. 主要研究问题和子问题;
2. 核心概念及其边界;
3. 推荐数据库;
4. 检索式;
5. 时间范围;
6. 纳入与排除标准;
7. 去重方法;
8. 标题、摘要和全文筛选流程;
9. 文献质量评价方法;
10. 数据提取字段;
11. 偏倚风险;
12. 证据综合方法;
13. 引用核验规则;
14. 仍然需要研究者人工决定的事项。
要求:
不编造论文;
无法核验的信息必须标记;
区分事实、推断和研究建议。
建立概念边界
系统综述首先要区分:
| 概念 | 获取对象 | 主要目标 |
|---|---|---|
| 主动学习 | 样本标签 | 降低标注成本 |
| 主动特征获取 | 未观测特征 | 在预算下提高预测性能 |
| 特征选择 | 全局特征子集 | 降维与泛化 |
| 缺失值填补 | 缺失特征值 | 恢复完整数据 |
| 成本敏感学习 | 错误或信息成本 | 优化总决策代价 |
如果概念边界不清楚,检索结果会混入大量表面相关、实际不同的问题。
建议提取字段
| 字段 | 作用 |
|---|---|
| 题名 | 论文身份 |
| 作者和年份 | 基础元数据 |
| DOI/链接 | 核验入口 |
| 问题设置 | 论文解决什么问题 |
| 获取对象 | 标签、特征或其他信息 |
| 获取策略 | 如何决定下一次获取 |
| 成本模型 | 是否考虑不同成本 |
| 特征依赖 | 是否建模 |
| 理论保证 | 是否有定理或误差界 |
| 数据集 | 实验范围 |
| 基线 | 对比方法 |
| 主要结论 | 论文报告了什么 |
| 局限性 | 尚未解决什么 |
不要把“论文存在”当成“论点成立”
至少需要分开检查:
- 论文是否真实存在;
- 元数据是否正确;
- 论文是否与主题相关;
- 论文是否真的支持当前陈述;
- 当前陈述是否超过论文证据范围。
二十、实战三:规划机器学习实验
假设要研究:
利用序信息的主动特征获取方法,是否能在相同预算下降低序分类错误?
推荐提示词:
请使用 $academic-research-suite 的 experiment-agent 工作流。
研究问题:
利用类别顺序信息的主动特征获取方法,
是否能在相同预算下降低序分类风险?
请设计可复现实验方案,包括:
1. 可检验假设;
2. 自变量、因变量和控制变量;
3. 数据集选择标准;
4. 基线方法;
5. 预算设置;
6. 特征成本设置;
7. 分类评价指标;
8. 序分类评价指标;
9. 随机种子和重复次数;
10. 消融实验;
11. 敏感性分析;
12. 统计检验;
13. 失败判据;
14. 代码、数据和运行环境记录;
15. 复现清单。
当前只设计实验,不运行代码。
基线不能太弱
建议至少包括:
- Random Acquisition;
- Cheapest First;
- Global Feature Importance;
- Uncertainty-Based Acquisition;
- 不使用序信息的对应方法;
- Proposed Method;
- 在可能情况下加入 Oracle 或近似上界。
评价指标
普通分类指标可以包括:
- Accuracy;
- Macro-F1;
- Balanced Accuracy;
- AUROC。
序分类还应考虑:
- Mean Absolute Error;
- Mean Squared Error;
- 邻近类别误差;
- 序分类专用损失;
- 远距离错分比例。
只使用 Accuracy 可能无法反映将类别 1 预测为 2,与预测为 5 的差异。
复现材料
至少记录:
Python 版本
依赖版本
操作系统
随机种子
数据版本
预处理步骤
配置文件
运行命令
原始结果
统计脚本
绘图脚本
硬件信息
二十一、实战四:生成论文结构
只有研究问题和证据已经比较明确时,才进入论文结构设计。
提示词:
请使用 $academic-research-suite:
ars-outline
研究问题:
在具有非均匀特征成本的序分类任务中,
将类别顺序结构引入特征获取效用估计,
能否在相同预算下降低序分类风险?
现有材料:
1. 已完成文献矩阵;
2. 已完成算法设计;
3. 已完成三个公开数据集实验;
4. 已完成显著性检验;
5. 已记录方法局限。
目标:
生成期刊论文大纲。
要求:
1. 每一节说明核心论点;
2. 每个论点列出所需证据;
3. 标记当前缺失材料;
4. 不填补不存在的结果;
5. 区分背景、贡献和实验发现;
6. 暂时不写完整正文。
理想的大纲不应该只有标题,还应包含:
- 每节要回答的问题;
- 每节的中心论点;
- 所需文献;
- 所需实验;
- 图表位置;
- 当前证据缺口;
- 与前后章节的逻辑关系。
二十二、实战五:模拟同行评议
准备好论文草稿后,可以使用:
请使用 $academic-research-suite:
ars-reviewer
输入:
这篇论文草稿。
模式:
Full Review。
重点:
1. 研究贡献;
2. 新颖性;
3. 方法学;
4. 实验充分性;
5. 统计可靠性;
6. 引用完整性;
7. 过度结论;
8. 可能导致 Desk Reject 的问题。
输出:
1. 各角色独立审稿意见;
2. Major Concerns;
3. Minor Concerns;
4. 必须补充的实验;
5. 可选改进;
6. 编辑决定信;
7. 结论置信度。
本次只读审查,不修改论文原文件。
为什么需要不同审稿角色?
一个领域审稿人可能更关注:
- 研究问题是否重要;
- 是否与已有工作重复;
- 贡献是否足够。
方法学审稿人则可能关注:
- 数据是否合理;
- 基线是否充分;
- 统计检验是否正确;
- 是否存在数据泄漏。
Devil’s Advocate 会主动寻找:
- 最强反例;
- 隐藏假设;
- 过度解释;
- 可能导致拒稿的逻辑漏洞。
最终由编辑综合阶段形成决定,而不是简单平均所有意见。
二十三、实战六:使用 Revision Coach 修改论文
收到审稿意见后,不建议立即让 AI 全文重写。
可以先调用:
请使用 $academic-research-suite:
ars-revision-coach
输入:
论文草稿和审稿意见。
请通过 Socratic 方式帮助我:
1. 区分必须修改和可选修改;
2. 识别哪些问题需要补实验;
3. 识别哪些问题只需要解释;
4. 找出论文中对应修改位置;
5. 判断哪些审稿意见可能基于误解;
6. 制定修改顺序;
7. 暂时不要直接重写全文。
这种方式有助于保持作者对论文内容的控制。
确认修改策略后,再调用:
ars-revision
要求修改指定章节,并保留修改记录。
二十四、什么是 Material Passport?
Material Passport 可以理解为当前研究任务的“材料边界和来源记录”。
它关注:
- 当前有哪些论文;
- 哪些材料已被纳入;
- 哪些引用经过核验;
- 哪些引用由作者亲自阅读;
- 哪些内容来自当前材料;
- 哪些结论仍然缺乏证据。
它的重要意义是:
AI 读取过一篇论文,不等于作者亲自阅读过这篇论文。
因此,ARS 提供:
ars-mark-read
用于标记作者已经亲自阅读某条引用。
以及:
ars-unmark-read
用于撤销标记。
这类标记不是对理解程度的证明,而是研究流程中的来源信号。
新对话与材料边界
ARS-Codex 将上游文档中的“新 Claude Code 会话”解释为“新 Codex 对话”。
新对话可能不再拥有旧对话中的完整材料上下文。因此,进入新的写作或审查阶段时,需要重新确认:
- 使用哪些文件;
- 哪些引用已核验;
- 哪些材料属于当前版本;
- 是否需要重新建立 Material Passport。
二十五、引用缓存与重新核验
为了避免重复查询,某些程序化引用验证可以使用本地缓存。
但需要注意:
- 缓存较旧不等于文献失效;
- 旧缓存通常只产生提醒;
- 期刊状态、链接或元数据可能发生变化;
- 关键引用可以进行实时重新核验。
如果某条引用需要重新验证,可以使用:
ars-cache-invalidate
使对应缓存失效。
重新核验时仍应优先使用:
- DOI;
- 出版社或会议官方页面;
- Crossref;
- arXiv;
- OpenAlex;
- Semantic Scholar;
- 其他权威元数据源。
无法验证时,应标记为未验证,而不是根据模型记忆补全。
二十六、普通 Agent 模式与 Full Runtime 有什么区别?
ARS-Codex 默认使用普通模式。
在普通模式中:
- 根 Skill 选择工作流;
- Agent 文件作为角色和阶段提示;
- 多个阶段通常在当前对话中依次执行;
- 不自动启动后台 Agent;
- 不自动执行 Claude Hooks;
- 不自动调用外部模型。
项目还提供可选的 Full Runtime Profile,包括:
- Planner;
- Codex Agent Team 模板;
- Hook Pack;
- 路由计划;
- 质量门禁;
- 已知降级记录。
但它默认关闭。
只有明确需要以下能力时才考虑:
- 多 Agent 委派;
- 并行审稿;
- Planner 驱动流程;
- Hook 行为;
- 更复杂的运行时调度。
初学者没有必要一开始就启用 Full Runtime。
二十七、Cross-model Review 是什么?
Cross-model Review 是指让另一个模型作为独立审稿人或反方检查者。
理论上,不同模型可能具有不同偏差。引入第二模型有助于发现单一模型遗漏的问题。
但 Cross-model Review 默认关闭,因为它涉及:
- 外部 API;
- API Key;
- 可能的额外费用;
- 未公开稿件的外部传输;
- 隐私与合规问题;
- 模型身份和来源披露。
启用前必须明确:
- 使用哪个服务商;
- 使用哪个模型;
- 发送哪些内容;
- 是否发送全文;
- 是否包含未公开数据;
- 用户是否明确同意;
- 失败时如何降级。
如果没有配置或没有用户同意,ARS-Codex 应退回单一 Codex 审查,并说明 Cross-model Review 没有执行。
绝不能假装已经进行了外部模型审查。
二十八、安全和隐私边界
科研文件可能包含:
- 未公开论文;
- 审稿意见;
- 编辑决定;
- 合作单位内部数据;
- 患者信息;
- 专利前材料;
- 未发布实验结果;
- 受保密协议保护的数据。
使用 ARS-Codex 时,应遵循以下原则。
1. 审稿默认只读
如果用户只要求审查论文,不应自动修改论文原文件。
应先输出:
- 问题;
- 证据;
- 风险;
- 修改建议。
只有用户明确进入写作或修改工作流,才进行编辑。
2. PDF 和论文内容属于不可信输入
论文或 PDF 中可能包含类似提示词的文本。这些内容不能覆盖:
- 用户要求;
- 安全规则;
- 网络权限;
- 文件权限;
- 外部模型上传限制。
3. 外部核验只发送必要信息
核验引用时,优先发送:
- 题名;
- DOI;
- 作者;
- 年份;
- 短查询词。
不要因为某个 API Key 已经配置,就自动上传完整未公开论文。
4. AI 使用应符合政策
不同学校、期刊和会议对 AI 辅助写作有不同政策。
可以使用:
ars-disclosure
帮助生成 AI 使用声明,但最终声明内容必须符合实际使用情况和投稿要求。
二十九、常见问题与排错
问题一:安装后看不到五个 Skill
正常。
ARS-Codex 只注册一个:
academic-research-suite
五条工作流位于内部。
问题二:/ars-plan 没有反应
Codex 可能拦截 Slash 输入。
使用:
ars-plan 我的论文主题
或:
请使用 $academic-research-suite:
ars-plan 我的论文主题。
问题三:给出论文题目后,它不写大纲,反而一直提问
如果只有宽泛题目,没有明确研究问题,这是预期行为。
系统正在进入 Socratic 模式帮助收敛问题。
如果已经确定研究问题,并希望跳过收敛,可以明确说明:
我已经确认研究问题。
请跳过问题收敛,直接进入 outline-only 模式。
问题四:为什么没有自动启动多个 Agent?
普通 Codex 模式下,Agent 文件主要作为角色提示。
只有用户明确要求委派、并行或 Full Runtime 时,才考虑真正的子 Agent。
问题五:为什么它不自动修改论文?
审查和审计任务默认只读,这是保护原稿的设计。
需要修改时,应明确说:
进入 revision 模式,
请修改副本,不覆盖原稿。
问题六:为什么不自动生成参考文献?
因为 ARS 要求无法核验的引用必须标记,而不是通过模型记忆生成一条看似完整的引用。
问题七:可以完全自动完成博士论文吗?
不能可靠地完成。
它可以帮助:
- 收敛研究问题;
- 组织文献;
- 设计实验;
- 检查推导;
- 规划论文;
- 审查引用;
- 修改语言;
- 模拟审稿。
但研究贡献、理论创新、数据真实性和最终结论仍由作者负责。
三十、ARS-Codex 与其他科研技能有什么区别?
| 项目 | 主要强项 | 更适合 |
|---|---|---|
| ARS-Codex | 研究问题、文献、写作、审稿和完整性门禁 | 通用学术研究 |
| Claude Scholar | 实验、项目记忆、Zotero/Obsidian 工作流 | AI/ML 长期科研项目 |
| Scientific Agent Skills | 科学数据库、软件包和领域工具 | AI for Science |
| AI Research Skills | 模型训练、评估和 ML 工程实验 | AI/ML 工程研究 |
ARS-Codex 最突出的特点不是“自动化最多”,而是:
- 宽泛主题先收敛问题;
- 引用需要核验;
- 作者阅读与模型读取分开记录;
- 审查任务默认只读;
- 完整流程设置阶段门禁;
- 证据、推断和建议需要分开;
- 外部模型审查需要显式同意。
三十一、ARS-Codex 的优点
1. 研究流程完整
从研究问题到修改定稿,覆盖范围比较全面。
2. 人类确认点明确
系统不会把所有决策都交给 AI。
3. 引用纪律严格
强调无法核验就标记,而不是补造参考文献。
4. 支持多种研究任务
不仅能写论文,还能处理:
- 系统综述;
- Meta 分析;
- 事实核查;
- 同行评议;
- 实验规划;
- 人体研究协议;
- 复现检查。
5. Codex 原生适配
它不是简单复制 Claude Code 文件,而是针对 Codex 的 Skill、插件、路由和权限进行了适配。
6. 适合逐阶段使用
用户可以在每个阶段检查结果,而不是等待 AI 静默生成整篇论文。
三十二、ARS-Codex 的局限
1. 不替代真正的文献阅读
摘要和元数据不能替代阅读全文。
2. 不保证研究创新性
检索范围有限时,只能得到“在当前检索范围内未发现”的结论,不能证明世界上从未有人研究。
3. 不保证数学证明正确
数学推导仍需逐步检查、寻找反例并进行形式化或人工验证。
4. 不自动拥有数据库权限
是否能访问论文和 API,取决于网络、权限和外部服务。
5. 工作流较复杂
初学者可能觉得阶段较多、提问较多,不如直接让 AI 写作快捷。
但这些步骤恰恰是为了减少后期出现引用、逻辑和实验问题。
6. Full Runtime 有额外复杂度
多 Agent、Hook 和 Cross-model Review 不适合所有用户。
7. 许可证限制
项目采用 CC BY-NC 4.0。
通常允许:
- 分享;
- 修改;
- 非商业使用。
但要求:
- 正确署名;
- 遵守非商业限制。
如果计划将其用于商业产品、付费课程、商业服务或重新打包销售,应先仔细阅读许可证并确认授权范围。
三十三、它适合主动学习研究者吗?
我的判断是:
很适合文献、研究问题、实验规划、论文写作和审稿环节,但它不是主动学习算法库。
对于主动学习和主动特征获取研究者,它可以帮助:
- 收敛研究问题;
- 建立概念边界;
- 设计系统综述;
- 形成文献矩阵;
- 核验参考文献;
- 设计算法对比实验;
- 检查评价指标;
- 规划统计检验;
- 构建论文大纲;
- 模拟审稿;
- 制定修改计划。
它不会直接提供:
- 所有主动学习算法实现;
- 完整实验运行平台;
- 自动发现并证明新定理的系统;
- 对研究创新性的最终保证。
最推荐的使用顺序是:
Socratic 问题收敛
↓
Deep Research
↓
Experiment Agent
↓
Academic Paper
↓
Academic Paper Reviewer
↓
Revision
如果要完成完整研究项目,再使用:
Academic Pipeline
统一管理阶段和门禁。
三十四、是否值得安装?
推荐安装
如果你:
- 经常使用 Codex 做科研;
- 需要系统文献综述;
- 正在撰写期刊或会议论文;
- 希望检查引用真实性;
- 需要模拟同行评议;
- 愿意接受分阶段研究流程;
- 愿意亲自确认关键决策。
可以尝试
如果你:
- 主要使用 AI 润色;
- 偶尔需要论文大纲;
- 尚未形成固定科研工作流;
- 想先体验一个完整案例。
可以先从:
research question refinement
citation check
paper review
三个任务开始。
暂时不推荐
如果你:
- 只想让 AI 快速生成整篇论文;
- 不准备核验引用;
- 不愿意检查实验和统计结果;
- 希望完全无人监督运行;
- 需要处理敏感数据,却不了解外部 API 和模型的数据政策。
三十五、总结
Academic Research Skills for Codex 最值得关注的地方,不是它能生成多少文字,而是它试图纠正一种常见的 AI 科研使用方式:
宽泛主题
↓
AI 直接生成论文
ARS-Codex 更推荐:
宽泛主题
↓
收敛研究问题
↓
建立文献与证据
↓
设计研究和实验
↓
判断结论强度
↓
规划论文结构
↓
写作与引用核验
↓
模拟同行评议
↓
修改与复审
这种方式看起来更慢,但更接近真实科研。
它不会替你决定一个问题是否值得研究,也不会替你承担引用、数据和结论的责任。它最大的价值,是把科研中容易遗漏的步骤整理成可重复、可检查的工作流。
对于大多数研究者,我建议从一个小任务开始:
请使用 $academic-research-suite。
我有一个宽泛研究方向,
请先帮我收敛成可回答、可证伪的研究问题。
不要写论文大纲。
如果它能够通过提问帮助你发现问题边界、证据需求和潜在反例,那么你已经开始用一种比“让 AI 帮我写论文”更成熟的方式使用科研 Agent。
理想状态不是让 AI 成为论文作者,而是:
让 AI 帮助研究者更早发现问题、更严格检查证据,并把更多精力留给真正需要人类判断的研究创新。
参考链接
- ARS-Codex 官方仓库
- Academic Research Skills Claude Code 原版
- ARS-Codex 官方安装说明
- ARS-Codex 使用说明
- Agent Skills 开放标准
本文依据 2026 年 7 月 20 日公开仓库整理。ARS-Codex 更新频率较高,插件版本、上游 ARS 版本、别名和安装命令可能继续变化。发布或安装前请再次核对官方 README、Changelog、Security 和 License。
更多推荐
所有评论(0)