数据论文曾经面对的主要问题是:如何让数据像论文一样获得 DOI、同行评审和学术信用。

到了2026年,这个问题已经不够了。

生成式人工智能、知识图谱、检索增强生成和大规模机器学习的发展,正在把研究数据从“供研究者下载的学术成果”,变成可以被机器自动发现、解析、组合乃至用于训练模型的知识资源。数据是否开放仍然重要,但更迫切的问题已经变成:

  • 机器能否正确理解数据?
  • 数据的生成和加工过程能否被追溯?
  • 数据适合哪些用途,又不适合哪些用途?
  • 数据中的偏差、不确定性和权利限制能否被计算系统识别?
  • 当数据持续更新时,一篇静态论文还能否承担说明责任?
  • 大语言模型参与数据审查后,谁对错误和泄露负责?

这也是2026年7月《开放人文数据期刊》(Journal of Open Humanities Data, JOHD)主编 Barbara McGillivray 与韩国科技信息研究所 KISTI 展开交流时,真正值得追问的深层问题。

表面上,这次对话讨论的是 JISTaP 如何引入数据论文;实际上,它触及的是学术出版的一次结构性转型:

期刊正在从“发表数据说明书”,走向“认证数据责任链”。

如果看不到这一变化,数据论文就可能成为开放科学时代的过渡性产品:它解决了数据的可引用问题,却无法回应人工智能时代的数据可解释、可追踪和负责任重用问题。


一、从“可供人阅读”到“可供机器判断”

传统数据论文主要面向人类研究者。

作者通过论文解释数据从何而来、如何采集、包含哪些字段、存放在哪里,以及其他人应当如何引用。审稿人阅读论文、抽查数据并提出修改意见,最终由编辑决定是否发表。

这种模式隐含了一个前提:未来的数据重用者会先阅读论文,再使用数据。

但这一前提正在失效。

今天的数据可能被搜索引擎自动索引,被数据聚合平台批量收集,被知识图谱转换为实体和关系,被人工智能系统作为训练、评估或检索语料。数据进入下游系统时,与之配套的论文未必会被读取;即使被读取,其中用自然语言表达的限制条件,也未必能被机器正确识别。

2025年发表于 Scientific Data 的研究 “On the Readiness of Scientific Data Papers for a FAIR and Transparent Use in Machine Learning”,对不同领域的 4,041篇数据论文进行了考察。其重要意义并不只是再次评价数据是否符合 FAIR,而是提出了一个更前沿的问题:

数据论文是否为机器学习中的透明使用提供了足够的信息?

这意味着,数据出版的评价标准正在发生变化。过去,只要数据拥有持久标识符、开放许可、元数据和下载地址,就可能被认为具备较高的开放性;现在还要进一步判断:

  • 数据的采样边界是否明确?
  • 标签由谁、以何种规范生成?
  • 是否记录自动处理与人工修订环节?
  • 是否说明数据代表性不足?
  • 是否披露缺失记录和排除标准?
  • 是否标注敏感用途与禁止用途?
  • 机器能否识别版本、来源和许可?
  • 数据是否适合被纳入模型训练?

由此看,数据论文未来的作用不能停留在“让数据可发现”,还必须帮助人和机器判断:

这套数据能否用于某一具体任务,以及使用者应当承担什么责任。

这是一种从 FAIR 向 AI-ready、AI-aware 和 responsible reuse 的转变。


二、数据论文真正认证的,不是“数据正确”,而是“责任可以追溯”

数据论文常被描述为经过同行评审的数据出版物。这种说法容易让读者误以为,期刊已经核实了整个数据集的正确性。

事实上,绝大多数期刊既没有能力,也没有资源逐条验证底层数据。

一个包含数十万条历史人物记录的数据集,可能涉及同名异人、年代推断、古今地名映射、身份分类和来源冲突。审稿人能够抽查若干记录,却不能重新完成整个项目。即使论文顺利通过评审,也不能证明数据没有错误。

因此,数据论文不应发出一种过强的质量承诺。它真正能够认证的是:

  1. 作者公开说明了数据的来源和生成过程;
  2. 数据、代码、元数据与论文之间基本一致;
  3. 数据中的关键选择和限制可以被检查;
  4. 作者、期刊和存储库的责任有所划分;
  5. 出现问题后,可以定位到相关版本和处理环节。

换言之,数据出版应当从“质量认证”转向可审计性认证

这也是2025年 Wang 等人在 “What Are Journals and Reviewers Concerned About in Data Papers?” 中呈现出的重要问题。该研究考察了 22种发表数据论文的学术期刊,并分析了 131篇数据论文的评审材料,从期刊指南与实际审稿活动两个层面观察数据论文究竟被如何评价。

这类研究使我们不再满足于阅读期刊公开的政策文本,而可以进一步追问:

  • 审稿人是否真正访问了数据?
  • 是否检查了数据与论文的一致性?
  • 评审重点是格式完整,还是重用条件?
  • 数据质量判断有没有明确证据?
  • 审稿人检查的是整个数据集,还是部分样本?
  • 伦理、版权和长期保存问题是否有人负责?

这一区分至关重要。期刊指南中写有“数据必须可重用”,并不意味着审稿过程真的验证了可重用性。

未来的数据论文应在出版时披露更多“审查元数据”,例如:

  • 数据由谁检查;
  • 检查发生于何时;
  • 使用了什么软件或环境;
  • 抽查了多少记录;
  • 哪些部分没有被验证;
  • 自动化工具执行了哪些检查;
  • 评审结论适用于哪个数据版本。

这相当于把同行评审本身也变成一种可审计的数据。


三、人文数据的前沿问题不是开放,而是“解释性来源”

在人文学科,数据不是现实世界的透明投影,而是研究者通过分类、删选、转录、链接和建模生产出来的知识对象。

一套历史人物数据可能需要判断:

  • 两个同名记录是否属于同一人物;
  • 模糊的生卒年代如何编码;
  • 古代官职如何映射为统一类别;
  • 不同文献中的冲突记载如何处理;
  • 女性、奴仆、少数族群和普通人的缺席如何说明;
  • 不确定判断是否被压缩成确定值。

这些判断不只是数据清洗,而是学术解释。

2025年 JOHD 发表的 “Datafication and Cultural Heritage Collections Data Infrastructure”,将讨论推进到“数据化”层面:文化遗产机构并不是简单地把已有收藏转换为数据,而是在基础设施、组织能力、描述标准和访问机制的共同作用下,重新塑造什么能够成为数据、什么能够被连接,以及什么能够进入研究视野。

这提醒我们,人文数据论文必须披露的不只是技术来源,而是解释性来源

一般来源信息解释性来源信息
数据来自哪家机构为什么选择该机构及其收藏
文件如何生成哪些材料没有被数字化或收录
使用何种字段为什么采用这些类别和字段
数据如何清洗哪些判断由人工完成
使用何种算法算法改变或排除了什么
数据是否完整“完整”相对于什么范围而言
错误率是多少哪些类型的错误无法量化

传统 provenance 通常关注文件的来源与处理步骤;人文数据则需要更进一步,记录数据背后的认识论来源

例如,一项文学情感标注数据集不能只说明使用了三名标注者和多数投票机制,还应说明:

  • “积极”与“消极”是否适合描述特定历史文本;
  • 标注者的语言和文化背景是什么;
  • 反讽、典故和语境歧义如何处理;
  • 分歧是被保留,还是被多数投票抹平;
  • 不确定性是否作为数据的一部分发布。

如果数据论文没有记录这些问题,那么它虽然提高了技术透明度,却可能加剧认识论上的不透明。


四、“数据表”正在挑战“数据论文”

数据论文的优势是能够进入学术出版、同行评审和引文评价系统;它的缺陷则是以线性、静态的文章形式描述非线性、动态的数据对象。

近年来,数据文档开始出现另一种发展方向:将数据说明拆解为结构化、机器可读并可持续更新的声明,例如:

  • dataset cards;
  • datasheets for datasets;
  • data statements;
  • data nutrition labels;
  • data manifests;
  • machine-readable metadata profiles。

2026年发表于 Scientific Data“Biomedical Data Manifest: A Lightweight Data Documentation Framework”,代表了这一趋势。其核心方向不是再增加一篇传统意义上的说明论文,而是通过轻量、标准化的数据清单,记录数据来源、内容、使用限制和关键治理信息。

对于人文学科,这一方向尤其具有启发性。

一篇数据论文也许会在正文某处说明“部分影像受到版权限制”,但机器很难理解这句话究竟适用于哪些文件。如果这些限制被写入结构化 manifest,就可以具体关联到:

  • 文件或文件组;
  • 权利所有者;
  • 许可类型;
  • 允许用途;
  • 禁止用途;
  • 访问期限;
  • 敏感性等级;
  • 人工智能训练权限;
  • 衍生数据发布条件。

因此,未来的数据出版物可能不再是一篇论文,而是由多个相互关联的对象构成:

  1. 数据论文:解释数据的学术背景与知识建构;
  2. 数据集:保存实际记录和文件;
  3. 数据清单:提供机器可读的结构化声明;
  4. 处理代码:展示数据转换过程;
  5. 版本图谱:记录数据更新与派生关系;
  6. 评审记录:说明审稿人检查了什么;
  7. 权利声明:规定不同数据元素的访问和重用条件。

如此看来,“数据论文”或许只是一个入口,而不是完整的出版单元。

真正需要建设的,是一个由论文、数据、代码、权利、来源和版本共同构成的数据出版包


五、开放数据正在转向“有条件的负责任重用”

过去的数据共享政策往往把开放程度理解为一条从封闭到开放的直线:越容易下载,似乎越符合开放科学。

但文化遗产数据、口述史数据和族群资料表明,并非所有开放都会自动产生公共利益。

一套数据可能在法律上允许开放,却仍然存在伦理风险。例如:

  • 墓葬或遗址坐标可能被非法利用;
  • 宗教与族群知识可能不适合脱离语境传播;
  • 历史档案中可能包含仍然可识别的个人信息;
  • 殖民时期形成的分类可能在人工智能系统中被再次固化;
  • 馆藏图像可以用于学术研究,却未必可以用于商业模型训练;
  • 社区同意数字展示某些材料,不等于同意其进入生成式人工智能语料库。

2025—2026年数字文化遗产领域开始更明确地讨论 responsible reuse:数据文档不仅要帮助使用者找到材料,还要说明什么样的重用可能造成伤害。

2025年发布的 “Write It Down! Fostering Responsible Reuse of Cultural Heritage Data” 延续了数字文化遗产 datasheets 的探索,试图把来源、偏差、权利、敏感性和责任写入可复用的数据说明框架。

这意味着,人文数据论文需要增加传统许可协议无法充分表达的信息:

  • 原始材料由谁保存、描述和解释;
  • 数据涉及哪些个人或社群;
  • 是否经过相关社群同意;
  • 哪些重用在法律上可行、伦理上却不适宜;
  • 是否允许生成合成内容;
  • 是否允许训练商业模型;
  • 是否允许面部识别、身份推断或地理定位;
  • 使用者是否有义务保留文化语境;
  • 数据主体或来源社区能否要求修订或撤回。

开放许可回答的是“可以做什么”,责任声明还必须回答:

即使技术上可以做,是否应该做?


六、大语言模型不是数据审稿人,而是“来源审计器”

JOHD探索由大语言模型辅助数据论文评审,确实具有前沿性,但如果只是让模型检查 README 是否完整、论文与数据是否一致,其意义仍然有限。

更值得探索的是:能否利用模型帮助重建和审计数据的责任链。

例如,模型可以辅助比较:

  • 论文所述采集范围与实际数据分布;
  • 数据字典与字段取值;
  • README、许可文件和存储库元数据;
  • 不同版本之间新增、删除和修改的内容;
  • 人工标注规范与实际标签;
  • 论文声明的排除标准与数据中的缺失模式;
  • 引用来源与数据记录之间的对应关系。

这类任务的价值不在于模型能够作出最终判断,而在于它可以发现需要人类解释的异常。

但模型参与评审后,期刊必须公开另一组信息:

  1. 使用了什么模型和版本;
  2. 哪些文件被提供给模型;
  3. 数据是否离开期刊或存储库环境;
  4. 服务商是否保留输入;
  5. 模型执行了哪些任务;
  6. 输出由谁核验;
  7. 作者是否可以拒绝;
  8. 自动检查报告是否保存;
  9. 模型生成的错误意见如何纠正。

否则,大语言模型可能把原本可见的人类判断,替换为不可见的系统判断。

期刊甚至可能以“人工智能辅助”为名,把数据编辑和质量控制成本转嫁给通用模型。一旦发生错误,又以“最终决定由人工作出”为由回避工具责任。

因此,人工智能参与数据评审的基本原则应当是:

模型可以扩展检查范围,但不能缩小责任范围。


七、数据论文的真正冲突,是静态发表与动态维护之间的冲突

论文发表通常意味着文本进入相对稳定的版本。数据则可能持续发生变化:

  • 新记录不断加入;
  • 错误被修正;
  • 分类标准发生调整;
  • 权利状态出现变化;
  • 文件格式需要迁移;
  • 敏感数据可能被撤回;
  • 新版本可能由不同团队维护;
  • 数据可能被拆分、合并或形成衍生版本。

一篇2026年发表的数据论文,描述的可能只是数据在某个时间点的状态。如果读者两年后打开存储库,看到的已经是新版本,那么论文、审稿意见和实际数据之间就可能发生脱节。

这使“发表数据”这一表达本身值得怀疑。

2026年关于考古数据出版平台 Open Context 的回顾性研究 “Open Context in a Changing Context: Data Publishing, Archaeology, and the Future of Open Knowledge”,反映出的正是基础设施环境变化中的长期数据出版问题。数据出版不是把文件一次性放到网上,而是持续处理标准、维护、互操作、资金和社区关系。

因此,数据论文必须建立比普通论文更严格的版本机制:

  • 论文引用明确的数据版本,而不是笼统链接到数据集首页;
  • 数据更新后保留旧版本;
  • 重大更新可发表新版数据论文或版本说明;
  • 数据修订与论文勘误相互关联;
  • 数据撤回不等于删除历史记录;
  • 衍生数据集保留与原数据的来源关系;
  • 存储库迁移后,持久标识符仍能解析;
  • 权利或访问条件变化时,论文页面同步提示。

未来甚至需要区分三种不同状态:

数据论文已发表

表示关于某个版本的描述经过了评审。

数据版本仍有效

表示该版本仍可访问,且未发现使其整体失效的重大问题。

数据服务仍被维护

表示当前版本仍在更新,技术和治理责任主体仍然存在。

三者不能混为一谈。


八、谁拥有数据的“撤回权”?

论文撤回通常由作者、编辑和出版机构处理;人文数据的权利主体却可能更加复杂。

如果口述史参与者改变公开意愿,谁可以要求撤回?

如果原住民或地方社群认为某些材料不应继续开放,他们在数据出版制度中是否有正式位置?

如果博物馆修改了图像授权,数据集中的相关文件如何处理?

如果研究者发现原始档案中包含个人敏感信息,是否应该删除数据?删除之后,既有研究是否仍然可验证?

这些问题表明,数据治理不能只围绕作者、期刊和存储库设计。它还应容纳:

  • 数据主体;
  • 来源社群;
  • 馆藏机构;
  • 权利持有人;
  • 数据维护者;
  • 后续纠错者;
  • 数据重用者。

传统数据论文通常只在“伦理声明”或“数据可访问性声明”中简要处理这些关系。但随着人工智能扩大数据传播和再利用规模,单一声明已经不足以承担治理功能。

期刊需要建立更加细致的出版后机制:

  • 局部记录撤回;
  • 字段级访问限制;
  • 敏感数据降精度处理;
  • 权利声明更新;
  • 争议来源标记;
  • 社区意见附注;
  • 数据修订日志;
  • 受影响研究的通知机制。

这意味着,数据论文的编辑工作不会在正式发表时结束。


九、JISTaP需要建立的不是新栏目,而是“机器可执行的责任链”

如果 JISTaP 只是增加一种名为 Data Paper 的投稿类型,它得到的很可能是一批结构较短、附带数据链接的普通论文。

真正具有前沿意义的做法,是把数据论文设计成一个责任链入口。

第一层:数据对象

  • 可信存储;
  • 稳定版本;
  • 持久标识符;
  • 文件校验值;
  • 长期保存策略。

第二层:知识来源

  • 原始材料来源;
  • 选择与排除标准;
  • 人工解释环节;
  • 算法处理环节;
  • 不确定性表达;
  • 数据偏差与代表性。

第三层:权利与伦理

  • 许可条件;
  • 第三方权利;
  • 数据主体和来源社区;
  • 敏感性等级;
  • 允许与禁止的重用;
  • 人工智能训练权限。

第四层:同行评审

  • 领域审查;
  • 数据结构审查;
  • 技术检查;
  • 伦理法律复核;
  • 自动化检查;
  • 未被验证的范围。

第五层:出版后维护

  • 版本更新;
  • 错误报告;
  • 局部修订;
  • 权利变化;
  • 数据撤回;
  • 衍生数据追踪。

更重要的是,这些信息不能只隐藏在 PDF 中,而应尽可能以结构化方式与数据对象关联。

如果机器不能识别许可、来源、不确定性和禁止用途,所谓“机器可读数据”就只是文件格式可读,而不是治理信息可读。


结语:数据论文正在从学术信用工具变成数据治理接口

十年前,数据论文最重要的任务,是让研究者愿意共享数据,并让数据劳动获得正式引用。

今天,这项任务仍未完成,但新的问题已经出现。

数据不再只被同行研究者下载和阅读,也可能被平台聚合、被模型训练、被自动系统重新分类,并以数据创建者未曾预料的方式传播。人文学科的数据尤其如此:它们不仅承载事实,也承载分类、缺席、不确定性、权力关系和历史解释。

因此,未来的数据论文不能只是一篇描述数据的短论文,而应成为连接以下对象的治理接口:

  • 数据及其版本;
  • 数据生产者与维护者;
  • 原始资料与来源社群;
  • 存储库与长期基础设施;
  • 人类审稿人与机器检查工具;
  • 当前使用者与未来重用者;
  • 开放许可与负责任使用边界。

JOHD与KISTI的对话真正重要之处,不是为期刊增加一种文章类型提供了操作经验,而是让我们看到:学术出版正在被要求为数据的整个生命周期承担更多责任。

所以,数据论文未来面对的核心问题不再是:

这套数据是否值得发表?

而是:

谁以什么方法生产了它?谁检查过它?机器将如何理解它?它可能被用于什么?出现错误或伤害时,谁能够介入,又由谁负责?

当数据论文能够回答这些问题时,它才不只是论文制度对数据的收编,而可能成为人工智能时代人文学术基础设施的一部分。


建议采用的近期外文文献

以下文献可以作为文章的主要证据来源,早期文献只保留用于概念溯源。

2025—2026年核心文献

  1. On the Readiness of Scientific Data Papers for a FAIR and Transparent Use in Machine Learning. (2025). Scientific Data, 12, 61.
    https://doi.org/10.1038/s41597-025-04402-4
    **可支撑观点:**数据论文是否具备机器学习透明使用条件;研究样本包含4,041篇数据论文。

  2. Wang, X., et al. (2025). What Are Journals and Reviewers Concerned About in Data Papers? Learned Publishing.
    https://doi.org/10.1002/leap.2001
    **可支撑观点:**期刊政策与实际评审关注点;涉及22种期刊和131篇数据论文的评审材料。

  3. Vuong, Q. H., et al. (2025). Critical Remarks on Current Practices of Data Article Publishing.
    https://www.sciencedirect.com/science/article/pii/S2694610625000098
    **可支撑观点:**当前数据论文出版机制的局限,以及发表数据与建立有效知识之间的差距。

  4. Biomedical Data Manifest: A Lightweight Data Documentation Framework. (2026). Scientific Data.
    https://www.nature.com/articles/s41597-026-06670-0
    **可支撑观点:**数据文档从线性论文转向结构化 manifest;可用于讨论机器可读的数据治理声明。

  5. Belteki, D., et al. (2025). Datafication and Cultural Heritage Collections Data Infrastructure. Journal of Open Humanities Data.
    https://openhumanitiesdata.metajnl.com/articles/10.5334/johd.277
    **可支撑观点:**文化遗产的数据化并非单纯数字转换,而是由基础设施、机构实践和知识组织共同塑造。

  6. Write It Down! Fostering Responsible Reuse of Cultural Heritage Data. (2025).
    https://zenodo.org/records/17725565
    **可支撑观点:**数字文化遗产 datasheets、责任重用、来源、偏差、敏感性与权利说明。

  7. Kansa, E., et al. (2026). Open Context in a Changing Context: Data Publishing, Archaeology, and the Future of Open Knowledge. Internet Archaeology.
    https://intarch.ac.uk/journal/issue71/3/full-text.html
    **可支撑观点:**数据出版的长期基础设施、维护和制度环境,而非一次性存储。

  8. Emerging Data Practices: Data Work in the Era of Large Language Models. (2025). ACM CHI Proceedings.
    https://doi.org/10.1145/3706598.3714069
    **可支撑观点:**大语言模型时代的数据生产、管理和劳动方式变化;适合扩展“数据劳动重新分配”的论述。

更多推荐