从ML文档到结构化需求:ModelCards如何成为SE与ML团队的“沟通桥梁”?

论文信息

  • 原标题:From Machine Learning Documentation to Requirements: Bridging Processes with Requirements Languages
  • 主要作者:Yi Peng、Hans-Martin Heyn、Jennifer Horkoff(ORCID分别为0009-0000-2727-8000、0000-0002-2427-6875、0000-0002-2019-5277)
  • 研究机构:University of Gothenburg(瑞典哥德堡大学)、Chalmers University of Technology(瑞典查尔姆斯理工大学)
  • 引文格式(GB/T 7714):Peng Y, Heyn H M, Horkoff J. From Machine Learning Documentation to Requirements: Bridging Processes with Requirements Languages[EB/OL]. arXiv:2511.15340v1 [cs.SE], 2025-11-19.
  • 开源资源:研究数据集(含原始/处理数据)地址:https://doi.org/10.6084/m9.figshare.28564058.v1

一段话总结

该研究聚焦机器学习(ML)系统软件工程中需求工程(RE)的挑战,旨在验证ModelCards和DataSheets作为RE相关信息源的潜力:首先分析20个公开文档(10个ModelCards、10个DataSheets),发现其平均含83%(ModelCards)和88%(DataSheets)的RE相关信息,但存在信息冗余和粒度不一致问题;接着评估EARS、Rupp’s模板、Volere三种主流RE语言的信息捕获效果,结果显示EARS和Rupp’s模板能捕获多数核心信息(EARS捕获率37%-79%,Rupp’s模板41%-80%),而Volere可通过“需求+外部因素”结构捕获全部RE相关信息,但三者均有局限(如EARS无法表达不确定性、Volere缺ML特定分类);最终证实ML文档可作为桥接ML组件描述与结构化SE流程的关键载体,为ML系统的RE实践提供指导。

思维导图

在这里插入图片描述

研究背景:ML需求工程的“痛点”与ML文档的“潜力”

如果你是一名开发医疗ML系统的工程师,可能会遇到这样的问题:团队花了3个月训练出一款胸部X光诊断模型,但在整合到医院系统时发现——模型的“适用患者年龄范围”“诊断准确率边界”“数据标注来源”这些关键信息,只零散写在研发笔记里,需求工程师根本没法据此制定清晰的系统需求,导致开发反复返工。

这正是当前ML系统软件工程(SE)的核心痛点:ML系统依赖数据和模型,行为具有非确定性(比如不同输入可能导致不同输出),但传统需求工程(RE)的信息源(如 stakeholder访谈、需求文档),很难覆盖ML组件的“模型性能边界”“数据质量约束”“使用局限”等关键信息。就像厨师有优质食材(ML模型),却没有清晰的“菜谱”(需求),没法做出符合用户预期的“菜品”(系统)。

为了解决ML文档混乱的问题,ML社区推出了ModelCards和DataSheets:ModelCards记录模型的“身份信息”(如用途、性能、局限),比如某情感分析模型的ModelCards会写“仅支持英文文本,准确率85%”;DataSheets则描述数据集的“出身”(如数据来源、标注方式、潜在偏差),比如某医疗数据集的DataSheets会注明“数据来自3家三甲医院,标注由5名放射科医生完成”。

这些文档在Hugging Face等开源平台很流行,但问题是:它们结构松散(不同团队写法不一),且从未被系统地当作RE的信息源——没人知道这些文档里到底有多少能直接用於需求的信息,也不知道现有RE工具能不能“读懂”这些信息。这篇研究正是要解决这个“连接断层”:把ML文档的“零散信息”,变成RE能用的“结构化需求”。

创新点:3个“首次”与1个“实用工具”

这篇研究的独特价值,体现在3个“首次”和1个“实用工具”上:

  1. 首次系统分析ML文档的RE价值:之前的研究要么聚焦ML模型性能,要么讨论RE框架,但没人量化过ModelCards和DataSheets里“能直接用於需求”的信息占比,这篇研究首次用数据证实“ML文档是RE的富信息源”(平均83%+)。
  2. 首次对比3种主流RE语言的ML适配性:EARS(轻量级)、Rupp’s模板(标准化)、Volere(全维度)是工业界常用的RE工具,但之前没人测试过它们处理ML文档的能力,研究首次给出了“哪种工具适合哪种场景”的明确答案。
  3. 首次提出ML文档的RE信息识别标准:基于国际标准ISO/IEC/IEEE 29148:2018,研究制定了“RE相关/无关信息”的判断准则(比如“模型准确率”是相关,“模型架构细节”是无关),相当于给RE工程师提供了“信息筛选放大镜”。
  4. 实用工具:RE语言选择指南:针对不同需求场景(如仅需核心功能、需完整上下文),明确推荐对应的RE语言,避免工程师“盲目试错”。

研究方法:5步拆解,从“选文档”到“评效果”

研究团队用了一套严谨的“5步方法”,把复杂的研究过程拆解得清晰易懂:

步骤1:选对文档——确保样本“有代表性”

团队没有随便找文档,而是从Google Scholar筛选了20个“高质量样本”:

  • 数量:10个ModelCards(如LLAMA 2大语言模型、RoentGen胸部X光生成模型)+10个DataSheets(如CheXpert医疗影像数据集、SA-1B图像分割数据集);
  • 多样性:覆盖医疗、自然语言处理、计算机视觉等领域,包含学术项目(如大学研发的模型)和工业产品(如Meta的LLAMA 2);
  • 配对性:部分文档是“同系统配对”(如SAM模型的ModelCard+SA-1B数据集的DataSheet),方便观察两者的信息互补性。

步骤2:识别RE信息——给信息“贴标签”

团队基于国际标准ISO/IEC/IEEE 29148:2018,制定了“RE相关信息”的判断准则,像“分拣员”一样给文档句子分类:

  • RE相关信息:比如“模型需支持384x240x3维度输入”(功能需求)、“数据集不含敏感医疗信息”(约束)、“模型准确率不低于85%”(性能);
  • RE无关信息:比如“模型用Transformer架构”(纯技术描述)、“未来计划支持多语言”(未实现的设想)、“作者致谢”( bibliographic信息)。

步骤3:提取RE信息——用3种工具“结构化”

团队让研究员手动把RE相关信息,“填”进3种RE语言的模板里:

  • EARS:选5种模式(如“普遍型”——“系统应做XX”、“事件驱动型”——“当XX触发时,系统应做XX”);
  • Rupp’s模板:按9种模式拆分(如“FunctionMASTER”描述功能、“PropertyMASTER”描述非功能需求);
  • Volere:除了需求,还记录“外部因素”(如依赖、风险),比如“模型依赖CC-BY-NC 4.0许可证”。

步骤4:验证结果——避免“主观偏差”

为了确保结果可靠,团队做了两轮“交叉审查”:

  • 第一轮:3名作者各自审查10%的样本,判断“哪些是RE相关信息”,解决了19-35处分歧(比如“模型训练数据量”是否算RE信息);
  • 第二轮:审查“RE信息是否正确映射到RE语言”,解决了10-17处分歧(比如“模型局限”该用Volere的哪个字段记录)。

步骤5:定量分析——用数据“说话”

最后,团队统计两个核心指标:

  • RE信息占比:每个文档中RE相关句子的比例(部分相关的句子按0.5算);
  • RE语言捕获率:每种RE语言能“抓住”多少RE相关信息。

主要成果:3张表看懂核心结论

研究的核心成果可以用3张表概括,直白告诉你“ML文档有多少用”“哪种RE工具好用”:

表1:RQ1答案——ML文档含高RE信息,但有2个问题

指标ModelCards(10个)DataSheets(10个)关键问题
RE信息占比范围70%-95%84%-92%1. 冗余:同一信息多表述(如DS1反复提“放射科医生标注”);
2. 粒度不一致:高抽象描述(如“支持图像分析”)与低实现细节(如“输入维度384x240”)混杂
RE信息占比平均值83%88%
最高占比案例MC5(文本摘要模型,95%)DS5(少样本图像数据集,92%)
最低占比案例MC3(情感分析模型,70%)DS7(ASL翻译数据集,84%)

表2:RQ2答案——3种RE语言的“能力对比”

RE语言捕获率范围优势场景核心局限
EARS37%-79%快速提取核心功能(如输入输出、许可证约束)仅支持“shall”,无法表达不确定性(如“数据集被认为更具代表性”)
Rupp’s模板41%-80%捕获 nuanced 内容(如不确定性、条件逻辑)难以直观表达模型/数据集局限(如“仅支持英文测试”)
Volere100%完整捕获RE信息(含依赖、风险、局限等外部因素)缺乏ML特定分类,把“数据质量约束”“评估指标要求”都归为“解决方案约束”

表3:研究的核心贡献

贡献类型具体内容
实践贡献1. 提供RE信息识别checklist,帮工程师快速筛选ML文档中的有用信息;
2. 明确RE语言选择指南:核心功能用EARS/Rupp’s,需完整上下文用Volere
理论贡献1. 首次量化ML文档的RE价值,证实其可作为SE与ML团队的“信息桥梁”;
2. 指出现有RE语言的ML适配性缺口,为后续优化提供方向
资源贡献开源数据集(含20个文档的标注数据),为自动化RE提取(如NLP/LLM工具)提供基础

关键问题:问答形式读懂核心价值

Q1:ModelCards和DataSheets里,到底有多少能直接用於需求工程的信息?

A:平均来看,ModelCards有83%的句子是RE相关信息(范围70%-95%),DataSheets更高,达88%(范围84%-92%)。比如文本摘要模型MC5的文档里,95%的句子都包含“摘要准确率”“支持的文本长度”“使用许可证”等可直接转化为需求的信息,证实这两类文档是RE的“信息金矿”。

Q2:如果我是需求工程师,该选哪种RE语言处理ML文档?

A:看你的需求场景:① 若只需快速提取核心功能(如模型能做什么、输入格式是什么),选EARS或Rupp’s模板,效率高;② 若需要完整记录上下文(如模型依赖哪些许可证、有什么使用局限、存在哪些风险),必须选Volere,它能100%捕获信息,但要注意手动区分ML特定概念(如把“数据质量”和“评估指标”分开记录)。

Q3:研究发现ML文档存在“冗余”和“粒度不一致”问题,实际工作中该怎么解决?

A:研究虽未直接给出解决方案,但提供了优化方向:① 团队可制定ML文档的“标准化模板”,比如规定“性能指标”“使用局限”等模块的统一写法,减少冗余;② 明确“需求级信息”和“设计级信息”的边界,比如“模型用Transformer架构”是设计细节(无关),“模型推理时间不超过1秒”是需求(相关),避免粒度混杂。

Q4:未来能通过AI工具(如LLM)自动从ML文档中提取需求吗?

A:这篇研究为实现自动化提供了基础。研究开源了标注数据集(含RE相关信息的标签),后续可基于这些数据训练LLM模型,让AI自动识别ML文档中的RE信息,并按EARS/Volere等格式输出结构化需求。不过,要先解决现有RE语言的ML适配性问题(如Volere的分类优化),才能让AI提取的需求更精准。

3. 详细总结

一、研究背景与核心问题
  1. ML系统的SE挑战:ML系统因非确定性行为、强数据依赖,导致传统软件工程(SE)中需求工程(RE)面临新障碍,尤其在模型/数据需求(鲁棒性、公平性、数据质量)的定义与集成上存在困难。
  2. ML文档的潜在价值:ML社区的ModelCards(记录模型性能、用途、局限)和DataSheets(描述数据集动机、构成、偏差)在开源平台(如Hugging Face)广泛使用,但结构松散、 adoption不一致,尚未被系统视为RE信息源。
  3. 核心研究问题
    • RQ1:ModelCards和DataSheets中包含多少RE相关信息?从RE视角看,这些信息的文档方式存在哪些问题?
    • RQ2:现有RE语言(EARS、Rupp’s模板、Volere)在捕获上述RE信息时效果如何?哪些类型的RE信息无法被有效捕获?
二、研究方法
方法环节关键细节说明
数据选择20个文档(10 ModelCards + 10 DataSheets)1. 来源:Google Scholar筛选引用ModelCards/DataSheets原论文的高质量文档;
2. 多样性:覆盖医疗(如RoentGen胸部X光模型)、安全、商业等领域;
3. 配对性:部分文档为同一ML系统的ModelCard+DataSheet(如MC2+DS2);
4. 规模:共分析超1200个句子。
RE信息识别基于ISO/IEC/IEEE 29148:2018标准1. 演绎编码标准:从标准的“术语定义、需求基础、信息项内容、系统操作概念”提取RE相关信息 criteria;
2. RE相关信息:含需求(功能/非功能)、约束、性能、操作条件等;
3. RE无关信息:纯架构描述、通用知识、未来工作等。
RE信息提取手动映射到三种RE语言1. EARS:选择5种模式(普遍型、事件驱动型等),提取主语、系统响应等;
2. Rupp’s模板:按9种模式(FunctionMASTER、PropertyMASTER等)拆分信息;
3. Volere:补充元数据(如依赖、风险),缺失字段(如Originator)排除。
验证与定量分析两轮迭代审查 + 百分比统计1. 验证:对10%样本独立审查,解决分歧(首轮聚焦信息相关性,次轮聚焦RE语言映射);
2. 定量:统计RE相关句子占比(部分相关计0.5)、各RE语言的信息捕获率。
三、核心研究结果
1. RQ1:ML文档中的RE相关信息与文档问题
  • RE信息占比:ModelCards平均83%(范围70%-95%),DataSheets平均88%(范围84%-92%),具体数据如下表:
    文档类型代表案例句子总数(S)RE相关句子数(RS)RE信息占比(RS/S)
    ModelCardMC5(文本摘要模型)615895%(最高)
    ModelCardMC3(情感分析模型)231670%(最低)
    DataSheetDS5(少样本图像分类数据集)756992%(最高)
    DataSheetDS7(ASL翻译数据集)6756.584%(最低)
  • 文档问题:1. 冗余:同一信息多表述(如DS1多次重复“放射科医生标注数据”);2. 粒度不一致:部分章节为高抽象描述,部分为低实现细节(属设计决策而非需求)。
2. RQ2:三种RE语言的捕获效果与局限
  • 捕获效果对比(平均捕获率:Volere > Rupp’s模板 > EARS):
    RE语言捕获率范围优势场景关键表现
    EARS37%(MC6)-79%(MC1)捕获核心功能(输入输出、训练算法、许可证约束)在7/10 ModelCards和2/10 DataSheets中表现弱于Rupp’s
    Rupp’s模板41%(MC6)-80%(DS6)捕获 nuanced 内容(如不确定性),支持条件逻辑在7/10 ModelCards和8/10 DataSheets中优于EARS,最大差距12%(DS9)
    Volere100%(需求+外部因素)捕获全部RE信息,含依赖、风险、局限等外部因素需将ML特定信息(如数据质量、评估指标)归入通用分类(如“解决方案约束”)
  • 各自局限
    • EARS:仅支持“shall”作为模态动词,无法表达不确定性(如DS2“数据集被认为更具代表性”中的“认为”);
    • EARS + Rupp’s模板:难以直观表达模型/数据集局限(如MC4仅支持英文测试、DS8检测准确率非100%);
    • Volere:缺乏ML特定需求分类,导致不同概念(如数据来源约束、评估指标要求)被 conflate 为同一通用类别(如“解决方案约束”)。
四、研究贡献与未来方向
  1. 核心贡献:首次从RE视角系统分析ModelCards和DataSheets,量化其RE信息潜力,评估现有RE语言的适配性,为ML系统SE与RE的融合提供实证基础。
  2. 实践启示
    • 对从业者:提供RE信息识别 checklist;核心功能用EARS/Rupp’s模板,需上下文(如局限、依赖)用Volere;
    • 对研究者:扩展Volere的ML特定分类,增强EARS的模态灵活性;探索NLP/LLM自动化RE信息提取;
  3. 威胁与局限
    • 内部威胁:信息相关性判断存在主观偏差(已通过10%样本审查缓解);
    • 外部威胁:样本偏向高引文档,未覆盖所有RE格式(如用户故事)。

4. 关键问题

问题1:该研究如何验证ModelCards和DataSheets中RE相关信息的存在及质量?具体发现了哪些关键数据与问题?

答案:研究通过“数据选择-信息识别-定量统计”三步验证RE相关信息:1. 选择20个高质量文档(10 ModelCards+10 DataSheets,覆盖多领域);2. 基于ISO/IEC/IEEE 29148:2018标准,采用演绎主题分析区分RE相关信息(如需求、性能、约束)与无关信息(如纯架构描述、未来工作);3. 统计RE相关句子占比(部分相关计0.5)。
关键发现:① 信息数量:ModelCards平均含83% RE相关信息(范围70%-95%),DataSheets平均88%(范围84%-92%),证实其为RE富信息源;② 文档质量问题:存在信息冗余(如DS1多次重复“放射科医生标注数据”)和粒度不一致(高抽象描述与低实现细节混杂),影响RE信息的复用与追溯。

问题2:三种主流RE语言(EARS、Rupp’s模板、Volere)在捕获ML文档RE信息时的核心差异是什么?这些差异背后的原因是什么?

答案:核心差异体现在捕获范围、表达灵活性、ML适配性三方面,具体如下表:

对比维度EARSRupp’s模板Volere差异原因
捕获范围37%-79%41%-80%100%(需求+外部因素)EARS/Rupp’s仅聚焦核心需求,Volere额外覆盖依赖、风险等外部因素
表达灵活性低(仅“shall”)中(支持“should”“may”)高(支持元数据与外部因素描述)EARS为轻量级结构,Rupp’s含9种模式,Volere强调可追溯性与完整性
ML适配性低(无法表达不确定性)中(可捕不确定性,难捕局限)中(捕全部信息,但缺ML分类)EARS设计目标为原子需求,Rupp’s侧重系统行为,Volere为通用RE框架,均未针对ML场景优化

差异根源:三种RE语言的设计定位不同——EARS追求轻量化与可读性,Rupp’s强调系统行为的细粒度描述,Volere聚焦需求的完整性与可追溯性,均未考虑ML系统特有的不确定性、数据依赖、模型局限等场景。

问题3:该研究对ML系统软件工程中的RE实践有哪些直接指导意义?未来可从哪些方向进一步优化ML文档与RE的融合?

答案:1. 实践指导意义
① 信息识别:提供基于ISO标准的RE信息识别 checklist,帮助从业者从ModelCards/DataSheets中高效提取需求(如功能、性能、约束);
② RE语言选择:核心功能(如输入输出、训练算法)用EARS/Rupp’s模板,需上下文(如依赖、风险、局限)用Volere;
③ 文档改进:提醒ML团队减少信息冗余、统一描述粒度,提升ML文档的RE可用性。
2. 未来优化方向
① 优化RE语言:扩展Volere的ML特定分类(如新增“数据质量需求”“模型评估指标需求”),增强EARS的模态灵活性(支持“should”“may”等);
② 自动化工具:基于现有手动标注数据集,开发NLP/LLM工具实现ML文档RE信息的自动化提取;
③ 扩展文档类型:将研究范围从ModelCards/DataSheets扩展到其他ML文档(如Nutritional Labels、FactSheets),验证结论通用性;
④ 完善文档规范:结合RE需求,制定ML文档的标准化模板,减少冗余与粒度问题。

总结

这篇研究精准击中了ML系统需求工程的“连接断层”——传统RE缺ML信息源,而ML文档(ModelCards/DataSheets)虽含高价值信息却未被利用。通过分析20个高质量文档,研究证实ML文档平均含83%+的RE相关信息,且3种主流RE语言中,Volere能完整捕获信息(但需优化分类),EARS/Rupp’s适合快速提取核心功能。

对从业者来说,这篇研究相当于提供了“ML需求提取工具箱”——既知道该从哪里找信息(ModelCards/DataSheets),也知道该用什么工具处理(EARS/Rupp’s/Volere);对研究者来说,它指出了现有RE语言的ML适配性缺口,为后续优化(如扩展ML特定分类、自动化提取)提供了清晰方向。

当然,研究也有局限:样本偏向高引文档,可能无法完全代表所有ML文档;未测试用户故事等其他RE格式。但整体来看,它为ML系统的需求工程实践,搭建了从“零散文档”到“结构化需求”的关键桥梁。

更多推荐