在这里插入图片描述

文章目录

介绍

近年来,许多病原体鉴定和微生物组分析工具已被开发出来,其中 Kraken 2 是最受欢迎的一种。虽然 Kraken 2 之后的工具能够帮助解读其输出结果,但评估单个样本中某一分类群/生物体存在的可能性的统计框架以及与自动化端到端分析流程相结合的完整分析管道尚未完全实现。
在此,我们介绍一款名为 SPARKI 的 R 软件包,它能够对 Kraken 2 的输出结果进行统计分析,并有助于识别下一代测序样本中存在的病原体。SPARKI 为该领域增添了新的内容,它为 Kraken 2 数据带来了概率视角,成为一种发现工具,并且与诸如 KrakenTools、Bracken 和 Pavian 等其他方法相辅相成。

在这里插入图片描述

病原体鉴定和微生物组分析在许多研究领域中变得愈发重要。为了应对这一挑战,已经开发出了多种工具,其中包括 Kraken 2(伍德等人,2019 年),这是一款基于 k-元的工具,能够对测序读取进行分类学鉴定。简而言之,Kraken 2 会将 FASTQ 文件中的测序读取拆分为 k-元组,从中获取被称为最小化的子字符串。然后,通过为每个最小化子字符串计算一个紧凑的哈希码,Kraken 2 能够高效地访问分类群数据库,并为每个 k-元组分配相应的较低共同祖先分类群。当使用“–报告”选项运行时,Kraken 2 会生成一个包含所有分类群的样本报告,这些分类群在样本中被识别出来。如果使用“–报告-最小化数据”标志运行,Kraken 2 还会输出在样本中找到的每个分类群所对应的唯一最小化子字符串的数量。
虽然 Kraken 2 是一种用于病原体鉴定和微生物组分析的常用工具,但其输出结果可能会存在不确定性。最小化结果可能会被错误地归类到不同的分类群中——这种归类受到提供的查询序列的数量和组成的影响——并且该软件尚未完全实现统计框架来量化一个分类群/生物体在样本中真正存在的可能性。用户可以通过修改“–confidence”参数来调整其 Kraken 2 分析的置信度得分,以降低发现假阳性分类群的风险,但这种方法不会报告分类群被识别的统计显著性——即确定性程度。
此外还有一些工具,例如 KrakenTools(Lu 等人,2022 年)、Bracken(Lu 等人,2017 年)和 Pavian(Breitwieser 和 Salzberg,2019 年),可用于对 Kraken 2 的结果进行后续处理。例如,KrakenTools 提供了一组脚本,用于对 Kraken 2 生成的结果进行操作,如读取提取和报告整理;Bracken 利用贝叶斯定理重新估计较低分类等级(如属和种)的群落丰度,并获得精度更高的输出;而 Pavian 允许用户根据每个分类单元分配的读取数量来识别可能有研究价值的结果,这些结果可以以百分比或 z 分数的形式进行可视化。
SPARKI(旨在对稳健型 Kraken 2 分析结果进行统计处理的工具,网址:https://github.com/team113sanger/sparki)(博卡西诺和维尔梅斯 2025 年发表)是一个 R 软件包和命令行工具,旨在帮助研究人员解读 Kraken 2 的输出结果。它既可以作为独立软件使用,也可以作为名为 sparki-nf(https://github.com/team113sanger/sparki-nf)的端到端病原体鉴定管道的一部分使用(sparki-nf;博卡西诺 2025a)(图 1a),该管道是用 NextFlow 编写的(迪·托马索等人,2017 年)。SPARKI 提供的关键样本级结果对于每个分类单元而言是:(i)样本中发现的最小化序列的比例(最小化序列的比例越高,该生物体的基因组在样本中存在的可能性就越大),以及(ii)结果的统计显著性。SPARKI 的独特之处在于它利用最小化序列数据来评估在 Kraken 2 分析的总读长数给定的情况下,在样本中找到每个分类单元的可行性。SPARKI 框架已在先前的研究中得到应用(切马等人,2025 年;王等,2025 年),在此我们详细描述了其实现方式。

代码

https://github.com/team113sanger/sparki

在这里插入图片描述

参考

  • SPARKI: a tool for the statistical analysis of pathogen identification results
  • https://github.com/team113sanger/sparki

更多推荐