
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
深度学习在药物发现中常因“分布外”(OOD)分子而失效——模型对结构新颖的分子预测不可靠,却可能给出高置信度的错误答案。如何让模型知道自己“没见过”某个分子?2026年《Nature Machine Intelligence》的一项研究给出了答案:不熟悉度(Unfamiliarity)。作者提出联合分子模型(JMM),通过分子SMILES的自编码重构损失量化陌生感,并结合谱聚类主动划分OOD测试集

深度学习在药物发现中常因“分布外”(OOD)分子而失效——模型对结构新颖的分子预测不可靠,却可能给出高置信度的错误答案。如何让模型知道自己“没见过”某个分子?2026年《Nature Machine Intelligence》的一项研究给出了答案:不熟悉度(Unfamiliarity)。作者提出联合分子模型(JMM),通过分子SMILES的自编码重构损失量化陌生感,并结合谱聚类主动划分OOD测试集

在conda中添加新环境可以帮助隔离不同项目的依赖,避免版本冲突。

AAindex是一个包含氨基酸理化特性数值指标的数据库,分为AAindex1(氨基酸指标)、AAindex2(突变矩阵)和AAindex3(蛋白质接触势)三部分。aaindex软件包提供轻量级访问AAindex1数据的功能,无需额外安装库。使用方法简单:安装后通过Python代码即可获取氨基酸指标数据,并支持转换为DataFrame格式进行排序和保存。目前仅支持AAindex1,未来将扩展支持其他

组织类型(54):GTEx数据库简介(1) - 知乎 (zhihu.com)TCGA、ICGC、GTEx 数据库都是啥?- 知乎 (zhihu.com)GTEx:基因型和基因表达量关联数据库-CSDN博客。

深度学习在药物发现中常因“分布外”(OOD)分子而失效——模型对结构新颖的分子预测不可靠,却可能给出高置信度的错误答案。如何让模型知道自己“没见过”某个分子?2026年《Nature Machine Intelligence》的一项研究给出了答案:不熟悉度(Unfamiliarity)。作者提出联合分子模型(JMM),通过分子SMILES的自编码重构损失量化陌生感,并结合谱聚类主动划分OOD测试集

DrugBank是一个综合性的生物信息学和化学信息学数据库,专门收录药物和靶点的详细信息。它由加拿大阿尔伯塔大学的Wishart 研究组维护,提供化学、药理学、相互作用、代谢、靶点等多方面的药物数据。DrugBank 结合了实验数据和计算预测,广泛应用于药物研发、精准医疗、生物信息学研究等领域。

深度学习在药物发现中常因“分布外”(OOD)分子而失效——模型对结构新颖的分子预测不可靠,却可能给出高置信度的错误答案。如何让模型知道自己“没见过”某个分子?2026年《Nature Machine Intelligence》的一项研究给出了答案:不熟悉度(Unfamiliarity)。作者提出联合分子模型(JMM),通过分子SMILES的自编码重构损失量化陌生感,并结合谱聚类主动划分OOD测试集

CD-HIT是一款高效的生物序列聚类工具,通过贪心算法和局部敏感哈希快速将相似序列分组。它通过设置相似度阈值(如0.4-0.9)来降低数据冗余,在蛋白质相互作用预测中尤为重要,能防止模型通过记忆相似序列而非学习互作模式导致的评估偏差。

DrugBank是一个综合性的生物信息学和化学信息学数据库,专门收录药物和靶点的详细信息。它由加拿大阿尔伯塔大学的Wishart 研究组维护,提供化学、药理学、相互作用、代谢、靶点等多方面的药物数据。DrugBank 结合了实验数据和计算预测,广泛应用于药物研发、精准医疗、生物信息学研究等领域。








