
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
单细胞 RNA 测序(scRNA-seq)技术的爆发式发展,使人类细胞图谱等综合数据库的规模已膨胀至数千万个细胞。如何从海量且高度异质的单细胞数据中高效提取生物学知识——包括细胞类型识别、批次效应消除、基因扰动预测和调控网络推断——成为计算生物学的核心挑战。当前主流方法大多针对特定任务开发专用模型,导致"数据孤岛"和"任务孤岛"的局限。scGPT。
单细胞 RNA 测序(scRNA-seq)技术的爆发式发展,使人类细胞图谱等综合数据库的规模已膨胀至数千万个细胞。如何从海量且高度异质的单细胞数据中高效提取生物学知识——包括细胞类型识别、批次效应消除、基因扰动预测和调控网络推断——成为计算生物学的核心挑战。当前主流方法大多针对特定任务开发专用模型,导致"数据孤岛"和"任务孤岛"的局限。scGPT。
自监督深度语言建模在自然语言处理领域取得了前所未有的成功,近年来也被广泛应用于生物序列分析。然而,现有的蛋白质语言模型(如 ESM、TAPE-Transformer、ProtTrans 等)大多从自然语言领域直接引入现有架构和预训练任务,未能充分利用蛋白质的独特特性——蛋白质没有明确的多字母构建块(如单词和句子),长度变化远大于句子,且三维结构导致远距离位置之间存在大量相互作用。
自监督深度语言建模在自然语言处理领域取得了前所未有的成功,近年来也被广泛应用于生物序列分析。然而,现有的蛋白质语言模型(如 ESM、TAPE-Transformer、ProtTrans 等)大多从自然语言领域直接引入现有架构和预训练任务,未能充分利用蛋白质的独特特性——蛋白质没有明确的多字母构建块(如单词和句子),长度变化远大于句子,且三维结构导致远距离位置之间存在大量相互作用。
在材料科学领域,密度泛函理论(DFT)是计算材料性质的金标准,但其高昂的计算成本严重制约了大规模材料筛选和分子动力学模拟的效率。机器学习势能(Machine Learning Potential, MLP)为这一问题提供了新的解决思路——通过在 DFT 数据上训练神经网络,实现接近 DFT 精度但快几个数量级的原子模拟。CHGNet。
在材料科学领域,密度泛函理论(DFT)是计算材料性质的金标准,但其高昂的计算成本严重制约了大规模材料筛选和分子动力学模拟的效率。机器学习势能(Machine Learning Potential, MLP)为这一问题提供了新的解决思路——通过在 DFT 数据上训练神经网络,实现接近 DFT 精度但快几个数量级的原子模拟。CHGNet。
ESM-2(Evolutionary Scale Modeling 2)是 Meta AI(FAIR)推出的蛋白质语言模型,它把自然语言处理里的掩码语言建模(Masked Language Modeling, MLM)思想搬到了蛋白质序列上:把一条氨基酸序列看作一句"蛋白质语言",通过在海量蛋白序列(UniRef50)上做自监督预训练,让模型学会氨基酸之间的进化与结构约束。和依赖多序列比对(MSA
ESM-2(Evolutionary Scale Modeling 2)是 Meta AI(FAIR)推出的蛋白质语言模型,它把自然语言处理里的掩码语言建模(Masked Language Modeling, MLM)思想搬到了蛋白质序列上:把一条氨基酸序列看作一句"蛋白质语言",通过在海量蛋白序列(UniRef50)上做自监督预训练,让模型学会氨基酸之间的进化与结构约束。和依赖多序列比对(MSA







