logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Google开源视觉语言模型PaliGemma,图像描述、问答、分割样样精通,消费级GPU可运行

近年来,视觉语言模型(VLM)在图像理解和生成领域取得了显著进展。这类模型能够接收图像和文本输入,并生成相应的文本输出,为图像描述、问答、分割等多种视觉任务提供了全新的解决方案。近日,Google开源了其最新研发的视觉语言模型PaliGemma,该模型不仅拥有强大的多任务能力,还具备轻量级和易用性等特点,使其在众多应用场景中具有广阔的应用前景。Huggingface模型下载:AI快站模型免费加速下

文章图片
#语言模型#人工智能#计算机视觉 +4
英伟达发布 VILA 视觉语言模型,实现多图像推理、增强型上下文学习,性能超越 LLaVA-1.5

近年来,大型语言模型 (LLM) 的发展取得了显著的成果,并逐渐应用于多模态领域,例如视觉语言模型 (VLM)。VLM 旨在将 LLM 的强大能力扩展到视觉领域,使其能够理解和处理图像和文本信息,并完成诸如视觉问答、图像描述生成等任务。然而,现有的 VLM 通常缺乏对视觉语言预训练过程的深入研究,导致模型在多模态任务上的性能和泛化能力受限。

文章图片
#语言模型#学习#人工智能 +4
Sora视频水印终极解决方案:这款AI工具让你实现精准去除、高清无痕!

Sora2WatermarkRemover工具为AI视频创作者提供了专业级去水印解决方案。该工具通过"手动蒙版+AI智能修复"技术,支持用户精准标记水印区域,利用ComfyUI引擎智能填充内容,在保持原画质的同时完美去除水印。操作简单仅需"上传-框选-提交"三步,适用于影视制作、社交媒体创作等场景,为Sora视频的商业应用扫清障碍。云端处理不占用本地资源,是

文章图片
#人工智能#音视频
秒级生成、细节拉满!探索阿里巴巴 LHM 开源模型,人人都是 3D 建模师

LHM 以其惊人的速度、出色的细节还原能力和易用性,真正意义上革新了 3D 数字人的创建方式。它不仅是一个强大的技术工具,更是一个激发创意的平台,让“人人都是 3D 建模师”的愿景触手可及。

文章图片
#开源#3d#人工智能
Geneformer:计算生物学的大模型革新

近日,《Nature》杂志发表了关于Geneformer的研究,这是转录组计算生物学领域的第一个大模型。Geneformer基于约3000万个单细胞转录组的大规模语料库进行预训练,旨在网络生物学数据有限的情况下实现上下文特异性预测。Geneformer采用基于注意力的深度学习模型,通过迁移学习在有限数据的网络生物学中进行预测。它利用自注意力机制关注每个单细胞转录组中表达的基因,优化给定学习目标内的

文章图片
#人工智能#深度学习#语言模型
谷歌发布时序预测基础模型TimesFM,2亿参数,消费级GPU可运行,零样本时间序列预测新突破

时序数据在零售、金融、制造、医疗和自然科学等各个领域无处不在,而时序预测则是这些领域中一项至关重要的任务。近年来,深度学习模型在处理丰富、多变量的时序数据方面取得了显著进展,往往优于传统的统计方法,例如 ARIMA 或 GARCH。然而,大多数深度学习模型都需要经过漫长而复杂的训练和验证过程,才能在新的时序数据上进行测试。因此,对于需要快速部署和应用的实际场景,这些模型存在局限性。

文章图片
#transformer#深度学习#人工智能 +2
Qwen3-TTS 完整指南:开源文本转语音模型详解

阿里巴巴Qwen团队发布开源文本转语音模型Qwen3-TTS,提供1.7B和0.6B两个版本,支持10种语言和49+种音色。该模型具备3秒语音克隆、97毫秒低延迟等核心功能,性能优于竞品,采用Apache2.0许可可商用。硬件要求从4GB到12+GB VRAM不等,支持量化优化和微调,适用于内容创作、对话式AI等多种场景。

文章图片
#开源#人工智能#语言模型 +2
开源金融推理新标杆!Fin-R1以7B参数逼近DeepSeek-R1满血版,单卡4090即可部署

Fin-R1 (Finance Reasoning Large Language Model) 并非通用型大模型,而是专为金融领域设计的推理(Reasoning)大模型,属于 R1 类模型。数据碎片化与噪音: 金融数据来源多样,格式不一,噪音多,难以有效利用。推理逻辑不可控: 传统模型像个“黑箱”,难以理解其决策过程,这在需要高可靠性的金融领域是致命的。业务泛化能力弱: 模型往往在一个任务上训练好

文章图片
#金融#人工智能#开源
8卡L20满血运行 QwQ-32B ,每秒2600+ Tokens,压测数据全公开!

本文详细介绍了 QwQ-32B 模型的部署与测试过程,从环境准备到压力测试,每一步都提供了清晰的操作指南和实际示例。通过这些步骤,大家能够轻松地在自己的环境中部署和测试 QwQ-32B 模型,并根据压测数据对模型性能有更深入的了解。希望本文能为大家在人工智能模型的应用和优化方面提供有价值的参考。

文章图片
#数据库#人工智能#运维
智谱开源新一代多模态大模型CogVLM2,性能媲美GPT-4V

多模态大模型(MLLM)是近年来人工智能领域最热门的研究方向之一,其能够融合图像、文本等多种模态信息,实现更强大、更灵活的应用。然而,现有的主流多模态模型多以英文为训练语言,在中文理解方面存在着明显的短板。为了突破这一局限,智谱 AI 团队推出了新一代中文多模态大模型 CogVLM2,并将其开源,为中文多模态领域的发展贡献力量。Huggingface模型下载:AI快站模型免费加速下载:THUDM。

文章图片
#深度学习#人工智能#语言模型 +2
    共 128 条
  • 1
  • 2
  • 3
  • 13
  • 请选择