logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Seed-Thinking-v1.5:字节豆包新推理模型发布,200B参数战胜Deepseek

字节跳动旗下的豆包团队正式发布了其最新的推理模型——Seed-Thinking-v1.5,该模型在多个方面展现出了明显的技术优势。这一进展不仅推动了推理模型的发展,还引发了同行业内的高度关注,标志着AI技术在通用推理能力上的一个重要里程碑。

文章图片
#AIGC
LSNet:以小见大,CVPR2025全新轻量级主干网络

本文提出了一种新型的轻量级视觉网络架构——LSNet(Large-Small Network),旨在通过高效的感知和聚合策略,在有限的计算成本下实现高性能的视觉信息处理。LSNet的设计灵感来源于人类视觉系统的“看大,聚焦小”策略,通过结合大核感知(Large-Kernel Perception, LKP)和小核聚合(Small-Kernel Aggregation, SKA)的LS卷积操作,实现

文章图片
#深度学习#计算机视觉#人工智能 +4
Kimi-K2技术报告解读:万亿参数大模型,开源模型新SOTA

Kimi K2,这是一个面向智能体智能的 1 万亿参数开源 MoE 模型。借助 token 高效的 MuonClip 优化器与 15.5 T 高质量 token 数据,作者实现了稳定且可扩展的预训练。后训练阶段,作者将大规模合成工具使用数据与统一 RL 框架相结合,同时利用可验证奖励与自评反馈。Kimi K2 在智能体与推理基准上刷新开源纪录,成为迄今最强的开源大模型。 

文章图片
#人工智能#nlp#AIGC +2
LaViDa:基于扩散模型的多模态大模型,速度超越next-token范式

这篇文章提出了一种基于离散扩散模型(DMs)的新型视觉语言模型(VLM),LaViDa,旨在解决现有自回归(AR)VLMs在推理速度和可控生成方面的局限性。文章详细介绍了LaViDa的设计、训练和推理过程,并通过一系列实验验证了其在多模态任务中的性能和优势。

文章图片
#人工智能#多模态#pytorch +1
HPT:何凯明新作!解决智能体异构问题(包含论文代码详解)

在这篇博客中,我们介绍了异构预训练Transformer(HPT)模型,这是由MIT和Meta FAIR团队开发的机器人学习领域的一个突破。HPT解决了机器人学习中的异构性问题,通过预训练一个共享的神经网络主干来学习通用的表示,使模型能够跨机器人硬件和任务迁移和泛化。这一创新减少了对特定任务数据的需求,并在真实与模拟环境中展现了优异的性能,预示着机器人技术在智能化和自主化方面的广阔前景。

文章图片
#人工智能#计算机视觉
Vllm进行Qwen2-vl部署(包含单卡多卡部署及爬虫请求)

使用vLLM部署Qwen2-VL,包含单卡部署、多卡部署、爬虫requests发送请求

文章图片
#爬虫#深度学习#人工智能 +1
VGGT:CVPR2025最佳论文,3D基础模型来了!

本文介绍了一种名为VGGT(Visual Geometry Grounded Transformer)的新型前馈神经网络,它能够直接从单张、少数或数百张图像中高效地预测出场景的关键三维属性,包括相机参数、深度图、点云图和三维点轨迹。VGGT的设计目标是简化传统的三维重建流程,避免复杂的后处理优化步骤,同时提供高质量的三维重建结果。

文章图片
#人工智能#3d#视觉检测 +4
MinerU:最强文档解析多模态大模型

MinerU是一款由OpenDataLab开源的多模态文档智能解析工具链,旨在将PDF等非结构化文档转化为机器可读的结构化数据。MinerU支持多种输出格式(Markdown/LaTeX/HTML/JSON),可处理复杂版式文档,并针对重叠元素设计了智能后处理算法。该工具填补了开源社区在高精度文档理解基础设施方面的空白,为构建高质量大模型语料库提供了工业级解决方案。

文章图片
#开源#人工智能#视觉检测 +2
Qwen3-VL:开源最强多模态大模型(架构解析及使用代码)

Qwen3-VL是阿里巴巴开发的新一代视觉语言模型,支持256K tokens的交错上下文处理,包含稠密型和混合专家型变体。其核心优势包括强大的文本理解能力、稳健的长上下文处理以及先进的多模态推理能力。模型通过增强型交错MRoPE、DeepStack集成和文本基视频时间对齐三大升级优化时空建模。训练采用四阶段预训练和SFT、知识蒸馏、RL后训练流程,在多模态任务中表现卓越。评估显示Qwen3-VL

文章图片
#人工智能#深度学习#语言模型 +2
DeepSeek-Math-V2:自验证数学推理大模型(论文详解)

DeepSeekMath-V2是由DeepSeek-AI开发的自验证数学推理大语言模型,通过验证器-生成器;协同架构解决传统强化学习在数学推理中的局限性。该模型在数学竞赛中表现卓越,并在多项基准测试中优于GPT-5-Thinking-High等主流模型,展现了自验证数学推理的可行性。

文章图片
#人工智能#深度学习#自然语言处理 +1
    共 95 条
  • 1
  • 2
  • 3
  • 10
  • 请选择