logo
publist
写文章

简介

ModelScope旨在打造下一代开源的模型即服务共享平台,为泛AI开发者提供灵活、易用、低成本的一站式模型服务产品,让模型应用更简单!

擅长的技术栈

可提供的服务

开源模型社区

Qwen3.8-27B-DFlash2 开源:1.92B 草稿模型,SGLang 单并发吞吐达自回归 3.4 倍

Inco AI 团队开源面向 Qwen3.8-27B 的投机解码草稿模型 Qwen3.8-27B-DFlash2。该草稿模型参数量 1.92B、约 3.85GB,与目标模型 Qwen3.8-27B 配合使用,沿用 DFlash 系列一次前向传播并行预测整块 token 的草稿设计,并在此基础上新增轻量路径选择器和双抽头动态卷积,把草稿准确率保持到整块末尾。 在单张 NVIDIA H200、SGLa

文章图片
FastFlowLM 接入魔搭社区:AMD Ryzen™ AI NPU 推理框架,一个参数切换国内下载源

FastFlowLM(FLM)发布 v0.9.46,正式接入魔搭社区(ModelScope)。它是首个专为 AMD Ryzen™ AI NPU 打造的开箱即用推理运行时,使用方式与 Ollama 类似——一行命令拉取模型、一行命令运行,但底层完全针对 NPU 硬件重新设计。此前模型默认从 Hugging Face 拉取,本次新增 --modelscope 1 参数,国内用户可将下载源切换到魔搭,无

文章图片
B站indexTTS 2.5 开源:五国语言零样本配音,推理提速 2.28 倍

B站 IndexTTS 团队近日在魔搭社区开源 IndexTTS 2.5,一款支持中、英、日、西、阿五语种的零样本语音复刻模型。IndexTTS 系列此前以情感-音色解耦和高情绪还原度在社区获得广泛关注,但也面临两个集中反馈:语种覆盖有限(仅中英)、推理速度不够快。2.5 版本针对这两点做了系统性升级,同时补齐了语速控制能力。   主要技术指标:推理提速约 2.28 倍(A10 环境)、

文章图片
小红书开源dots3-note Preview:280B 总参数激活 16B,512K 上下文的三模态长程 Agent 模型

小红书 dots studio 团队开源 dots3-note Preview。作为 dots3 系列(将包括 note、jazz、aria 三档)中最轻量的模型,note 总参数 280B、激活参数 16B,支持 512K 上下文,具备文本、视觉和语音的多模态理解能力,并针对复杂推理和长程 Agent 任务进行了优化。   dots3-note Preview 在推理、Agent 及多

文章图片
走到LLaDA-2.2,关于扩散语言模型上的一些理论和实际思考

过去一年,diffusion language model(dLLM)快速升温。Google 发布了 DiffusionGemma,LLaDA 系列推进到了 2.2,黄高老师团队的 *The Flexibility Trap: Rethinking the Value of Arbitrary Order in Diffusion Language Models* 也获得了 ICML Outsta

文章图片
LTX-2.5 开源:22B 音画生成模型,原生多镜头、自动时长与 4K HDR

Lightricks 开放 LTX-2.5 模型权重。这是 LTX-2 音视频生成模型的最新版本,参数规模为 22B,可根据文本、图像和视频输入生成同步音画。相比 LTX-2.3,LTX-2.5 进一步更新视频解码、提示词理解和蒸馏流程,并新增原生多镜头、自动时长预测、4K HDR 与 RAW 工作流等能力。模型同时提供面向微调的 Dev 权重和固定 8 步推理的 Distilled 权重。 模型

文章图片
Qwen3.8-2.4T-A95B 开源!2.4T MoE,激活 95B,原生 256K 上下文

刚刚,Qwen 团队正式开放 Qwen3.8-2.4T-A95B 模型权重!   Qwen-Max 级别的模型首次开源权重:模型总参数为 2.4T,每个 Token 激活 95B 参数,原生支持 262,144 Token 上下文,并可扩展至 1,010,000 Token。 Qwen3.8 延续 Qwen3.5 的混合架构,重点提升编程、办公、科研和长周期 Agent 任务的端到端完成

文章图片
智源AREX开源:4B的Turbo版超越30B级DeepResearch模型

当大模型逐渐掌握对话、推理、编程和工具调用之后,自主研究被视为下一个关键方向。 普通问答只需要定位一个事实,而自主研究面对的是一组相互关联、彼此制约的条件。智能体不仅要从庞大的信息空间中定位候选答案,还需整合分散甚至冲突的证据,并确认最终答案满足全部关键约束——只要有一项未验证,答案即为无效解。自主研究的核心难题并不是“搜索得还不够久或者证据难找”,而是:智能体能不能知道当前答案到底已经成立了什么

文章图片
96GB 显存怎么跑 DeepSeek-V4-Flash-0731?Expert Offload 与单卡RTX pro6000部署实战

随着大语言模型规模不断增长,本地部署大模型时遇到的主要问题,已经不只是 GPU 算力是否足够,而是模型权重能不能放进显存,以及 CPU 和 GPU 之间如何合理分配这些权重。 DeepSeek-V4 这类大规模 MoE 模型就是一个很典型的例子。模型整体参数规模很大,即使使用一张拥有 96GB 显存的 RTX PRO 6000,也很难简单地把完整模型全部加载到 GPU 中。但 MoE 模型与传统

文章图片
NVIDIA Nemotron 3.5 Lightning 开源:30B MoE 仅激活 3B,吞吐最高提升 4 倍

NVIDIA 开源 Nemotron 3.5 Lightning,BF16、NVFP4、NVFP4-DFlash、NVFP4-DSpark 四个权重版本已同步上线魔搭社区。这是一个总参数 30B、激活参数 3B 的混合 MoE 模型,蒸馏自NVIDIA 前沿模型 Nemotron 3 Ultra,与 Nemotron Coalition 共同开发,支持最高 1M 上下文,使用超过 20T toke

文章图片
    共 1062 条
  • 1
  • 2
  • 3
  • 107
  • 请选择