
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
Xing4.0-29B-A4B 通过4-bit 量化后显存占用降低至 15GB(比 FP16 省约 75%),RTX 3090、RTX 4090 这类 24G 消费级显卡就能本地跑长上下文任务,这意味着,个人开发者、小型工作室、中小企业不用采购昂贵的 A 系列专业卡,依托现有消费级硬件就能把模型跑起来——既能完成复杂任务拆解、工具调用执行,也能保证数据安全私密、全程不出域。更关键的是,从训练芯片到

Xing4.0-29B-A4B 通过4-bit 量化后显存占用降低至 15GB(比 FP16 省约 75%),RTX 3090、RTX 4090 这类 24G 消费级显卡就能本地跑长上下文任务,这意味着,个人开发者、小型工作室、中小企业不用采购昂贵的 A 系列专业卡,依托现有消费级硬件就能把模型跑起来——既能完成复杂任务拆解、工具调用执行,也能保证数据安全私密、全程不出域。更关键的是,从训练芯片到

智谱AI发布GLM-4-0414系列大模型,包含32B和9B两种参数规模,涵盖基础、推理和沉思等模型类型,采用MIT开源协议。其中32B推理模型性能对标业界领先水平,实测推理速度达200 Tokens/秒。文档详细介绍了基于MindSpeed-LLM的部署流程,包括环境配置、权重转换、数据预处理、训练推理等完整实践指南。开发者可通过魔乐社区获取6个不同版本的模型下载链接。

在传统的AI模型部署过程中,工程师们常常面临着诸多挑战。多机集群的配置复杂,手动部署不仅耗时费力,还容易出现错误。昇腾MindIE多机集群推理自动化工具的出现,正是为了解决这些痛点。它通过自动化的部署流程,极大地简化了多机集群推理的复杂性,让工程师们能够更专注于模型的开发和优化,而不是被繁琐的部署细节所困扰。目前该工具已上线魔乐社区,欢迎体验!

本文详细介绍了在魔乐社区部署多模态大模型推理服务的完整流程。首先配置基于OpenEuler的NPU开发环境,安装LLaMA-Factory等依赖包并进行环境验证。接着演示了如何下载Qwen2.5-VL-3B-Instruct等模型权重,并提供了三种推理部署方式:交互式终端、OpenAI兼容API服务以及离线推理脚本。重点说明了多模态模型处理图像输入的注意事项,包括正确的占位符使用方式。最后指导用户

TeleChat3-105B-A4.7-Thinking是 TeleChat系列国内首个开源的全自主创新千亿参数细粒度MoE语义大模型,由中国电信人工智能研究院(TeleAI)研发训练,在问答、写作、数学、代码、Agent等多维度,与业内头部模型比肩,特别在代码能力、复杂任务通用问答、细粒度MoE等维度上有显著的效果提升,同时采用创新训练方式,加快模型在训练初期的收敛速度,增强模型在训练中的稳定性

在AI4S关键垂类领域,Intern-S1-Pro成功构建了一个跨越化学、材料、生命、地球、物理五大核心学科的全谱系能力矩阵,涵盖100多个专业子任务,不仅在Mol-Instruction、Biology-Instruction等单学科垂类评测中表现优异,更在SciReasoner等高难度的综合学科评测基准中,取得了与闭源商业大模型及垂类SOTA模型相当,甚至更优的成绩,稳居AI4S领域的第一梯队

在刚刚结束的魔乐社区GeekDay上海站上,魔乐社区贡献者、昇腾优秀开发者丁一超带来了题为《如何入门大模型从量化到评测》的分享。作为一名从企业IT工作之余投身AI技术的开发者,他用亲身经历证明:量化并非高不可攀的技术壁垒,而是一条有章可循的实践路径。本文将系统梳理丁一超的分享内容与采访心得,涵盖MindStudio-ModelSlim工具链的使用、一键量化操作、敏感层分析、vLLM Ascend部

国产 AI 生态再添旗舰力作!4月12日,MiniMax M2.7正式开源并上线魔乐社区。M2.7 开启了模型的自我进化,也是MiniMax第一个 AI 深度参与迭代自己的模型。基于其在真实的软件工程、专业办公场景的优异表现,M2.7 已成为在 Hermes Agent、OpenClaw 等智能体工具中最受好评的模型之一。来自海内外的开发者与企业客户的接入需求持续增长,模型调用量在快速提升。

除了性能惊艳,MiniCPM-V 4.6 在效率上也取得了堪称「反常识」的突破。尽管参数规模比 Qwen3.5-0.8B 更大,但 MiniCPM-V 4.6 的运行效率却更快,实现了惊人的反超推理吞吐量:基于 vLLM 的 token 吞吐量是 Qwen3.5-0.8B 的1.5 倍。计算成本:在 AA 评测中,仅用2.5%的 token 消耗(5.4M vs 233M)就超越了 Qwen3.5









