
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
2023 年,当 Mistral 发布 Mixtral 时,很多人觉得 MoE 只是一个「不错的技巧」。到了 2025 年,MoE 已经成为了大模型的默认架构。这不是偶然——在算力成本压力越来越大的背景下,任何能「用更少计算做更多事情」的技术都会成为主流。对于做 AI 应用的开发者来说,理解 MoE 的几个关键参数(总参数 vs. 激活参数、top-K 值、专家数量)比深入理解注意力机制本身更为实
每次跟身边朋友聊大模型,总有人会问同一个问题:「为什么 ChatGPT 还是会一本正经地胡说八道?」这个问题背后其实是整个 AI 行业最棘手也最迷人的技术难题——幻觉(Hallucination)。五年过去了,从 GPT-3 到 GPT-4o,再到 Claude、Gemini、DeepSeek,模型智商翻了好几倍,但幻觉问题就像影子一样甩不掉。今天我想聊聊,为什么这个问题从根子上就无法彻底消除。
传统的 Transformer 模型遇到一个问题:模型越大,推理成本越高。一个 1750 亿参数的 GPT-3,每次生成 token 都需要激活所有参数,计算量极大。不要每次都用全部参数,而是只激活其中一部分「专家」。具体来说,MoE 层包含多个独立的 Feed-Forward Network(FFN)子网络,每个称为一个「专家」(Expert)。输入 token 经过一个门控网络(Router)
Tokenization 是大模型的第一道工序,也是最容易被忽视的环节。它决定了模型「看到」的文本是什么样的,直接影响模型的训练效率、推理速度和理解能力。下次看到界面上跳动的 token 数字时,希望你能想起——这不仅仅是一个计费单位,更是大模型理解人类语言的最基础单元。你还遇到过什么跟 token 相关的有趣问题?欢迎在评论区留言讨论。
Qwen2.5 代表了中国开源大模型的一个重要里程碑。它不仅在架构设计上紧跟前沿(GQA + RoPE + SwiGLU + 长上下文),还在训练方法上展现了工程实力(18T tokens 的高质量预训练 + 多阶段后训练)。更重要的是,它以完全开放的姿态推动了整个社区的发展,让更多开发者能够站在巨人的肩膀上进行创新。从 Qwen 到 Qwen2.5,我们看到的是国产大模型从「能跑」到「好用」的质
如果你关注过去两年大模型的发展,会发现一个有趣的现象:从 ChatGPT 发布时传闻的千亿参数 MoE 架构,到 DeepSeek 的开源 MoE 模型,再到 Gemini 1.5 系列的架构演进——几乎所有主流大模型都在拥抱混合专家(Mixture of Experts, MoE)架构。以 Mixtral 8×7B 为例,它的总参数量是 8×7B = 56B,但由于每次只激活两个专家(约 12B
Ollama:零门槛,适合初学者和个人使用llama.cpp:极致性能,适合边缘设备和资源受限场景vLLM:企业级能力,适合高并发生产环境建议路线:先用 Ollama 跑通全流程,验证模型效果;如果部署到生产环境且有高并发需求,再切换到 vLLM;如果需要在低配设备上运行,考虑 llama.cpp。无论选择哪种方案,本地部署的大门已经向所有人敞开。花一个周末动手试试,你会发现运行自己的大模型并没有
自从 ChatGPT 横空出世以来,大语言模型(LLM)展现出了令人惊叹的能力——写代码、做翻译、写文章、甚至通过律师资格考试。。所谓幻觉,是指模型生成的内容看起来合情合理,但实际上与事实不符。比如问一个模型"2024年奥运会谁拿了乒乓球金牌",它可能编造出一个听起来很真实的名字和比分。更棘手的是,这些错误往往包裹在流畅自然的语言中,让人很难一眼识破。
过去两年里,AI 编程助手从一个新鲜的概念变成了越来越多开发者日常工具箱中的标配。作为一名 AI 技术从业者,我几乎每天都会接触这些工具。和。
过去两年里,AI 编程助手从一个新鲜的概念变成了越来越多开发者日常工具箱中的标配。作为一名 AI 技术从业者,我几乎每天都会接触这些工具。和。







