我把 Claude 的脑子Mythos “偷”回了本地,只用了 4GB 显存
前几天,我在本地折腾大模型的时候,又遇到了那个老问题。
就是那种,你想找个聪明的模型,结果发现它大得根本跑不起来。你想找个跑得起来的,结果发现它笨得让你想砸键盘。
特别是当你想让它帮你分析一下长文档,或者做点复杂的逻辑推理时,那些本地的 7B、9B 小模型,经常给你扯一些不着四六的话。
你让它写个代码,它逻辑是通的,但细节全是错的。你让它分析个长报告,它看到一半就开始胡说八道。
然后我看到了 Qwythos-9B。
说实话,第一眼看到这个名字,还有它那个长长的后缀 Claude-Mythos-5-1M,我是有点懵的。
Claude Mythos?那不是 Anthropic 家顶级的闭源模型吗?怎么跟一个 9B 的开源模型扯上关系了?
等我把它那份技术报告啃完,我发现,这东西有点意思。
它不是抄答案,它是抄“思考过程”
很多人对“蒸馏”有个误解,以为就是把大模型的回答扒下来,喂给小模型。
如果真是这样,那小模型永远只是个拙劣的模仿者。
但 Qwythos-9B 背后的 Empero AI 团队,干了件挺狠的事。
他们没有用普通的问答数据,而是用了超过 5 亿条 Claude Mythos 和 Claude Fable 的推理轨迹。
什么意思?
就是他们把 Claude 在解决复杂问题时,脑子里那些“第一步想什么、第二步想什么、遇到死胡同怎么退回来”的完整思维链(Chain of Thought),全都扒了下来。
然后,用他们自己的 rethink 系统,把这些思维过程硬塞进了一个只有 9B 参数的 Qwen3.5 架构里。
你可以这么理解:
他们不是把学霸的“答案”抄给了小学生,而是把学霸的“解题思路”,一点点揉进了小学生的脑子里。
结果就是,这个 9B 的小学生,做题的时候,居然有了学霸的影子。
从官方跑分来看,MMLU(知识理解)涨了 34 分,GSM8K(数学推理)涨了 30 分。
对于一个 9B 的模型来说,这已经不是挤牙膏了,这是换了个脑子。
104 万 Token,这不是噱头
这是我觉得最离谱的地方。
以前我们跑本地的 9B 模型,能有个 8K、32K 的上下文,就该谢天谢地了。
但 Qwythos-9B 默认启用了 YaRN 长上下文扩展技术,直接支持 104 万 Token。
104 万是什么概念?
大概相当于三四本几十万字的小说,或者一个中大型项目的全部源代码。
你可以把整个项目的代码库扔给它,让它帮你找 bug。你可以把几十篇长篇论文扔给它,让它帮你做文献综述。
当然,我得泼盆冷水。
104 万是理论上限。如果你真在本地开 104 万的上下文,你的显存会瞬间爆炸。
对于普通用户来说,开个 32K 到 128K,已经能覆盖 99% 的场景了。
但哪怕只是能稳定跑 128K,对于本地小模型来说,也是个巨大的飞跃。
4GB 显存,真正的“平民窟”神器
这里就不得不提它的部署门槛了。
它提供了 GGUF 量化版本。
这意味着什么?意味着你不需要去买那张几万块钱的 H100,也不需要 24G 显存的 4090。
只要 4GB 显存,你就能跑起来。
如果你像我一样,用的是 i5-12600KF 处理器,配了 32G 内存,哪怕没有独立显卡,纯靠 CPU 和内存,也能把这个模型跑起来。
32G 内存跑个 4GB 的 Q4_K_M 量化版本,简直是绰绰有余。
而且,社区里已经有人做好了“一键启动脚本”。
你不需要去配什么 Python 环境,不需要去装一堆依赖。
下载模型,下载 llama.cpp,把模型扔进 models 文件夹,双击那个 BAT 脚本。
选一下你的显存大小(或者内存大小),它自动帮你配好上下文长度,直接启动一个兼容 OpenAI 格式的本地 API。
然后你就可以用 OpenWebUI、Cherry Studio,甚至 Claude Code 直接连上去用。
这种“开箱即用”的体验,在本地大模型圈子里,真的太难得了。
不仅能聊天,它还能当 Agent
以前,本地小模型基本就是个“聊天机器人”。
你问它答,仅此而已。
但 Qwythos-9B 支持原生的 Function Calling(函数调用)。
这意味着,它可以调用外部工具。
你可以让它查天气,可以让它执行 Python 代码,可以让它去搜索网页。
它甚至还有个视觉版本(Vision),配合 mmproj 文件,它能看懂图片。
你可以给它发一张 UI 截图,让它帮你写前端代码。你可以给它发一张报错截图,让它帮你 debug。
当一个小模型,有了推理能力,有了长上下文,还能调用工具、能看图。
它就不再是个玩具了,它是一个真正能在本地跑起来的 Agent。
我的判断
说实话,Qwythos-9B 肯定不如原版的 Claude Mythos 那么神。
你在它身上,还是能看到 9B 模型的局限。比如极其复杂的逻辑嵌套,它可能还是会绕晕。
但在 9B 这个级别,它是降维打击。
它证明了,通过高质量的思维链蒸馏,小模型也能拥有大模型的“思考方式”。
更重要的是,它把体验顶级模型推理能力的门槛,拉到了极低。
4GB 显存,或者 32G 内存。
不需要交每个月 20 美金的订阅费,不需要担心数据传到云端。
所有的推理,都在你自己的电脑上完成。
如果你也想在本地跑个大模型,又不想忍受那些“人工智障”的回答。
去试试 Qwythos-9B 吧。
去 Huggingface 或者魔搭社区下载模型,找个一键启动脚本。
当你看着那个对话框里,它给出的一段逻辑清晰、步骤完整的回答时。
你会觉得,折腾这一晚上,值了。
本文由 mdnice 多平台发布
更多推荐

所有评论(0)