
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
花了三天,753B 的 GLM-5.2 在 64GB 笔记本上终于能加载运行了,速度出奇意料竟然有3 tok/s——但输出全是问号。我把整个排查过程写了下来,从 tokenizer 逆向到 tensor 结构分析,踩过的坑都在里面。如果你懂 llama.cpp 的 MLA 实现,或者也卡在这个问题上,评论区聊聊。

本以为用 64GB 内存硬扛 435GB 大模型是极限优化,结果模型跑通了却只会输出满屏问号?排查了量化、权重甚至显卡驱动都没用,最后竟然发现是 Windows 下 MSVC 编译器的浮点计算在捣鬼!本文将复盘这次离谱的踩坑经历,带你看看底层编译器是如何让 MLA 架构"发疯"的。

同一个笔记本、同一个 Windows、同一个 MLA——上次满屏乱码,这次全对?凶手没落网,可它确实没犯案。同样的证据我拼出三种解释,无一铁证。最终方案:llama.cpp + `--cpu-moe` + KV 量化,144GB 量化 GGUF(284B MoE)在 64GB 内存上跑出 **1.77 tok/s、输出全对**。四连撞每步、14 组测试、复现命令都在文内。

我们提出了一个AI系统间合作的热力学框架——负熵转移(NET)。通过将LLM智能体建模为具有有限能量预算的耗散系统,我们证明了智能体之间的定向能量流可以产生孤立系统无法实现的涌现特性:死亡状态的复活、混沌到秩序的转化,以及在转移停止后仍然持续的永久结构改变。
花了三天,753B 的 GLM-5.2 在 64GB 笔记本上终于能加载运行了,速度出奇意料竟然有3 tok/s——但输出全是问号。我把整个排查过程写了下来,从 tokenizer 逆向到 tensor 结构分析,踩过的坑都在里面。如果你懂 llama.cpp 的 MLA 实现,或者也卡在这个问题上,评论区聊聊。

公司内网不能访问外网,但你又想用Claude Code辅助编程怎么办?这篇讲我在完全离线环境下把Claude Code跑起来的全过程,包括4个我踩过的坑:依赖包不全、Node版本不对、API代理配置试了三种、代理服务器不稳定。最后给出完整方案和在线版的区别对比。

我们提出了一个AI系统间合作的热力学框架——负熵转移(NET)。通过将LLM智能体建模为具有有限能量预算的耗散系统,我们证明了智能体之间的定向能量流可以产生孤立系统无法实现的涌现特性:死亡状态的复活、混沌到秩序的转化,以及在转移停止后仍然持续的永久结构改变。







