
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
这篇文章讨论一个在 AI 团队里极常见、但又极容易把决策带偏的问题:当别人说“Qwen 是跑分模型”“DeepSeek 更适合真实任务”时,我们究竟该如何判断这类观点是否客观、是否值得采纳?文章提出一套非常实用的判断框架:把任何观点拆成“现象、解释、建议”三层,再结合变量控制、指标翻译、替代解释、证据强度和可证伪性进行分析。它不仅适用于 “Qwen vs DeepSeek”,也适用于几乎所有 AI

很多人对TTFT、Output Speed、Throughput 这些指标如数家珍,却对“一次请求在系统里到底经历了什么”并没有完整心智模型。结果就是:知道指标名,不知道指标为什么会变;知道模型更快,不知道快在哪一段;知道 “Dense” 和 “MoE” 不一样,却说不清它们到底在请求生命周期的哪个环节分叉。本文从真实推理系统视角,把一次请求从 API 入口到最后一个 token 返回的全过程拆开

大模型推理进入 decode 阶段后,很多人会发现 GPU 利用率不高、显存占用很高、tokens/s 上不去。但问题到底出在读模型权重,还是读 KV cache?这篇文章给出一个非常实用的判断方法:固定模型和输出长度,只做两组小实验,分别拉长上下文和拉高并发,就能快速判断瓶颈更偏权重读取、KV cache,还是两者混合。
只要主干还是 Transformer,大多数推理优化都逃不开三本账:Attention / KV、FFN / MLP 和 系统调度。本文试图用一套开发者能直接复用的框架,把这些看似五花八门的技术重新归类:它到底省的是算、读、存,还是把代价转移到了别处?

Cursor提出"动态上下文发现"策略,通过让AI按需检索文件而非预加载所有信息,显著提升效率。相比静态上下文导致token膨胀和逻辑混乱,该方案将工具调用的token消耗降低46.9%。核心做法包括:长输出落文件、对话历史存档、技能按需加载、工具懒加载及终端日志文件化。文件系统作为简单通用的抽象层,既解决当前效率问题,又为未来演进保留空间。这种"先干活后查找"的机制,有效避免了信息过载导致的"书

很多人做本地部署选型时,第一反应是“27B dense 一定比 35B MoE 更小、更轻、更好跑”。但我在单卡 `L20 48GB` 上把 `llama.cpp`、`SGLang`、`vLLM` 三条路线都跑了一遍后,结论恰好相反:`Qwen3.6-35B-A3B` 这颗 MoE 在长上下文服务场景里反而更好部署,`Qwen3.6-27B` dense 不仅没有更轻,某些路线甚至更难落地。
1)Apps SDK:与外部应用无缝集成,把 ChatGPT 打造成未来的操作系统;2)AgentKit:无需编码,拖放搭建智能体。人人都可快速开发智能体,还能评估智能体能力;3)Codex 全面可用:不写一行代码,打造爆款 APP;4)API 更新:三大 API 更新,Sora 2 API 同步上线。

本文记录一个因 ~/.docker/config.json 代理配置不当,导致 Docker Compose 容器间无法通过服务名互访的隐蔽问题。包含根因分析、解决方案和最佳实践,3 分钟帮你排雷避坑。
随着 TPU v6 (Trillium) 的发布、Apple Intelligence 官宣使用 TPU 训练、以及传闻中 Meta 等巨头开始与谷歌洽谈算力合作,谷歌的策略已明显从“自用为主”转向“激进的算力市场争夺者”。这篇深度报告将为你拆解谷歌 TPU 的最新技术进展(v5p与Trillium v6)、针对英伟达的“非对称打击”策略,以及其商业布局的真实意图。
2025年12月5日,摩尔线程(688795.SH)正式登陆上海证券交易所科创板,作为国内GPU领域的领军企业之一,其上市不仅为公司发展注入强大资本,也标志着国产GPU和AI算力赛道迎来一个重要的里程碑。本文将从公司的核心竞争力、行业机遇与挑战出发,为您提供具备前瞻性的投资分析与建议。







