logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

如何判断一个 AI 观点是否客观?GPT-5.4老师教你一套适用于几乎所有 AI 模型、产品和架构路线之争的辩证框架

这篇文章讨论一个在 AI 团队里极常见、但又极容易把决策带偏的问题:当别人说“Qwen 是跑分模型”“DeepSeek 更适合真实任务”时,我们究竟该如何判断这类观点是否客观、是否值得采纳?文章提出一套非常实用的判断框架:把任何观点拆成“现象、解释、建议”三层,再结合变量控制、指标翻译、替代解释、证据强度和可证伪性进行分析。它不仅适用于 “Qwen vs DeepSeek”,也适用于几乎所有 AI

文章图片
#人工智能#架构
一次大模型请求到底发生了什么?从 API 入口到最后一个 Token 全流程讲清楚(GPT-5.4-high 生成)

很多人对TTFT、Output Speed、Throughput 这些指标如数家珍,却对“一次请求在系统里到底经历了什么”并没有完整心智模型。结果就是:知道指标名,不知道指标为什么会变;知道模型更快,不知道快在哪一段;知道 “Dense” 和 “MoE” 不一样,却说不清它们到底在请求生命周期的哪个环节分叉。本文从真实推理系统视角,把一次请求从 API 入口到最后一个 token 返回的全过程拆开

文章图片
大模型推理的 Decode 阶段到底是读权重慢,还是读 KV Cache 慢?用两个小实验快速定位瓶颈(GPT-5.4-high 生成)

大模型推理进入 decode 阶段后,很多人会发现 GPU 利用率不高、显存占用很高、tokens/s 上不去。但问题到底出在读模型权重,还是读 KV cache?这篇文章给出一个非常实用的判断方法:固定模型和输出长度,只做两组小实验,分别拉长上下文和拉高并发,就能快速判断瓶颈更偏权重读取、KV cache,还是两者混合。

#人工智能
看懂大模型推理优化,先认清三本账:Attention / KV、FFN / MLP 和系统调度

只要主干还是 Transformer,大多数推理优化都逃不开三本账:Attention / KV、FFN / MLP 和 系统调度。本文试图用一套开发者能直接复用的框架,把这些看似五花八门的技术重新归类:它到底省的是算、读、存,还是把代价转移到了别处?

文章图片
动态上下文发现:Cursor 让 Agent 从“背书”到“开卷考”

Cursor提出"动态上下文发现"策略,通过让AI按需检索文件而非预加载所有信息,显著提升效率。相比静态上下文导致token膨胀和逻辑混乱,该方案将工具调用的token消耗降低46.9%。核心做法包括:长输出落文件、对话历史存档、技能按需加载、工具懒加载及终端日志文件化。文件系统作为简单通用的抽象层,既解决当前效率问题,又为未来演进保留空间。这种"先干活后查找"的机制,有效避免了信息过载导致的"书

文章图片
单卡 L20 48G 实测|Qwen3.6 的 35B MoE 反而比 27B dense 更好部署?基于 llama.cpp、SGLang、vLLM 推理模型的对比实验

很多人做本地部署选型时,第一反应是“27B dense 一定比 35B MoE 更小、更轻、更好跑”。但我在单卡 `L20 48GB` 上把 `llama.cpp`、`SGLang`、`vLLM` 三条路线都跑了一遍后,结论恰好相反:`Qwen3.6-35B-A3B` 这颗 MoE 在长上下文服务场景里反而更好部署,`Qwen3.6-27B` dense 不仅没有更轻,某些路线甚至更难落地。

#sglang
OpenAI 发布四大更新,重视算力+存力机遇【国盛证券2025年10月7日行业周报】

1)Apps SDK:与外部应用无缝集成,把 ChatGPT 打造成未来的操作系统;2)AgentKit:无需编码,拖放搭建智能体。人人都可快速开发智能体,还能评估智能体能力;3)Codex 全面可用:不写一行代码,打造爆款 APP;4)API 更新:三大 API 更新,Sora 2 API 同步上线。

文章图片
#人工智能
踩坑记录:Docker 代理配置导致容器间通信失败的排查与解决(claude-4.5-opus-high 回答)

本文记录一个因 ~/.docker/config.json 代理配置不当,导致 Docker Compose 容器间无法通过服务名互访的隐蔽问题。包含根因分析、解决方案和最佳实践,3 分钟帮你排雷避坑。

#docker#容器#运维
谷歌 TPU:从“后花园”到“角斗场”(Gemini 3 pro生成)

随着 TPU v6 (Trillium) 的发布、Apple Intelligence 官宣使用 TPU 训练、以及传闻中 Meta 等巨头开始与谷歌洽谈算力合作,谷歌的策略已明显从“自用为主”转向“激进的算力市场争夺者”。这篇深度报告将为你拆解谷歌 TPU 的最新技术进展(v5p与Trillium v6)、针对英伟达的“非对称打击”策略,以及其商业布局的真实意图。

掘金“国产GPU第一股”:摩尔线程上市后的投资机遇与风险深度分析(Gemini 2.5 Flash生成)

2025年12月5日,摩尔线程(688795.SH)正式登陆上海证券交易所科创板,作为国内GPU领域的领军企业之一,其上市不仅为公司发展注入强大资本,也标志着国产GPU和AI算力赛道迎来一个重要的里程碑。本文将从公司的核心竞争力、行业机遇与挑战出发,为您提供具备前瞻性的投资分析与建议。

#人工智能
    共 100 条
  • 1
  • 2
  • 3
  • 10
  • 请选择