
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
在客户端部署上线的日志服务器因为等保扫瞄到ES(Elasticsearch) 7.17.8版本有安全漏洞,所以要做一个升级,升级到最新的 8.15.3。因为ES 8.X 版本是默认启动了安全配置,也就是配置文件中的配置默认是设为的,所以当启动 ES的时候访问9200端口会要求输入账户和密码。接下来,我将一步步分享如何手动配置超级用户的密码以及如何让 logstash 和 kibana 以 http

LLM Architecture Gallery 的价值,不是又提供了一个“模型很全”的页面,而是把现代 LLM 的结构差,收成开发者能反复打开的对照表。这个模型是 Dense、MoE,还是 hybrid它主要改了注意力,还是改了专家层长上下文时,KV 看起来贵不贵和上一代比,换的是骨架还是训练配方下一步该去读,还是直接安排压测这个模型综合排名第几我这张 4090 / L20 一定能跑业务里中文效
命令检查当前驱动所能执行的最高 CUDA 版本;参考下图,找到 CUDA Version 后对应的版本号,即 13.0。(⚠️注意这个版本号是当前驱动版本所能支持的 CUDA 最高版本号,而不是当前安装的 CUDA 版本)在网页上根据自己的环境情况进行对应信息的勾选,如操作系统、架构、安装方式等等。确定自己需要安装的 CUDA 版本后,可以前往。然后依次执行命令进行下载安装即可。如果不清楚,可以查
本文记录一个因 ~/.docker/config.json 代理配置不当,导致 Docker Compose 容器间无法通过服务名互访的隐蔽问题。包含根因分析、解决方案和最佳实践,3 分钟帮你排雷避坑。
你不需要每一个 Agent 都是 Agentic 的。最优雅的设计是:一个极其聪明的中心 Planner(负责意图拆解与编排)+ 一群高效专业的专家型 Agent(负责执行特定任务)。这种“星型架构”最符合插件化和模块化的商业需求。
提问:GQA(分组查询注意力机制)有什么其他的学习资料吗?我觉得还是要必要深入学习一下,另外大概是从什么模型开始,都普遍采用GQA了?后续还会进一步优化么好眼力!能注意到 GQA 并开始思考它的演进,说明你已经从“大模型使用者”进阶到“大模型研究者”了。GQA(Grouped Query Attention)确实是当前大模型显存优化的核心技术,它像一把手术刀,精准地切掉了 KV Cache 中冗余
很多团队做大模型选型时,最大的问题不是“模型不够强”,而是没有先分清主模型、组件模型和系统层各自负责什么。本文试图用一张全景图,把强 CoT、强 Agent、Embedding、Reranker、Guardrail、Harness 这些容易混淆的概念一次讲清楚。
只要主干还是 Transformer,大多数推理优化都逃不开三本账:Attention / KV、FFN / MLP 和 系统调度。本文试图用一套开发者能直接复用的框架,把这些看似五花八门的技术重新归类:它到底省的是算、读、存,还是把代价转移到了别处?

这篇文章讨论一个在 AI 团队里极常见、但又极容易把决策带偏的问题:当别人说“Qwen 是跑分模型”“DeepSeek 更适合真实任务”时,我们究竟该如何判断这类观点是否客观、是否值得采纳?文章提出一套非常实用的判断框架:把任何观点拆成“现象、解释、建议”三层,再结合变量控制、指标翻译、替代解释、证据强度和可证伪性进行分析。它不仅适用于 “Qwen vs DeepSeek”,也适用于几乎所有 AI

很多人对TTFT、Output Speed、Throughput 这些指标如数家珍,却对“一次请求在系统里到底经历了什么”并没有完整心智模型。结果就是:知道指标名,不知道指标为什么会变;知道模型更快,不知道快在哪一段;知道 “Dense” 和 “MoE” 不一样,却说不清它们到底在请求生命周期的哪个环节分叉。本文从真实推理系统视角,把一次请求从 API 入口到最后一个 token 返回的全过程拆开








