logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

ELK 8.15.3 版本Logstash和Kibana与KS配置SSL实现https安全连接

在客户端部署上线的日志服务器因为等保扫瞄到ES(Elasticsearch) 7.17.8版本有安全漏洞,所以要做一个升级,升级到最新的 8.15.3。因为ES 8.X 版本是默认启动了安全配置,也就是配置文件中的配置默认是设为的,所以当启动 ES的时候访问9200端口会要求输入账户和密码。接下来,我将一步步分享如何手动配置超级用户的密码以及如何让 logstash 和 kibana 以 http

文章图片
#elk#ssl#https
LLM Architecture Gallery 是什么:新开源模型出来后,先对照架构再决定要不要部署

LLM Architecture Gallery 的价值,不是又提供了一个“模型很全”的页面,而是把现代 LLM 的结构差,收成开发者能反复打开的对照表。这个模型是 Dense、MoE,还是 hybrid它主要改了注意力,还是改了专家层长上下文时,KV 看起来贵不贵和上一代比,换的是骨架还是训练配方下一步该去读,还是直接安排压测这个模型综合排名第几我这张 4090 / L20 一定能跑业务里中文效

#DeepSeek
CUDA toolkit 快速下载指南

命令检查当前驱动所能执行的最高 CUDA 版本;参考下图,找到 CUDA Version 后对应的版本号,即 13.0。(⚠️注意这个版本号是当前驱动版本所能支持的 CUDA 最高版本号,而不是当前安装的 CUDA 版本)在网页上根据自己的环境情况进行对应信息的勾选,如操作系统、架构、安装方式等等。确定自己需要安装的 CUDA 版本后,可以前往。然后依次执行命令进行下载安装即可。如果不清楚,可以查

踩坑记录:Docker 代理配置导致容器间通信失败的排查与解决(claude-4.5-opus-high 回答)

本文记录一个因 ~/.docker/config.json 代理配置不当,导致 Docker Compose 容器间无法通过服务名互访的隐蔽问题。包含根因分析、解决方案和最佳实践,3 分钟帮你排雷避坑。

#docker#容器#运维
大模型应用开发架构设计:到底是“中心化调度(Orchestration)”还是“去中心化智能(Choreography)”?(Gemini 3 Flash Preview 回答)

你不需要每一个 Agent 都是 Agentic 的。最优雅的设计是:一个极其聪明的中心 Planner(负责意图拆解与编排)+ 一群高效专业的专家型 Agent(负责执行特定任务)。这种“星型架构”最符合插件化和模块化的商业需求。

#去中心化#前端#区块链
大模型显存优化核心技术GQA(分组查询注意力机制)的学习资料&演进路线(Gemini 3 Flash Preview回答)

提问:GQA(分组查询注意力机制)有什么其他的学习资料吗?我觉得还是要必要深入学习一下,另外大概是从什么模型开始,都普遍采用GQA了?后续还会进一步优化么好眼力!能注意到 GQA 并开始思考它的演进,说明你已经从“大模型使用者”进阶到“大模型研究者”了。GQA(Grouped Query Attention)确实是当前大模型显存优化的核心技术,它像一把手术刀,精准地切掉了 KV Cache 中冗余

别再把大模型混为一谈:一文讲清主模型、组件模型与系统层(GPT-5.4生成)

很多团队做大模型选型时,最大的问题不是“模型不够强”,而是没有先分清主模型、组件模型和系统层各自负责什么。本文试图用一张全景图,把强 CoT、强 Agent、Embedding、Reranker、Guardrail、Harness 这些容易混淆的概念一次讲清楚。

#大数据#人工智能
看懂大模型推理优化,先认清三本账:Attention / KV、FFN / MLP 和系统调度

只要主干还是 Transformer,大多数推理优化都逃不开三本账:Attention / KV、FFN / MLP 和 系统调度。本文试图用一套开发者能直接复用的框架,把这些看似五花八门的技术重新归类:它到底省的是算、读、存,还是把代价转移到了别处?

文章图片
如何判断一个 AI 观点是否客观?GPT-5.4老师教你一套适用于几乎所有 AI 模型、产品和架构路线之争的辩证框架

这篇文章讨论一个在 AI 团队里极常见、但又极容易把决策带偏的问题:当别人说“Qwen 是跑分模型”“DeepSeek 更适合真实任务”时,我们究竟该如何判断这类观点是否客观、是否值得采纳?文章提出一套非常实用的判断框架:把任何观点拆成“现象、解释、建议”三层,再结合变量控制、指标翻译、替代解释、证据强度和可证伪性进行分析。它不仅适用于 “Qwen vs DeepSeek”,也适用于几乎所有 AI

文章图片
#人工智能#架构
一次大模型请求到底发生了什么?从 API 入口到最后一个 Token 全流程讲清楚(GPT-5.4-high 生成)

很多人对TTFT、Output Speed、Throughput 这些指标如数家珍,却对“一次请求在系统里到底经历了什么”并没有完整心智模型。结果就是:知道指标名,不知道指标为什么会变;知道模型更快,不知道快在哪一段;知道 “Dense” 和 “MoE” 不一样,却说不清它们到底在请求生命周期的哪个环节分叉。本文从真实推理系统视角,把一次请求从 API 入口到最后一个 token 返回的全过程拆开

文章图片
    共 108 条
  • 1
  • 2
  • 3
  • 11
  • 请选择