
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
在这篇文章中,我们从零起步,一步步构建了一个功能完整的低代码渲染引擎。模块核心能力关键设计组件注册表组件注册、查找、批量管理单例模式、类型安全渲染引擎Schema 解析、递归渲染、上下文传递表达式引擎数据绑定、动态取值、沙箱执行+ Proxy 沙箱条件渲染visible/disabled 条件、多运算符AND 逻辑求值器事件系统事件声明、动作链、动作分发Action 队列、异步调度布局系统24 栅
AI 应用监控 = 传统四指标 + AI 专属四指标,模型层比应用层更重要;网关是埋点的最佳位置,所有请求都经过它,指标最全;Prometheus + Grafana 2 小时能跑通,成本几乎为零(都跑在 Flexus 上);告警分级是灵魂:P0 立即、P1 15 分钟、P2 当日、P3 周会,别让"狼来了"毁掉告警;监控是省钱工具:思维链和 Token 成本监控,直接转化为真金白银的节省。AI
本文从零实现了一个完整的 TTS 系统,覆盖了从文本前端处理到波形生成的全流程。架构设计:基于 FastSpeech 非自回归架构,编码器-持续时间预测器-长度调节器-解码器-声码器五段式结构。相比自回归模型推理速度快 10 倍以上,且支持独立的语速控制。文本前端:文本规范化 + 音素转换是 TTS 系统的"入口关"——看似简单,但数字、缩写、多音字等边缘情况需要仔细处理。声学模型:通过多头注意力
Function Calling(函数调用 / 工具调用)是大模型落地到实际业务的关键能力。没有它,模型只能输出文本,有了它,模型才能查数据库、发 API、操作文件。很多开发者直接套 LangChain 或 Semantic Kernel,但出了问题根本不知道从哪排起。本文带你用纯 Python 手写一套可用的 Function Calling 机制,去掉所有框架封装,理解本质。我们先用 Pyth
本文从零实现了一个完整的 LoRA 模块,涵盖了从低秩分解的数学原理到实际训练的全流程。LoRA 的本质:冻结主干 + 低秩旁路 = 极少的可训练参数数学公式:(\Delta W = BA),计算顺序 (B(Ax)) 更高效工程关键:B 初始化为零、选择合适的 r 和 alpha、只收集 lora_ 参数部署友好:推理前合并权重,零额外开销可扩展:多任务场景下可部署数十个适配器,共用基座模型。
大模型本地部署不是 N 卡专属。AMD Radeon 显卡凭借大显存和逐渐成熟的 ROCm 生态,正在成为高性价比的 AI 推理选择。本文记录一套经过实测的 ROCm 环境搭建流程,以 Radeon RX 7900 XTX(24GB)为例,完整演示从驱动安装到 DeepSeek-R1 推理,再到生产级 API 服务的全过程。所有步骤均在 Ubuntu 22.04 LTS 上验证通过。AMD Rad
本文从零开始构建了一个面向 DeepSeek 架构的高效推理引擎,覆盖了 MLA 注意力实现、分页 KV Cache、MoE 专家调度、连续批处理、INT4 量化、推测解码等核心优化技术。回顾要点1.理解架构才能做好优化:DeepSeek 的 MLA 和 MoE 直接决定了 KV Cache 和计算调度策略2.连续批处理是现代推理引擎的基础设施:不做 CB 的推理引擎上限极低3.量化是性价比最高的
2025 年以来,DeepSeek 系列模型凭借其出色的推理能力和极具竞争力的价格,迅速成为国内开发者社区的热门选择。无论是 DeepSeek-V3 的综合能力,还是 DeepSeek-R1 在数学推理与代码生成方面的惊艳表现,都让人看到了国产大模型的真正实力。然而,模型强不等于应用强。部署门槛高:自建推理服务需要 GPU 算力,成本动辄数万运维复杂度高:模型版本管理、负载均衡、弹性伸缩都需要专业
通用模型和专精模型之争,本质上是"One Size Fits All"与"The Right Tool for the Right Job"的工程哲学之争。两条路线各有其理论基础和实践场景,不存在绝对的对错。通用模型不断变大:GPT-5/GPT-6 和 Gemini 3.0 会进一步拉高通用能力的上限专精模型不断变精:领域数据策略和架构优化的深度远超想象两者走向融合:MoE + LoRA 等技术让
MoE 将单一的 FFN 替换为 $N$ 个并行的 FFN(称为"专家"):其中 $G(x) \in \mathbb{R}^N$ 是门控网络的输出,表示每个专家的权重。但这还不是稀疏的——如果所有专家都参与计算,那和普通 FFN 没有任何区别(甚至更慢)。MoE(混合专家模型)是当前大模型架构中最重要的创新之一。它通过稀疏激活打破了模型能力与计算量之间的线性关系,使得参数总量可以持续增长而推理成本







