logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

asyncio 连接池:池子越大,不代表系统越快

asyncio 连接池是背压阀门,不是越大越好。获取连接要受 deadline 控制,池子大小要按下游能力反推,并持续监控等待时间、借出数量和泄漏。异步服务的稳定性,不靠无限 await,而靠每个等待点都知道什么时候该放弃。

#人工智能
记一次微服务雪崩:全因 RPC 未配超时,打爆了 50 个微服务节点

上月一个周五下午,生产环境经历了一场惊心动魄的级联雪崩。起因仅仅是 DB 机器出现了一次持续 10 秒的磁盘 IO 抖动,导致“订单查询”服务的响应变慢。但可怕的是,这一小块局部抖动迅速像癌细胞一样沿着 RPC 调用链扩散:用户服务死等订单服务,网关死等用户服务,最终整个微服务集群的 50 多个节点全线抛出504,前端页面一片狼籍。运维团队大盘报警频发,P99 延迟直线飙升到数秒以上。大量等待连接

#人工智能
大模型应用开发:Prompt Engineering 从经验法则到工程化实践

Prompt Engineering 的工程化实践,核心价值在于将"经验驱动的调参"升级为"设计-测试-迭代的工程流程",让大模型应用的输出稳定可预期。结构化模板:系统指令、Few-Shot 示例、输出格式约束分离组装,而非一整段文本格式强制:通过 JSON Schema 约束输出结构,解析器做格式校验,不合法则重试边界覆盖:Few-Shot 示例必须包含边界情况(空值、模糊输入、冲突信息),而非

文章图片
#人工智能
AI 任务调度引擎:大模型推理资源的智能分配与弹性伸缩

AI 任务调度引擎的核心目标是平衡延迟 SLA 与 GPU 资源利用率。三大核心机制——优先级调度防饿死、资源感知路由降成本、弹性伸缩提效率——各有适用场景和代价。冷启动延迟是弹性伸缩的最大制约,维持最小实例池是务实的妥协方案。请求复杂度预估的不确定性、多租户隔离的矛盾、以及系统复杂度的边际收益递减,都是设计调度引擎时必须面对的现实约束。调度引擎只在请求量大、模型多样、SLA 分级明确的场景下才有

#人工智能
GPU 资源争夺战:大模型推理调度实战指南

大模型推理调度需要在延迟、吞吐和公平性之间找到平衡点。优先级队列保证高价值请求优先执行,动态批处理提升 GPU 利用率,老化机制防止低优先级请求饥饿。三者协同,才能在有限的 GPU 资源下实现最优的推理服务体验。从 FIFO 开始:先用简单的先进先出队列上线,收集请求延迟分布和 GPU 利用率数据引入优先级:根据业务需求定义 2-3 个优先级级别,逐步替换 FIFO开启动态批处理:在 GPU 利用

#人工智能
Agent 服务化架构:将 Agent 封装为微服务的接口设计与性能考量

Agent 服务化不是简单地给代码包一层 FastAPI。接口设计:SSE 流式推送进度和结果并发控制:信号量限制同时执行的 Agent 数量超时管理:分层超时,子步骤独立设时限断线处理:session 持久化,支持断线续传可观测性:健康检查 + 就绪探针 + 事件日志Agent 从 Notebook 走向生产环境,接口设计和性能考量是第一关。过了这一关,你的 Agent 就不再是"实验室里的玩具

#人工智能
检索精度 vs 成本权衡:什么时候用大模型重排、什么时候用轻量模型

检索精度和成本的权衡,实质上是按查询复杂度做分级服务。简单查询用廉价方法,复杂查询才花钱做深度重排。判断复杂度的关键是词数、分数分布和历史收益三个维度。落地时注意:预算控制设硬上限,超支自动降级;每个重排方法都有 fallback,失败时不影响基本检索;高风险领域跳过蒸馏模型,直接用大模型两阶梯。

#人工智能
Python 部署优化:使用 Docker 多阶段构建缩小 RAG 服务镜像体积

冷启动:从 3 分钟降到 12 秒,K8s 滚动更新几乎无感知。镜像分发:1.8GB → 380MB,跨 Region 分发时间从 40 秒降到 8 秒。磁盘占用:节点磁盘使用率从 90% 降到 35%,不再触发驱逐。安全攻击面:移除 gcc、cmake 等编译工具后,CVE 数量减少 40%。多阶段构建:编译和运行分离。:排除所有不需要上镜像的文件。依赖最小化:embedding 模型走 API

#人工智能
智能投顾 Agent:RAG 如何让大模型读懂财报、研报和行情数据

RAG 做智能投顾的关键不是检索技术本身有多高级,而是让模型只说它从数据里读到的东西,不编造它不知道的东西。三层设计:表格解析保证结构化数据的准确性、交叉验证暴露数据源之间的差异不给用户虚假一致性、意图路由让精确查询和语义分析各走各路。金融场景没有什么"差不多"的空间,数字对错了,用户信任就没有了——而信任是投顾产品的唯一资产。

#人工智能
《大模型开发 Prompt Engineering 线上高并发排障实战》

通过对大模型应用开发与 Prompt Engineering的深度治理,消除了高并发下的稳定性隐患,为后续业务扩张打下了稳固防线。

#人工智能
    共 244 条
  • 1
  • 2
  • 3
  • 25
  • 请选择