logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

多模态 AI 聚合网关的能力注册与动态路由机制:从数百个异构后端到统一调用层

上周接手了一个 AI 工具导航平台的后端重构任务。这个平台聚合了国内外 300+ 个 AI 服务——从文本生成、图像编辑到音频转录和 PPT 制作,每个后端的 API 协议、认证方式、响应格式各不相同。团队 6 人,技术栈是 Spring Boot 3.4.5 + PostgreSQL 16.4 + Redis 7.2.5。原来的方案是硬编码路由表,每接入一个新服务就要改代码重新部署,上线频率从每

文章图片
10亿级会话状态的存储悖论:OpenAI 向量索引的分片策略与内存换取代价解析

ChatGPT 用户的会话记录并非简单地堆在关系型数据库里。对于服务量级突破10亿的在线交互系统,传统的 B-+ 树索引在高频随机读写场景下的 I/O 延迟已接近物理介质极限。OpenAI 近期披露的存储架构演进,核心在于解决“热数据驻留”与“冷数据归档”之间的动态平衡问题。这里要讨论的不是如何搭建一个普通的对象存储,而是如何通过底层数据结构优化,让向量检索(Vector Retrieval)在百

文章图片
Spring Boot 3.4 集成阿里云 PAI-EAS 出现连接池耗尽问题的排查与修复

对接阿里云 PAI-EAS 这类 AI 推理服务时,不能简单套用 Web 服务的 HTTP 配置。模型推理的耗时特性要求客户端具备更稳健的连接管理能力。显式配置连接池、启用空闲连接回收、确保 HttpClient 单例化,是避免生产环境连接池耗尽的三道防线。默认配置往往是为了通用场景设计的,在高并发垂直场景下,必须根据实际业务指标进行调优。#后端 #Java #SpringBoot #阿里云 #H

文章图片
文心一言 5.0 Preview 接入实战:Spring Boot 网关层如何处理多模态流式响...

方案一:原生 HTTP 客户端直连(Baseline)基于 OkHttp 4.12.0 / JDK 21 HttpClient 手工拼装请求头、解析 SSE 事件流。适用于快速验证 Demo,无额外依赖。核心痛点:多模态分块边界识别全靠正则,熔断降级需自写包装器。方案二:Spring AI 1.0.0-M4 抽象层适配(Standard)引入(社区维护版)或自实现ChatModel接口。利用Flu

文章图片
背景:从“问答”到“行动”的架构断裂

Agentic AI 的落地,难点往往不在模型本身,而在后端工程如何适配这种“长时程、状态依赖”的交互模式。Qwen3.8-Max 的规划能力是强大的,但如果没有一个稳固的后端状态机来锚定执行过程,这种能力就会因为环境噪声而衰减。对于 Java 后端开发者而言,理解“幂等性”、“状态回执”、“原子参数”这些概念在 AI 工具调用中的具体映射,比单纯调优 Prompt 更有价值。不要试图让 LLM

文章图片
华为 MatePad Air 2026 端侧模型推理:ONNX Runtime 与 TFLit...

ONNX Runtime 是微软推出的跨平台推理引擎,通过动态图转静态图优化,对 ARMv8-A 架构支持良好。在 HarmonyOS 开发环境中,它通常以 NDK 库形式集成。其核心优势在于 EP(Execution Provider)机制,能自动探测并调用 NPU 或 GPU 的算子库,但配置复杂度较高,需要手动指定中的线程数与内存分配器。TFLite 是 Google 专为移动设备设计的轻量

文章图片
prompts.chat API 版本迁移:从 Awesome ChatGPT Prompts...

上周有个需求,要把公司内部的 AI 提示词管理平台从「手动维护 JSON 文件 + 前端静态渲染」的模式,切换到对接 prompts.chat 的官方 API。这个项目之前用的是 Awesome ChatGPT Prompts 的原始数据格式——本质上就是一堆 Markdown 文件加一个静态 JSON 索引,部署在 GitHub Pages 上。现在要迁移到 prompts.chat 的 RES

文章图片
我把大模型API月账单从5000砍到800的踩坑实录

上个月帮一个做跨境电商的朋友看了他们的大模型API账单,真吓人——五月底的时候月消费已经飙到5000多块,但他们的业务量跟年初比也就翻了一倍不到。他们主要用大模型干两件事:批量生成商品listing描述,以及一个半自动的客服机器人。我当时翻了下他们的调用日志,好家伙,一个月两三百万次API调用,其中将近40%是重复的或者几乎重复的请求。朋友说"你先帮我把成本压下来,下个月业务要上一个新站点,再涨就

文章图片
EHR 数据接入 ChatGPT Enterprise 的脱敏管道延迟剖析:P99 从 2.3...

上周压测了一轮某三甲医院 EHR 系统接入 ChatGPT Enterprise 的完整调用链路。场景很具体:医生在问诊台发起一次"患者近三月检查摘要"请求,后端需要从 FHIR R4 仓库拉取 Patient、Observation、DiagnosticReport 三类资源,做 PHI 脱敏,拼成 Prompt 发给 OpenAI 推理端点,再把结果写回病历系统。整条链路跑下来 P99 卡在

文章图片
EHR 数据管道性能实录:FHIR R4 序列化瓶颈与 ChatGPT 接入的 4.2x 吞吐量优化

上周有个需求:把院内三套 EHR 系统(Epic Beaker、Cerner Millennium、Meditech Expanse)的病历数据接入 ChatGPT API,做临床决策支持。团队 8 人,后端用 Spring Boot 3.4.5 + JDK 17.0.12,FHIR 解析用 HAPI FHIR R4 库(版本 6.10.1)。问题出在数据管道层——不是 LLM 调用慢,是喂给 L

文章图片
    共 260 条
  • 1
  • 2
  • 3
  • 26
  • 请选择