logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

微服务灰度发布终极指南:Spring Cloud 全链路流量染色实践

灰度发布是一种通过小范围验证实现平滑过渡的发布策略,能够有效降低新版本上线风险。文章详细介绍了基于Spring Cloud Gateway和Nacos的灰度发布实现方案:1. 通过Nacos元数据标记服务版本;2. 在网关层使用全局过滤器为请求打上灰度标记;3. 通过Feign拦截器实现标记的全链路传递;4. 自定义Ribbon负载均衡规则实现基于标记的服务路由。该方案还支持通过Nacos配置中心

#微服务#spring cloud#架构
当 Git 合并遇到海量冲突:有没有“一键解决”的魔法?

本文探讨了如何利用 Git 的 rerere(Reuse Recorded Resolution)功能实现"一键解决"合并冲突。当遇到大量冲突时,rerere 可以记录并自动重用之前的手动解决方案。文章详细介绍了 rerere 的启用方法、工作原理,并提出了结合 -X theirs 合并策略实现"一键合并"的高级技巧。同时也指出了这种方法的局限性,强调它更适

#git#elasticsearch#大数据
Spring Boot 3 + Ollama本地大模型推理,接口响应5秒以上,延迟怎么降到500ms以内?

摘要: Spring Boot 3接入Ollama本地大模型时,5秒以上的接口延迟主要源于同步等待完整响应。优化方案包括: 硬件层:启用GPU加速、Flash Attention和模型量化(如q4_0),显著提升计算效率; 通信层:改用流式响应(stream:true),配合WebFlux实现实时token推送,首字延迟可降至200-500ms; 软件层:通过keep_alive保持模型加载、连接

#spring boot
当算力不再是瓶颈:重新审视 FlashAttention 的 IO 墙与算法极限

本文深入探讨了FlashAttention在长序列Transformer训练中的性能优化问题,指出算力提升并不能完全解决内存带宽瓶颈("内存墙")。文章通过数学建模和工程实践分析,揭示了FlashAttention通过分块平铺和重计算策略,将HBM访问次数从O(N²)降至O(N³/d)的关键技术。重点讨论了三个核心问题:1)非对称块大小的数学证明,展示了SRAM容量约束下的最优解;2)反向传播中重

#算法
AI Agent 的安全困境:从古代城门到 Prompt 越狱

摘要: AI Agent的安全隐患日益凸显,恶意Prompt攻击可诱导高权限工具执行危险操作。借鉴古城门防御的启示,文章提出三层防护体系:1)语义防火墙通过情感熵值识别诱导性指令;2)行为沙箱延迟执行并隔离操作;3)量子观测利用隐形字符触发Agent的自我监控。结合代码配置与权威研究,强调AI需具备“怀疑能力”,未来或需硬件级道德约束。技术演进正将科幻变为现实,但防御需随攻击手段同步升级。

#人工智能#安全
FastAPI + litellm 统一代理大模型 API:优雅实现成本监控与 Fallback 策略

本文介绍了如何使用FastAPI和litellm构建统一的大模型API代理服务。该方案通过中间层屏蔽底层差异,提供统一接口、故障转移和成本监控功能。核心实现包括:1) 定义标准请求/响应模型;2) 实现带fallback的模型调用逻辑;3) 记录token用量和成本;4) 提供成本统计接口。文章还提出了依赖注入、动态价格表和异步调用等优化建议,帮助开发者优雅地管理多模型API调用,提高系统可靠性和

#fastapi#java#人工智能
当 Git 合并遇到海量冲突:有没有“一键解决”的魔法?

本文探讨了如何利用 Git 的 rerere(Reuse Recorded Resolution)功能实现"一键解决"合并冲突。当遇到大量冲突时,rerere 可以记录并自动重用之前的手动解决方案。文章详细介绍了 rerere 的启用方法、工作原理,并提出了结合 -X theirs 合并策略实现"一键合并"的高级技巧。同时也指出了这种方法的局限性,强调它更适

#git#elasticsearch#大数据
FastAPI + litellm 统一代理大模型 API:优雅实现成本监控与 Fallback 策略

本文介绍了如何使用FastAPI和litellm构建统一的大模型API代理服务。该方案通过中间层屏蔽底层差异,提供统一接口、故障转移和成本监控功能。核心实现包括:1) 定义标准请求/响应模型;2) 实现带fallback的模型调用逻辑;3) 记录token用量和成本;4) 提供成本统计接口。文章还提出了依赖注入、动态价格表和异步调用等优化建议,帮助开发者优雅地管理多模型API调用,提高系统可靠性和

#fastapi#java#人工智能
AI Agent 的安全困境:从古代城门到 Prompt 越狱

摘要: AI Agent的安全隐患日益凸显,恶意Prompt攻击可诱导高权限工具执行危险操作。借鉴古城门防御的启示,文章提出三层防护体系:1)语义防火墙通过情感熵值识别诱导性指令;2)行为沙箱延迟执行并隔离操作;3)量子观测利用隐形字符触发Agent的自我监控。结合代码配置与权威研究,强调AI需具备“怀疑能力”,未来或需硬件级道德约束。技术演进正将科幻变为现实,但防御需随攻击手段同步升级。

#人工智能#安全
Spring Boot 3 + Ollama本地大模型推理,接口响应5秒以上,延迟怎么降到500ms以内?

摘要: Spring Boot 3接入Ollama本地大模型时,5秒以上的接口延迟主要源于同步等待完整响应。优化方案包括: 硬件层:启用GPU加速、Flash Attention和模型量化(如q4_0),显著提升计算效率; 通信层:改用流式响应(stream:true),配合WebFlux实现实时token推送,首字延迟可降至200-500ms; 软件层:通过keep_alive保持模型加载、连接

#spring boot
    共 11 条
  • 1
  • 2
  • 请选择