logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Python实战:手写LLM API成本优化工具,语义缓存+智能路由+Prompt压缩,每月省30-50%

LLM API花费太高?本文介绍如何用Python打造一个LLM成本优化器,通过四大手段自动降低API费用:语义缓存(相似问题直接返回缓存结果,省100%)、智能路由(简单任务走便宜模型,省50-80%)、Prompt压缩(去除系统提示词废话,省30%)和预算管控(超限自动降级)。客户端代码一行不用改,只改base_url即可接入。附完整代码和配置示例。

#python#缓存#后端
AIAgent长期任务执行技术全解析

Agent从分钟级任务到小时级任务的核心挑战是上下文管理和状态持久化。任务分解推荐粒度:每子任务3-10分钟,输入输出有清晰接口约定。依赖图解析让并行子任务缩短整体时间。上下文隔离确保子Agent只接收本任务所需信息。检查点按子任务完成保存,序列化需压缩中间结果。错误恢复需多阶段重试:前2次简单重试,第3次压缩上下文,第4次降级或标记人工介入。三个验证层次:语法→功能→逻辑,语法检查可完全自动化,

#人工智能
MiMo-Code开源16天11K星:小米AI编码Agent的持久记忆和自进化机制

MiMo-Code是小米开源的终端AI编程Agent,16天11K星。核心差异化是持久记忆系统和自进化机制。持久记忆跨会话存储项目结构、架构决策、用户偏好和问题修复记录,存储在 .mimo/memory/ 目录中。新会话自动加载记忆,不需要重新分析项目、重新解释偏好、重复讨论已决策的问题。效果在使用5-10次后开始明显。自进化机制在每次会话结束后异步分析交互数据——观察用户对生成代码的修改模式(双

#开源#人工智能
我花了一周时间部署odysseus,对比ChatGPT/Claude的结果如下

odysseus 26天78K星,自托管AI工作空间最火项目。我花一周实际部署,对比ChatGPT/Claude/Copilot的结果:部署耗时约3小时,混合模式月费$8-12(原SaaS订阅$70+)。功能覆盖度方面,聊天和Agent功能基本覆盖SaaS方案,额外提供邮件/笔记/日历集成、本地全文搜索、多模型切换、自定义Agent定时任务。差距在于聊天流畅度、移动端缺失、文档协作功能有限。适合有

#人工智能
Python实战:手写一个LLM API统一网关,实现DeepSeek/通义千问/OpenAI多Provider自动容灾切换

在生产环境中使用大模型API,最怕Provider挂了导致服务中断。本文介绍如何用Python手写一个LLM Gateway——在应用和LLM Provider之间加一层统一网关,支持DeepSeek、通义千问、OpenAI等多Provider自动容灾切换,内置3种路由策略(优先级/轮询/最低延迟)、SQLite用量统计和成本计算。客户端代码一行不用改,只改base_url即可接入。

#后端#python
Python实战:一条命令评测多个大模型(DeepSeek/通义千问/GPT-4o),自动生成对比报告

选大模型还在靠感觉?本文介绍如何用Python打造一个LLM评测工具,一条命令批量测试DeepSeek、通义千问、GPT-4o等多个模型,支持精确匹配、语义相似度、LLM裁判三种评分方式,内置中文测试集,自动生成Markdown对比报告。附完整代码和测试数据,帮你用数据选出最适合业务场景的模型。(148字)

#人工智能#深度学习#后端 +1
Claude Code Skills 全解析:1500+ Agent技能库汇总

AI编程助手的竞争已从"谁更聪明"转向"谁更懂你"。Claude Code Skills 让你可以把编程习惯、项目规范、最佳实践"教"给AI,打造真正属于你的编程搭档。本文深度解析 Skills 机制,并汇总 1500+ 社区技能库。

#人工智能
100万token真的能用吗?GLM-5.2和Gemini长上下文的实测分析

厂商宣称的"支持100万token"和实际可用的"可靠长度"是两回事。核心问题在位置偏差:Lost in the Middle研究显示,64K上下文中中间位置信息召回率仅38%,而开头位置85%。这个规律在更长上下文中仍然存在。GLM-5.2的IndexShare优化了计算效率(FLOPs减少2.9倍),使1M token推理可行,但没有解决位置编码本身的局限。RoPE对长距离位置关系的区分度随距

#RAG#人工智能
DeepSeek开源DeepSpec,大模型推理加速新突破

DeepSpec是DeepSeek在6月26日开源的推测解码框架,发布当天6.2K星标。核心价值:统一了推测解码的训练和评估流程,让不同算法可以在相同条件下公平对比。三阶段流程:数据准备(target cache约38TB存储)→ 训练(8GPU,支持三种算法)→ 评估(9个基准数据集,核心指标为接受率)。三种算法:Eagle3(独立Transformer)、DFlash(粗粒度表示+映射层)、D

#人工智能
AI编程Agent效率大比拼:谁更快更好更省?

AI编程Agent评测需要量化指标而非主观体验。本文提出四维框架:效率、质量、成本、体验。实测数据:Claude Code首次正确率78%(最高),纠错次数0.28次/任务(最少),单文件重构快20-40%,在200+文件项目中上下文衰减最慢(5倍)。Codex CLI在错误修复速度上领先(平均纠错5.8分钟),平衡性最好。Kimi Code API成本最低(约Claude Code一半),但首次

#人工智能
    共 28 条
  • 1
  • 2
  • 3
  • 请选择