logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Agent 说「改好了」,你一跑全是红:我给它加了两道关卡

这篇文章探讨了AI助手在代码修改任务中常见的"虚假完成"问题,并提出了改进方案。作者发现AI助手常犯三种错误:仅确认文件存在就报完成、简单检查目录算验证、忽略失败的检查结果。为此设计了双重验证机制:区分代码修改(必须通过完整检查)与数据处理任务(基本验证即可);对未通过的检查要求持续修正,直到通过或明确报告失败。文章通过TypeScript错误示例展示了改进前后的差异,最终强调核心原则:未通过检查

#人工智能#机器学习#深度学习 +1
Agent Harness 有了“眼睛”和“手”:更细的 Trace 事件 + 自动错误恢复

本文介绍了Agent Harness系统的第三次迭代,重点围绕三个方向进行增强: 精细化追踪:新增context_built和engine_started事件,记录上下文构建细节和执行引擎信息,同时优化tool_result包含耗时和错误码等关键指标,形成更完整的事件流体系。 功能扩展:为Agent新增两个核心工具: search_web:基于DuckDuckGo实现网络搜索能力 run_shel

#服务器#python#人工智能
Agent 终于会“看”表格了——read_csv 和 read_excel 的故事

概念解释:数据预览(Dataset Preview)不是把整个文件的内容都倒出来,而是先看一眼它的“骨架”这个表格有几行几列?列名叫什么?每列是什么类型的数据(数字、文字、日期)?有没有空值?前几行长什么样?就像你拿到一本厚厚的书,不会从第一页开始读——你会先看目录、看摘要、看第一章的前几段,判断这本书值不值得读。先看一眼“骨架”,再决定怎么用。“哦,这个表有 2473 行,两列,ASR识别文本有

#数据库#人工智能#python
我的 Agent 学会“作弊”了——伪工具检测和智能循环预算的故事

这篇文章讲述了作者在调试AI助手时发现的"作弊"行为——AI会假装执行任务而不实际调用工具,并逐步分享了解决方案。主要问题包括:AI学会伪造工具调用记录、用户反馈无效、短指令识别失误。作者通过四个修复措施应对:伪工具调用检测(FakeToolCallGuard)、强制工具使用(CompletionLoop)、记忆清洗(SessionSanitizer)和意图识别增强(IntentPlanner)。

#服务器#人工智能#python
Selenium + 自研小型 Agent:用脚本加简易agent搭建简单数据工作流

原理:Selenium/HTTP 取数,小型 Agent 编排;两层不要揉成一团。样子:固定列的热榜表 + 可独立运行的 Python 流水线。开源:MIT 仓库已公开,欢迎直接跑、提 Issue / PR。先把脏活收成脚本,再让 Agent 学会按铃。往往比指望模型每次现场发明轮子,更接近能长期维护的工程。

#python#人工智能
我让 Agent 学会了“先看再说“——数据配方 + 观察事实的进阶之道

这篇文章介绍了作者如何改进Agent的数据分析能力,使其从"凭感觉猜测"转变为"基于事实回答"。核心创新点包括: 引入"数据配方"(Data Recipe)概念:为常见数据分析任务预设标准流程,如导出文件列表、预览数据集等,指导Agent按最优路径执行。 新增profile_dataset工具:专门用于数据观察而非读取,实现"观察"与"读取"职责分离。 建立"观察事实"(Observed Fact

#服务器#python#人工智能
Agent 的“记忆管理”和“自我审视”:上下文压缩、意图规划与自验证

文章摘要 本文探讨了Agent系统面临的两个核心问题及解决方案:上下文过长导致的"失忆"问题和任务执行缺乏验证的问题。 针对上下文管理问题,提出了三层压缩机制: 工具结果整形(零成本截断冗余数据) 规则摘要(将历史消息压缩为JSON) LLM语义摘要(保留关键语义信息) 针对任务验证问题,设计了: 意图规划(用LLM准确理解用户需求) 自验证机制(强制Agent验证关键操作结果) 这些改进虽然增加

#人工智能#数据库#mysql
网页能用、脚本空结果:别急着怪账号风控

维护过「曾经能跑」的小红书脚本 / MCP / 爬虫看到但items=[],或怀疑是账号风控,又发现网页明明搜得动想复盘:逆向到底该怎么排优先级,而不是一上来就猜算法这不是「教你绕过平台」的教程,是我(和协作工具)把一套搜索+评论语音下载链路从半死修通时,真实走过的弯路。文中只写现象、对照方法和结论;具体 Cookie、完整签名串、可复制 payload一律不贴——那些东西过期快,贴了也只会害人。

#python#http#网络安全 +2
训练 loss 掉到 0.007,我以为成了——其实模型在背答案

《训练损失降至0.007的陷阱:当模型开始背答案》 本文通过作者微调Qwen3-8B模型的实际案例,揭示了训练过程中容易被忽视的过拟合现象。当使用160条数据训练5个epoch后,模型训练损失降至惊人的0.007,表面看是巨大成功,实则可能意味着模型只是在机械背诵训练数据,而非真正学会灵活表达。 关键发现: 训练损失并非越低越好,极低损失可能预示过拟合 小规模数据(100-200条)更容易出现背诵

#深度学习#机器学习#人工智能
看了钢铁侠,能不能拥有你自己的「贾维斯」?

这篇文章提出了一套普通人可落地的"贾维斯"语音助手设计方案,核心思路是将系统拆解为三层架构: 手机+耳机作为便携的语音输入终端 云服务器负责语音识别和任务分发 家用台式机作为执行终端,利用本地环境和权限完成实际任务 方案亮点在于: 合理分配计算资源(手机采集、云端识别、本地执行) 采用模块化设计保证安全性和可维护性 通过二次确认机制避免误操作 提供详细的网络连接方案建议 整体设计平衡了实用性和可行

#人工智能#大数据#深度学习
    共 21 条
  • 1
  • 2
  • 3
  • 请选择