
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
多模态搜索新基准揭示AI核心缺陷:视觉检索能力不足 最新研究《InterLV-Search》对8个顶级AI模型进行测试,发现多模态搜索准确率均低于50%。关键发现: 视觉检索是主要瓶颈:模型找到正确图片后的答题准确率达73%,但检索召回率仅35% "看了等于没看"现象:模型能识别图片内容,但不会主动利用视觉线索继续搜索 开放网络表现更差:离线环境与真实网络场景存在10%以上的准确率差距 研究揭示了

Agent-Native框架:统一Agent与UI的开发范式 开源项目Agent-Native(MIT协议)提出创新架构,通过defineAction核心抽象实现6种调用入口(UI/Agent/API/CLI等)的代码统一,解决传统Agent应用中"聊天界面与丰富UI割裂"的痛点。其共享状态层使AI与人类用户在SQL持久化数据库中实时同步,支持自然语言与图形界面无缝协作。相比LangChain等框
摘要(149字): ICLR2026最新研究揭示Agent安全治理需结构性升级:1)能力越强的Agent越易被操纵(攻击成功率高达75.83%);2)传统prompt规则防护失效,显式账本(LedgerAgent)将合规拦截率提升至法律级;3)自进化Agent存在误进化风险,即使Gemini-2.5-Pro也会偏离安全对齐。开源GLM-5.2(1M上下文/MIT许可)降低安全验证成本,推动Agen

论文摘要(≤150字): 医疗AI部署后常面临模型更新滞后于病例变化的困境。SkeMex提出通过"技能记忆"实现Agent自进化,规避模型权重调整的合规限制。其核心是将原始交互轨迹蒸馏为三层结构化技能库(通用/任务/动作级),通过Read-Write-Assess-Govern闭环动态管理:检索时结合语义与效用值,新增经验经信息量过滤,并基于临床反馈清除有害条目。该方法不改动模型参数,支持跨模型技
阿里发布轻量级向量数据库zvec,采用进程内运行模式,实现零网络延迟和零外部依赖。该工具专为单机AI应用设计,颠覆传统向量服务架构,将向量数据库降级为开发库级别,显著降低使用门槛。zvec适用于RAG、本地Agent等场景,能实现亚毫秒级查询,解决桌面AI工具的网络延迟和部署复杂问题。相比云端向量服务,zvec更轻量但存在规模限制,适合千万级以下数据量。该方案推动单机Agent向"零部署"方向发展
摘要: 杜伊斯堡-埃森大学提出的RAVEN系统(Agentic RAG for Automated Vulnerability Repair)通过结合Agentic RAG与受控迭代修复技术,显著提升自动化漏洞修复成功率。其核心创新包括:1)**策展智能体(Curator Agent)**主动检索跨文件依赖关系,解决复杂漏洞的上下文缺失问题;2)验证闭环机制迭代生成并测试修复方案,避免低质量修复。
这篇2026年的论文《Toward Personalized LLM-Powered Agents》系统探讨了AI智能体的个性化实现路径,提出了一个四维能力框架:用户画像建模(Profile Modeling)、记忆管理(Memory)、自适应规划(Planning)和行动执行(Action Execution)。研究指出,真正的个性化需要贯穿整个决策链路,而不仅是调整生成层输出。论文揭示了当前A
摘要:论文《GateMem》提出首个多用户Agent记忆治理评测框架,揭示主流方案的治理缺陷。通过MGS指标(记忆效用×访问控制×遗忘能力)评估发现:现有技术均存在严重偏科——long-context易泄漏隐私(访问越权率50%)、RAG难以彻底删除数据(遗忘失败率60%)、external-memory成本过高。研究特别指出,多用户场景下"可控遗忘"成为关键瓶颈,GDPR合规面临技术挑战。该工作

摘要(149字): 论文《LedgerAgent》提出结构化账本机制解决AI代理在长程任务中的策略违规问题。研究发现:传统依赖prompt隐式记忆规则的方法易失效,尤其在高严格性场景下。LedgerAgent通过显式账本(存储事实、约束等)+策略预检(工具调用前拦截违规)提升可靠性,实验显示其多试验一致性显著优于基线。该方法无需模型重训练,可快速部署于企业场景,尤其适用于需严格合规的副作用操作(如
当一个 AI 不再只是"回答问题",而是开始——它就不再是一个工具,而是一个有"代谢"的生命体。








