
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
搜索 "retrieval augmented generation" 的 4 篇最新论文,对比它们的摘要,然后用中文总结该方向的研究热点。理解问题↓调用 arxiv_search↓获取多篇论文↓读取论文信息↓对比摘要↓归纳研究热点↓生成中文结论也就是说,这个插件不只是给 Harness 多塞了一个 API。它相当于给 Agent增加了一种新的外部能力。最后,Harness 根据检索到的论文进行了

Claude加入文本水印,当然不是作秀。它背后的密码学和统计学基础都是真实存在的。和那些依赖“AI味”“句式太工整”“困惑度太低”来猜测作者身份的工具相比,嵌入式水印确实是更靠谱的一条路线。但“原理可靠”和“现实里永远可靠”,是两件完全不同的事。长文本、改动较少、候选词丰富时,水印可能表现得很好;到了短文案、代码、专有名词、翻译、跨模型改写和多人混合创作场景,信号就会迅速变弱。更关键的是:检测到C

Claude加入文本水印,当然不是作秀。它背后的密码学和统计学基础都是真实存在的。和那些依赖“AI味”“句式太工整”“困惑度太低”来猜测作者身份的工具相比,嵌入式水印确实是更靠谱的一条路线。但“原理可靠”和“现实里永远可靠”,是两件完全不同的事。长文本、改动较少、候选词丰富时,水印可能表现得很好;到了短文案、代码、专有名词、翻译、跨模型改写和多人混合创作场景,信号就会迅速变弱。更关键的是:检测到C

Claude加入文本水印,当然不是作秀。它背后的密码学和统计学基础都是真实存在的。和那些依赖“AI味”“句式太工整”“困惑度太低”来猜测作者身份的工具相比,嵌入式水印确实是更靠谱的一条路线。但“原理可靠”和“现实里永远可靠”,是两件完全不同的事。长文本、改动较少、候选词丰富时,水印可能表现得很好;到了短文案、代码、专有名词、翻译、跨模型改写和多人混合创作场景,信号就会迅速变弱。更关键的是:检测到C

前面的机制看着不少,但真到日常使用里,优先关注下面四项就够了。它们大致按照可能造成的成本从高到低排列。第一,长会话。每一轮都会重新带上之前的全部内容,所以一段会话消耗的大头,往往不是刚输入的那句话,而是前面累积的历史。任务换了,及时/clear;同一任务进入新阶段,再考虑/compact。第二,上下文太臃肿。Claude 读了但其实不需要的文件、噪声很大的命令输出、早已完成的旧任务、当前根本用不到

前面的机制看着不少,但真到日常使用里,优先关注下面四项就够了。它们大致按照可能造成的成本从高到低排列。第一,长会话。每一轮都会重新带上之前的全部内容,所以一段会话消耗的大头,往往不是刚输入的那句话,而是前面累积的历史。任务换了,及时/clear;同一任务进入新阶段,再考虑/compact。第二,上下文太臃肿。Claude 读了但其实不需要的文件、噪声很大的命令输出、早已完成的旧任务、当前根本用不到

前面的机制看着不少,但真到日常使用里,优先关注下面四项就够了。它们大致按照可能造成的成本从高到低排列。第一,长会话。每一轮都会重新带上之前的全部内容,所以一段会话消耗的大头,往往不是刚输入的那句话,而是前面累积的历史。任务换了,及时/clear;同一任务进入新阶段,再考虑/compact。第二,上下文太臃肿。Claude 读了但其实不需要的文件、噪声很大的命令输出、早已完成的旧任务、当前根本用不到

论文沿用了 STaRK 的设定。一个知识库包含一堆文本文档DD和一张知识图谱GVRGVR。其中每个实体iii对应一篇描述它的文档di∈Ddi∈D,以及图谱上的一个节点vi∈Vvi∈V,而RR则是节点之间的各种关系集合。放到精准医疗的语境里就很好懂了:某个基因或疾病的文档did_idi写的是它的文字描述,而图谱节点viv_ivi编码的是它和别人的关系,比如"副作用"“父子类别”"表现出某种症

一年前,Agent 几乎还是个稀罕物。现在它们已经无处不在了:银行、工程、医疗……哪儿都有。有段时间,Ben Hylak(本文作者)很讨厌"Agent"这个词——凭什么一个 LLM 调用就要另起炉灶、取个新名字?但很快他就看明白了,这个新词确实有必要存在。Agent 是一种实体,几乎带着某种自我意识,在它自己的环境里穿梭。它使用手头的工具,找到那些创造它的人根本想象不到的解法。有时候这些解法很有用

LLM Agent 的核心循环本身很简单,但让它在生产环境里真正跑起来,每个环节都有讲究。上下文工程是最核心的设计空间;虚假完成是最常见的生产问题;记忆机制让 Agent 真正拥有了跨任务的连续性。整个领域还非常早期——作者用的比喻是"通信技术的 1950 年代"。从真实问题出发去做工程,而不是从 benchmark 出发去刷分——这句话值得反复想想。







