logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

RAGEN-2 论文精读:多轮 Agent RL 中的“模板坍缩”——熵看不见的失败模式、互信息诊断与 SNR 机理

本研究揭示了强化学习(RL)中一种被现有指标系统性忽略的失败模式——“模板坍缩”(template collapse),即模型在单个输入内保持推理多样性但跨输入维度上变得与输入无关。论文提出三个核心贡献:(1) 定义模板坍缩并提出无需外部模型的互信息代理指标进行检测;(2) 从信号噪声比(SNR)角度解释坍缩成因,指出低reward方差会削弱任务梯度,使更新被输入无关的正则项主导;(3) 提出SN

文章图片
#人工智能#机器学习
当所有人都在卷“怎么干活”,他们去卷“给Agent喂什么知识”——Agents-K1论文精读

本文解读的该研究提出了一种新型的科学知识编排框架Agents-K1,旨在解决当前研究型AI智能体在知识组织方面的核心痛点。论文的创新点主要体现在三个方面: 结构化知识图谱构建、多模态语义对齐、离线/在线解耦架构。该框架为研究型Agent提供了可验证、可追溯的知识基础设施,其设计理念对于构建专业领域的知识增强型AI系统具有普遍参考价值。

文章图片
#人工智能
龙虾派(CEPi)完整解析:获树莓派官方授权、预装 Hermes Agent 的本地智能小主机

端脑科技发布三款本地智能产品:龙虾派(CEPi)是获树莓派官方授权的本地智能小主机,预装Hermes Agent框架,开箱即用;脑花 LUCY AINPC是搭载Lucy AI OS的智能中枢,提供外接大脑能力;脑花APP是移动调度入口。三者构成云边端协同体系,支持自然语言检索、录音整理、文件同步等场景,强调数据本地化与安全机制。龙虾派硬件基于树莓派,4GB内存,支持扩展存储,通过端脑云调用主流大模

文章图片
读透 Kimi K3:当架构选择开始为 Tensor Core 让路

Kimi K3 是首个开源 3T 级模型:2.8T 总参数、104B 激活、1M 上下文、原生视觉。本文从"算法-系统协同设计"的视角精读这份技术报告——KDA 的下界衰减如何为 Tensor Core 让路、注意力残差如何把 Transformer 那一招用到深度上、Stable LatentMoE 如何用 SiTU-GLU 和 Quantile Balancing 在 896 专家下稳住训练,

文章图片
Prefill Awareness:当大模型开始分辨“哪些话不是我说的”,会如何运作

安全评估大量依赖 prefill——改写模型"过去的"回合再看其续写,失准续写等评估尤甚。本文精读一篇 NeurIPS 2026 投稿:它首次系统命名并测量 prefill awareness(预填充感知)——若模型能分辨"哪些历史不是自己写的",这类评估的有效性便从根上受威胁。作者以刻意低风险的偏好数据集剥离混淆,论证 detection(检测)与 resistance(抵抗)几乎不相关:风格驱

文章图片
#人工智能
32B 小模型追平百亿闭源大模型:FitOne 领域后训练三段式(CPT→SFT→DAPO)

FitOne提出了一套完整的垂直领域大模型训练方案,针对科学健身指导(SFC)这一复杂场景,通过三阶段训练流程将通用基座转化为领域专家。方法包含:1)领域持续预训练(CPT),采用知识工程构建30B tokens领域语料,通过RegMix优化数据配比;2)混合监督微调(SFT),用知识引导生成和多维校验构建高质量指令数据,采用两阶段分布退火策略;3)DAPO强化学习,引入混合奖励函数和动态采样机制

文章图片
#人工智能
TacReasoner:给触觉大模型装上「动态感知」与「思维链」——一篇让 7B 打赢 14B 的触觉-语言框架

TacReasoner 面向具身触觉推理,提出「冻结外观流 + 可训帧差时序流」的动态感知编码器,并构建首个触觉思维链数据集 TouchCoT-10K,把推理过程显式写进训练目标,在多数子任务上让 7B 反超 14B 的 VTV-LLM。本文逐条精准推导其六个核心公式与两个损失函数,指出帧差与「剪切累积」动机的错位、式(7)期望记号之误、CLS 单 token 瓶颈及 45 样本评测的置信度问题,

文章图片
#多模态
让大模型在开球前下注:WorldCupArena 如何把“预测未来”做成一把可复用的标尺

多数大模型评测都在考"答案已知"的题,测不出模型能否在事件发生前给出有用判断。WorldCupArena 反其道而行:开球前 24 小时锁死预测,赛后对着官方战报打分,并把一场球拆成比分、球员、事件、技战术、整届赛事五层来评估。它用一套克制自洽、可独立复算的评分数学,让胜负正确率都约 68% 的模型分出真实高下,得出"加检索未稳定帮忙""最强模型仅微超博彩市场""模型在冷门上集体翻车"等诚实结论。

文章图片
当“话没毛病、动作要命”:一篇把具身安全从文本安全里拆出来的论文,值不值得信?

清华与南洋理工的新论文提出:具身智能体的物理危险与文本内容危险,在大模型隐状态里是两个可分的信号,并据此给出一个只需一层线性探针的安全监控方法 PRISM,在自建的对比基准上拿到 99.6% 准确率。本文不做翻译,而是把它的角度分析、目标函数、零假设检验逐一重推,把七张实验表逐格重算:主表全部自洽,但跨模型表有三行对不上;核心角度经去噪校正后从 76 度降到 61.5 度;而真实指令流的基准率算术

文章图片
TacReasoner:给触觉大模型装上「动态感知」与「思维链」——一篇让 7B 打赢 14B 的触觉-语言框架

TacReasoner 面向具身触觉推理,提出「冻结外观流 + 可训帧差时序流」的动态感知编码器,并构建首个触觉思维链数据集 TouchCoT-10K,把推理过程显式写进训练目标,在多数子任务上让 7B 反超 14B 的 VTV-LLM。本文逐条精准推导其六个核心公式与两个损失函数,指出帧差与「剪切累积」动机的错位、式(7)期望记号之误、CLS 单 token 瓶颈及 45 样本评测的置信度问题,

文章图片
#多模态
    共 50 条
  • 1
  • 2
  • 3
  • 4
  • 5
  • 请选择