logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

脑花 APP 完整解析:连接本地算力、AI NAS 与云端能力的个人 AI 应用入口

端脑科技上线了脑花 APP。脑花 APP 重新定义了人与 AI 的协作方式。作为一款 AI 原生的即时通讯网络,它将 AI NAS、本地算力与云端能力完美织入你最熟悉的聊天界面。在这里,分散在不同设备与服务中的 AI Agent 化身为你的“对话好友”。无需复杂的配置,像发微信一样日常,把顶尖的 AI 协同网络,变成一个人人都能点、人人都会用的手机界面。

文章图片
#人工智能
把 Prompt 当成“可训练参数“:SkillOpt 如何用深度学习的纪律去优化 Agent 技能

SkillOpt 提出了一种系统化优化 Agent 流程的方法,将自然语言技能文档视为可训练的“参数”,而非手工调整的静态规则。其核心创新在于借鉴深度学习优化器的设计,通过双模型架构(冻结目标模型+优化器模型)、有界文本更新(编辑预算控制)和验证门机制,实现技能文档的稳定迭代。实验覆盖 6 个基准、7 种模型,52 个评测场景均达到最优或并列最优。该方法避免了传统 Prompt 优化的随意性,最终

文章图片
#深度学习#人工智能#性能优化
ICML 2026 精读 | MLUBench:当多模态大模型「终身遗忘」时,真正的代价是对齐

学者们的研究揭示了多模态大模型(MLLM)终身遗忘任务中一个被忽视的核心问题:持续的知识遗忘会破坏视觉与语言模态间的对齐关系,导致模型性能整体退化。作者提出了首个针对终身遗忘场景的评测基准MLUBench,包含127个真实实体和超1.5万条多模态数据,并发现即使仅更新单一模态权重,模型在早期任务上的表现仍会大幅下降。 研究提出LUMoE解决方案,通过混合专家架构将遗忘操作隔离在冻结的主模型之外。这

文章图片
#人工智能#机器学习
Prefill Awareness:当大模型开始分辨“哪些话不是我说的”,会如何运作

安全评估大量依赖 prefill——改写模型"过去的"回合再看其续写,失准续写等评估尤甚。本文精读一篇 NeurIPS 2026 投稿:它首次系统命名并测量 prefill awareness(预填充感知)——若模型能分辨"哪些历史不是自己写的",这类评估的有效性便从根上受威胁。作者以刻意低风险的偏好数据集剥离混淆,论证 detection(检测)与 resistance(抵抗)几乎不相关:风格驱

文章图片
#人工智能
闭源大模型的信任红利正在耗尽,企业 AI 必将走向本地模型和开源 Agent——以端脑科技为例

大模型行业正经历从唯性能论向可控性转型的关键阶段。近期两起事件凸显企业AI应用的深层问题:模型发布采取分级审批制,暴露访问权不确定性;Claude Code被指隐蔽标记用户环境,反映高权限Agent的执行不可验证性。企业AI下一阶段的核心矛盾在于:闭源云端黑盒架构与业务级可信需求间的冲突。解决方案需构建可控智能体系,包含四大支柱:可审计入口(统一身份、日志和模型路由)、本地模型(保障数据边界和调用

文章图片
#人工智能
32B 小模型追平百亿闭源大模型:FitOne 领域后训练三段式(CPT→SFT→DAPO)

FitOne提出了一套完整的垂直领域大模型训练方案,针对科学健身指导(SFC)这一复杂场景,通过三阶段训练流程将通用基座转化为领域专家。方法包含:1)领域持续预训练(CPT),采用知识工程构建30B tokens领域语料,通过RegMix优化数据配比;2)混合监督微调(SFT),用知识引导生成和多维校验构建高质量指令数据,采用两阶段分布退火策略;3)DAPO强化学习,引入混合奖励函数和动态采样机制

文章图片
#人工智能
TacReasoner:给触觉大模型装上「动态感知」与「思维链」——一篇让 7B 打赢 14B 的触觉-语言框架

TacReasoner 面向具身触觉推理,提出「冻结外观流 + 可训帧差时序流」的动态感知编码器,并构建首个触觉思维链数据集 TouchCoT-10K,把推理过程显式写进训练目标,在多数子任务上让 7B 反超 14B 的 VTV-LLM。本文逐条精准推导其六个核心公式与两个损失函数,指出帧差与「剪切累积」动机的错位、式(7)期望记号之误、CLS 单 token 瓶颈及 45 样本评测的置信度问题,

文章图片
#多模态
让大模型在开球前下注:WorldCupArena 如何把“预测未来”做成一把可复用的标尺

多数大模型评测都在考"答案已知"的题,测不出模型能否在事件发生前给出有用判断。WorldCupArena 反其道而行:开球前 24 小时锁死预测,赛后对着官方战报打分,并把一场球拆成比分、球员、事件、技战术、整届赛事五层来评估。它用一套克制自洽、可独立复算的评分数学,让胜负正确率都约 68% 的模型分出真实高下,得出"加检索未稳定帮忙""最强模型仅微超博彩市场""模型在冷门上集体翻车"等诚实结论。

文章图片
当机器学习赢不过一次 ORDER BY value DESC

供应链延误模型通常用准确率和 AUC 评价,但运营只关心一件事:只能查 10% 的货,先查谁。这篇论文把问题改写成预算约束下的暴露捕获,并要求任何模型必须打赢一个零成本基线——按已知货值降序排。三个真实数据集里,XGBoost 输了两个。本文补全了论文未给出的三个推导:最优严重度权重等于校准图的斜率、代价敏感重加权在回归排序管线中理论上无效、以及价值排序的强度其实由货值分布的尾指数决定。

文章图片
RAGEN-2 论文精读:多轮 Agent RL 中的“模板坍缩”——熵看不见的失败模式、互信息诊断与 SNR 机理

本研究揭示了强化学习(RL)中一种被现有指标系统性忽略的失败模式——“模板坍缩”(template collapse),即模型在单个输入内保持推理多样性但跨输入维度上变得与输入无关。论文提出三个核心贡献:(1) 定义模板坍缩并提出无需外部模型的互信息代理指标进行检测;(2) 从信号噪声比(SNR)角度解释坍缩成因,指出低reward方差会削弱任务梯度,使更新被输入无关的正则项主导;(3) 提出SN

文章图片
#人工智能#机器学习
    共 59 条
  • 1
  • 2
  • 3
  • 6
  • 请选择