logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

别只盯着模型了,Agent 真正的天花板可能在“脚手架”

说白了,这就是一个把“文本生成”变成“状态机控制”的流水线。这篇长文的价值,不在于提出了什么底层算法创新,而在于把碎片化的工程共识整合成了一套可操作的心智模型。作者给出的解法是“Ratchet(棘轮)机制”:把每一次偶然的翻车,变成永久性的系统规则。现代大模型的后训练(Post-training)阶段,往往已经与特定的交互循环强耦合,导致一定程度的“架构过拟合”。开发者常陷入“唯模型论”的误区,以

招聘 | Ai native婚恋产品招Agent开发联创

我们要做的不仅仅是婚恋产品,更是在创造接下来A2A时代的重要能力 —— 在数字分身(小龙虾)普遍缺乏用户完整的主观数据的情况下,我们在强社交动机场景(婚恋),利用轻松且符合人性的聊天方式,“全面+高效”的采集用户主观数据,搭建个人基于主观数据的小模型。全程AI引导,用户用最懒的办法,只用动动嘴就可以了。我们正在开发一款婚恋匹配神器,用户注册后预约时间,坐等AI来电,通过聊天语音分析,AI会自动做匹

#人工智能
警告:你的Agent可能无法“解决“真实世界的视觉问题

AgentVista 包含 209 道任务,横跨 7 大领域 25 个子方向,每一道任务都扎根于细节丰富的真实视觉状态(日常照片、截图、技术图纸),要求 Agent 反复锚定视觉线索、检索外部信息并验证中间决策——这正是现实世界中多模态智能体面临的真正挑战。例如,VisualToolBench 会对输入图像进行预处理以适配特定视觉操作——虽然这有利于评测视觉操作能力,但也将问题从"在自然视觉状态下

给 Agent Skills 装上眼睛:MMSkills 用多模态技能包教会智能体看状态、做决策

结果显示,直接加载完整多模态技能包反而会伤害性能,说明未过滤的图片和状态描述会污染主上下文;模型覆盖前沿多模态模型与较小规模开源模型,包括 Gemini 3.1 Pro、Gemini 3 Flash、Qwen3-VL-235B-A22B-Thinking、GLM-5V-Turbo、Kimi-K2.6 和 Qwen3-VL-8B-Instruct。MMSkills 的核心观点很直接:对于视觉 Age

不让“猪队友”拖后腿!哈深新作 AgentDropoutV2,专治多智能体“传话游戏”翻车现场

大家都知道,现在的多智能体系统(MAS)就像是一个精英项目组,有的负责写代码,有的负责审题,有的负责检查。这就好比公司里的 Code Review,不是直接驳回 PR,而是先提意见让你改,改不好再 Close。这名字听着像是什么 Dropout 技术的升级版,没错,但它这次不只是“淘汰”,更是“挽救”!哪怕是把这个“避坑指南”直接移植到更小的模型(Qwen3-4B)上,效果依然杠杠的,说明这方法。

#游戏
Claude Code + 多智能体协同:把数据清洗、建模、部署一条龙自动化

系统覆盖Claude Code AI编程智能体、OpenClaw个人AI代理、SubAgent多智能体并行架构、MCP工具生态、Skills技能扩展等核心技术,并深度横评GPT、Claude、Gemini、DeepSeek等七大主流模型的科研能力差异。一次学全,体系化掌握。培训规模:从2017年至今累计完成300+场线下深度培训,培训科研人员超过20,000人,其中80%为高校教师、教授、研究生、

#自动化#人工智能#大数据 +1
舍弃人工标注!华人团队提出多模态大模型自我进化算法

如此一来,Agent在游戏过程中便可生成足够长且复杂的推理链条,并且随着对手能力的提升,其所面临的挑战也会越来越大,并被激发出更强的视觉理解与推理能力。任意形式的图片都可作为输入:和以往有限制条件的游戏化训练框架不同的是,Vision-Zero可在任意形式的图片上启动游戏,这使得模型可以在很多不同的领域里获得相应的能力提升,并有很好的泛化性能。本文作者包括来自杜克大学的汪勤思,林阅千,李海教授,陈

#算法
奖励模型“裁判”失灵?LongRM 突破长上下文瓶颈,8B模型性能超过 Gemini 2.5 Pro

我们选择了四个有代表性的现有生成式奖励模型(GenRMs)进行评估,包括两个基础 LLM:Llama-3.3-70B 和 Qwen3-8B,以及两个微调过的生成式奖励模型(GenRMs):Skywork-Critic-Llama-3.1-70B 和 Selene-1Mini-Llama-3.1-8B。为验证传统上下文扩展方法的有效性,我们选择了原生支持32K上下文的Con-J-Qwen2-7B模型

国际头部高校联名发布 Agentic AI 的真正进化论

的概念 ,因为如果 Agent 和 Tool 互相“勾结”(Reward Hacking),可能会导致 Agent 为了得分而伪造工具调用结果,这将是灾难性的。不要试图用 Prompt 解决所有问题,试着为你冻结的大模型训练一个专属的“小助手”(Adapter/Tool),这可能是 ROI 最高的技术投资。现在的系统要么是“改人不改工具”(A1/A2),要么是“改工具不改人”(T1/T2)。),更

#人工智能
视觉优势还是语义依赖?揭秘 DeepSeek-OCR 高压缩率背后的真相

结果显示了完全的“推理崩塌”:尽管 OCR 表面精度很高,但在涉及逻辑推理的QA任务中,DeepSeek-OCR 的正确率只有27.7%,而同等参数大小的语言模型正确率都在90%以上(见图3);结论:DeepSeek-OCR 的高分表现,很大程度上是建立在“语言先验”之上的幻觉,而非纯粹的视觉识别能力,并且这种现象在其他的端到端模型中也普遍存在。这为这一范式的未来发展敲响了警钟:要实现真正有效的长

    共 1070 条
  • 1
  • 2
  • 3
  • 107
  • 请选择