logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

最新 AI 论文盘点(2026-04-09):5 篇新作看个性化对齐、Agent 在线训练、多模态病理与视频运动控制

AI研究正从"泛能力堆高"转向"系统瓶颈拆解"。5篇新论文聚焦关键问题:1)个性化奖励模型仅75.94%准确率,揭示通用与个性化对齐差异;2)Android Agent在线训练通过单状态多动作采样提升1.4倍效率;3)视频生成需解耦物体/相机运动与因果关系;4)病理WSI的MoE路由需显式约束防失衡;5)LLM难以稳定执行语法规则转导,低资源翻译需谨慎。这些

#人工智能#算法
最新 AI 论文盘点(2026-04-11):5 篇新作看个性化对齐、Agent 在线训练、病理路由与视频运动控制

结果上,它在 AndroidLab 和 AndroidWorld 上,相比 UI-TARS-1.5-7B 拿到了 7.5% / 8.3% 的成功率提升,并在同等成功率下实现 1.4x 的训练效率提升。作者指出,很多现有方法默认采用的是 Single State / Single Action,也就是每拿到一个在线状态,只采一个动作样本来更新策略。这篇论文真正值得记住的,不只是 Android Ag

#人工智能
最新 AI 论文盘点(2026-04-27):5 篇新作看 Agent 世界模型、低成本 scaling law、多图理解、长尾 3D 重建与 LLM 水印

AI研究正转向解决现实约束:5篇新论文揭示关键趋势 Agent世界模型:提出分层框架(预测器/模拟器/演化器)解决不同环境下的动态建模问题,强调环境预测能力比工具调用更重要。 低成本Scaling Law:通过主动实验选择策略,仅用10%预算即可准确预测模型扩展规律,解决传统方法实验成本过高问题。 多图理解:提出CGC方法解决跨图对象混淆问题,通过组合对比训练增强多图归因能力,避免注意力泄漏。 长

#人工智能#3d#深度学习
最新 AI 论文盘点(2026-03-19):6 篇新作看 Agent 记忆、训练提速、KV 压缩与机器人低延迟控制

今天这批论文给我的一个强烈感觉是:AI 系统正在进入一个更讲“结构化工程能力”的阶段。这里说的结构化,不只是模型结构,而是:记忆怎么组织能力怎么沉淀训练怎么提速KV cache 怎么精打细算机器人动作怎么更快地产生基础模型怎么满足形式化约束过去几年,很多工作是在证明“模型能不能做到”。如果真要让系统长期运行、稳定部署、持续变强,到底该怎么设计它的内部结构。这类论文未必每篇都会立刻爆火,但它们很可能

#人工智能#机器人#深度学习
AI Research Agents 与科研自动化:从文献阅读到实验设计

过去一年,AI Research Agents 的讨论从「帮我总结论文」快速推进到「能否提出假设、写代码、运行实验、生成论文、接受审稿」。这个方向的关键变化不是 LLM 会写得更像论文,而是研究流程正在被拆成可检索、可执行、可评测、可追溯的 agentic workflow:文献发现需要开放式搜索和证据链;假设生成需要与已有知识图谱和实验约束对齐;实验设计需要代码、工具、仪器和预算边界;结果分析需

文章图片
#人工智能#自动化#语言模型
Software Engineering Agents:代码生成、调试、评测和真实仓库任务

2024-2026年,软件工程Agent研究从代码补全转向仓库级任务处理,模型能参与真实开发流程(定位bug、多文件编辑、测试验证等)。核心进展体现在:1)评测体系(SWE-bench系列)标准化真实issue修复任务;2)交互框架(SWE-agent等)设计专用工具接口;3)结构化方法(Agentless)验证简化管线的有效性;4)数据合成(SWE-smith)解决训练数据稀缺问题。研究趋势表明

文章图片
#人工智能#语言模型
最新 AI 论文盘点(2026-05-14):5 篇新作看 Embodied Agent 验证器、Benchmark 防作弊、VLM 失效模式、GUI Grounding 与隐性偏好学习

5篇代表性论文揭示了这一方向的关键进展: 动作验证机制:VeGAS为Embodied Agent增加验证层,通过候选动作筛选提升长链路任务可靠性,实验显示性能提升达36%。 评测安全性:BenchJack系统发现10个流行Agent Benchmark中存在219个可被利用漏洞,揭示了当前评测体系存在的严重安全问题。 失效模式分析:REVELIO方法系统识别VLM

#人工智能#学习
最新 AI 论文盘点(2026-04-07):6 篇新作看 latent reasoning 可解释性、小模型搜索代理、持久化 agent runtime,以及机器人系统如何开始认真补工程短板

AI研究正从"能否推理"转向"推理如何发生与落地"。最新论文揭示4个关键趋势:1)隐式推理模型的可解释性被质疑,部分推理痕迹可恢复但存在浪费;2)4B小模型通过训练策略优化实现高水平数学证明;3)难题学习采用任务重写方法,使模型逐步掌握;4)长期运行的Agent系统设计更关注可审计性、持久化与安全性。这些进展表明AI竞争焦点正从"答案质量&quot

#人工智能#机器人
最新 AI 论文盘点(2026-03-21):8 篇新作看可靠推理、GUI Agent 奖励、VLA 可解释性与机器人真实效率

从 embodied efficiency 那篇可以很明显看出来:参数少一点decoder 快一点FLOPs 低一点这些都不再自动等于更好。真实机器人场景要看的,是:动作平不平顺能耗高不高执行总时间长不长硬件磨损大不大今天这批论文给我最强的感觉是:AI 系统正在从“证明自己能做”转向“证明自己值得被信任、值得被部署”。这里的“值得”包括很多层:推理过程是不是更可靠奖励机制是不是更稳VLA 内部机制

#人工智能#机器人
最新 AI 论文盘点(2026-03-30):6 篇新作看 agent 外部化、LLM 自我改进、RAG 基础工程与研究型 AI 迭代

今天盘点 6 篇值得关注的 AI 新论文,重点看 agent harness 外部化、LLM self-improvement 闭环、RAG 的 adaptive chunking、可信 AI 的 memory 瓶颈,以及研究型 AI 如何基于反馈持续迭代。

#人工智能#AIGC
    共 111 条
  • 1
  • 2
  • 3
  • 12
  • 请选择