
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
AI同时操控200个机器人,任务成功率超90_,半数故障依然「能打」
AI同时操控200个机器人,任务成功率超90_,半数故障依然「能打」

任意Agent皆可强化学习!微软推出Agent Lightning框架,无需修改任何代码
AI Agent 已逐渐从科幻走进现实——不仅能够执行编写代码、调用工具、进行多轮对话等复杂任务,甚至还可以进行端到端的软件开发,已经在金融、游戏、软件开发等诸多领域落地应用。然而,当前的 AI Agent 在训练与优化环节却面临着严峻挑战,传统强化学习(RL)方法也在复杂、动态交互场景下表现不佳。为此,微软团队推出了一个灵活、可扩展的框架 —— Agent Lightning,其可对任何 AI

斯坦福新发现:一个“really”,让AI大模型全体扑街!
AI:人们为何会相信某个信息是真或假?

最强AI竟不如6岁儿童水平?BabyVision揭示大模型「视觉推理」困境
一场针对AI“视觉本能”的测试。

长程游戏Agent新思路!浙大团队:把昂贵推理用在“刀刃”上
对于开放世界游戏、复杂软件操作和多步骤具身任务来说,学会在关键转折点重新思考、在稳定阶段低成本执行,可能是提升智能体实用性的关键路径。

怎么让Agent越用越聪明?NUS团队提出新框架:记忆像代码一样可以迭代
让 Agent 记忆跟着环境一起演化。

清华、智谱团队提出Vision2Web:基于Agent验证评估视觉网站开发
在数据集构建方面,Vision2Web 筛选并整合了大量真实世界的网站资源,最终包含了 193 个开发任务,广泛覆盖内容、交易、SaaS 平台及公共服务 4 个类别下的 16 个子类,总计配备了 918 张原型图像和 1255 个测试用例,旨在为评估模型在多样化、高复杂度场景下的泛化能力提供坚实且高质量的数据基础。作为对工程能力的终极考核,全栈网站开发任务则要求模型面对结构化的需求文档与复杂原型图

手机上跑MoE?Meta提出MobileMoE,iPhone 16 Pro提速3.8倍
MobileMoE 并为端侧大语言模型建立了新的帕累托前沿,在精度与推理计算开销的权衡上取得了更优结果。










