
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
斯坦福新发现:一个“really”,让AI大模型全体扑街!
AI:人们为何会相信某个信息是真或假?

最强AI竟不如6岁儿童水平?BabyVision揭示大模型「视觉推理」困境
一场针对AI“视觉本能”的测试。

长程游戏Agent新思路!浙大团队:把昂贵推理用在“刀刃”上
对于开放世界游戏、复杂软件操作和多步骤具身任务来说,学会在关键转折点重新思考、在稳定阶段低成本执行,可能是提升智能体实用性的关键路径。

怎么让Agent越用越聪明?NUS团队提出新框架:记忆像代码一样可以迭代
让 Agent 记忆跟着环境一起演化。

清华、智谱团队提出Vision2Web:基于Agent验证评估视觉网站开发
在数据集构建方面,Vision2Web 筛选并整合了大量真实世界的网站资源,最终包含了 193 个开发任务,广泛覆盖内容、交易、SaaS 平台及公共服务 4 个类别下的 16 个子类,总计配备了 918 张原型图像和 1255 个测试用例,旨在为评估模型在多样化、高复杂度场景下的泛化能力提供坚实且高质量的数据基础。作为对工程能力的终极考核,全栈网站开发任务则要求模型面对结构化的需求文档与复杂原型图

手机上跑MoE?Meta提出MobileMoE,iPhone 16 Pro提速3.8倍
MobileMoE 并为端侧大语言模型建立了新的帕累托前沿,在精度与推理计算开销的权衡上取得了更优结果。

手机上跑MoE?Meta提出MobileMoE,iPhone 16 Pro提速3.8倍
MobileMoE 并为端侧大语言模型建立了新的帕累托前沿,在精度与推理计算开销的权衡上取得了更优结果。

高情商AI Agent来了!剑桥团队推出进化RL框架EvoEmo,靠愤怒、悲伤成功“讨价还价”
EvoEmo:为AI搭起“情感进化流水线”










