logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

姚顺雨腾讯首篇论文:给AI下半场指路“上下文学习”

CL-bench,专门用来测试大模型“从上下文中学习”的能力。姚顺雨,入职腾讯首席AI科学家后,参与的首个成果来了。CL-bench,专门用来测试大模型“从上下文中学习”的能力。这项研究与姚顺雨一贯的研究思路高度契合,去年8月他在OpenAI期间发表的博文《下半场》曾提出一个被反复引用的判断:AI正处在“中场休息”阶段,上半场是训练大于评估,下半场将是评估大于训练。真正重要的不是继续堆模型规模,而

#人工智能#学习#机器学习 +2
视觉思维链全新架构,加州大学让多模态大模型有了灵性,整体性能提升5.3%

加州大学伯克利分校、加州大学洛杉矶分校(UCLA)与松下AI研究中心的团队联合提出了一种全新的架构——视觉思维链(Chain-of-Visual-Thought,简称CoVT)。加州大学伯克利分校团队,让多模态大模型不再被迫将视觉信息翻译成贫瘠的文字。人类在观察世界时,绝不会把眼前景象先在脑子里翻译成一长串文字描述,再通过文字逻辑去判断距离和方位。我们会直接在大脑中通过视觉信号建立空间感。这种直觉

文章图片
#人工智能#AI#架构
两个LLM互相对线,推理能力起飞:康奈尔团队发布大模型版类GAN训练法

我们的研究表明,大语言模型可以通过类似 GAN 的双模型对抗式训练来提升数学推理能力,并在多个数学基准上取得可量化的性能提升。该方法还通过利用预训练知识增强后训练效果,在预训练与后训练之间建立了一座桥梁。尽管如此,我们的方法也存在局限性,例如在 GPQA 等领域外任务中并未带来性能提升。未来的研究将探索将该框架拓展到其他领域,如代码与事实问答,并进一步研究更广泛的多模型训练范式,包括协作式、竞争式

文章图片
#人工智能#AI
黄仁勋率先开源量子AI大模型

用英伟达自己的话说,Ising系列模型极大地简化了对复杂物理系统的理解,为量子纠错和校准提供了高性能、可扩展的AI工具。英伟达最新AI开源,瞄准了量子计算:推出——。用英伟达自己的话说,Ising系列模型极大地简化了对复杂物理系统的理解,为量子纠错和校准提供了高性能、可扩展的AI工具。而量子纠错和校准,正是构建混合量子-经典系统时最关键的两大挑战。老黄亦对Ising寄予厚望:AI对量子计算的实用化

#开源#人工智能#量子计算 +2
面试官:“大模型微调的方案有哪些?”我:“微调方案有全量微调、LoRA、QLoRA、SFT、DPO这些”,他:“你只会讲名称吗?”

回到开头那段对话,问到大模型微调方案,最重要的不是把名词列一遍,而是讲清楚两件事。第一件事是前置判断:微调是最后手段不是第一选择。能用 Prompt + Few-shot 解决就别上微调;能用 System Prompt 控制风格就别上微调;能用 RAG 接知识库就别上微调。只有这些都试过不行,再考虑微调。这一句说出来,面试官就知道你不是「为了微调而微调」的新人。第二件事是两个正交维度。

#人工智能#大数据#harmonyos +3
现代AI之父新作:13个大模型实测,检索agent真的可信吗?

搜索内容操纵对于当前的主流LLM助手依然是悬而未决的挑战。相比其他模型,Claude-sonnet、GPT-mini虽然在评测集上有更好的安全表现,但GPT在新场景下完全失守,Claude也存在过度拒绝和沉默漂移的潜在问题。把「对抗内容下的搜索推荐可靠性」当作模型安全的一等评测维度,而不是部署层的小事。评测指标要走出单一的ASR,把沉默漂移、误拒率这类被忽略的风险也纳进来。防御方案要针对「模型+框

#人工智能#线性代数#大数据 +1
这家西方开源大模型公司,开源出了DeepSeek-V3背后的架构!头部模型表现都差不多了,Mistral CEO自曝如何赚钱

如果各家前沿模型的性能已经非常接近,几乎难以分出谁更强——那会发生什么?面对《the Big Technology Podcast》抛出的问题,Mistral AI的 CEO Arthur Mensch 表示:大模型肯定会走向商品化,当模型表现越来越接近,那么竞争就不在于模型本身,而在于如何让客户用起来。

文章图片
#开源#架构#人工智能 +2
从显式CoT到隐式CoT:复旦让AI告别啰嗦,实现大模型高效沉默推理

模型像人类一样,通过一步步写出中间过程来解决复杂问题。这种方法在数学和编程领域等领域效果显著。复旦大学、上海AI实验室等机构的联合团队,一篇隐式推理(Supervised Implicit Chain-of-Thought,SIM-CoT)的论文刚刚被顶会ICLR 2026接收。通过将思维过程内化为不可见的向量,试图在保持推理能力的同时大幅降低计算成本,但这种“沉默的思考”往往因为缺乏引导而走向混

#人工智能#机器学习#深度学习 +3
Karpathy刚刚敲响警钟:大模型的“终极之战”打响!Agent大军即将全面接管研发

autoresearch核心逻辑很简单——人负责改提示词,AI负责改训练代码,然后让它自己跑下去。Andrej Karpathy上周末打包发布了一个新项目:autoresearch。Karpathy深夜炸场:开源630行代码“AI研究员”,5分钟完成一次训练,单卡就能跑,自我进化核心逻辑很简单——人负责改提示词,AI负责改训练代码,然后让它自己跑下去。项目地址:https://github.com

文章图片
#人工智能#算法#大数据 +1
突然袭击!刚刚,Meta超级智能团队首个大模型来了

刚刚,Meta 重金组建的超级智能实验室(SML)交卷!这也是年轻华人 Alexandr Wang 带领该团队后,交出的首份成绩。Meta 的大模型,卷土重来了!刚刚,Meta 重金组建的超级智能实验室(SML)交卷!这也是年轻华人 Alexandr Wang 带领该团队后,交出的首份成绩。Meta 一直是生成式 AI 时代最值得关注的公司之一,早在 2023 年初,它凭借开源 Llama 系列模

文章图片
#搜索引擎#人工智能#火山引擎 +1
    共 914 条
  • 1
  • 2
  • 3
  • 92
  • 请选择