logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

从 GShard 到 DeepSeek-V3:回顾 MoE 大模型负载均衡策略演进

先说点背景吧。MoE 架构之所以瞬间火起来,是因为人们发现,你可以在不等比例增加计算开销(FLOPs)的前提下,让模型拥有极其庞大的参数量。核心思路在于:对每个 token,只激活少量的专家参与计算,而不是让所有参数统统上场。但这种“只让部分专家工作”的做法,很快就暴露了一大问题:如果只把 token 分给几个专家,那怎么保证负载是均衡的?要是某个专家被一大堆 token 疯狂轰炸,而其他专家却闲

文章图片
#负载均衡#运维
谷歌首席科学家 Jeff Dean演讲:人类设计芯片需要18个月,AI只用了1秒钟

在芯片设计领域,谷歌的创新最为引人注目。传统芯片设计需要数百人投入18个月时间,成本高达数亿美元。AlphaChip 系统试图将这个过程缩短到几周。AlphaChip 采用了多项创新技术:智能芯片分块和组件聚类强化学习优化布局布线预训练模型加速设计过程 系统最令人印象深刻的是其预训练能力。如果从零开始,系统需要20小时才能达到较好状态。但通过预训练,系统能在1秒内完成高质量的布局评估,效率超越人类

文章图片
#人工智能
编程革命彻底爆发!刚刚,OpenAI最强智能体上线ChatGPT

当Thibault提出希望代码库「易维护、无bug」的目标时,Codex遍历代码库后,主动发现了可变默认值、不一致的超时设置等问题,并自行生成了修复任务。借助Codex实现功能开发、问题调试、测试编写与执行的加速,并用于重构大型代码库。此外,OpenAI研究员Katy Shi演示中强调,Codex的PR包含了详细的摘要,清晰说明了修改内容和引用的代码,测试结果一目了然。在纠错方面,他故意在指令中加

264页智能体综述来了!MetaGPT等20家顶尖机构、47位学者参与

此研究汇聚了来自 MetaGPT、Montréal & Mila 人工智能研究所、南洋理工大学、美国阿贡国家实验室、悉尼大学、宾夕法尼亚州立大学、微软亚洲研究院、伊利诺伊大学厄巴纳 - 香槟分校、香港科技大学、南加州大学、耶鲁大学、斯坦福大学、佐治亚大学、俄亥俄州立大学、阿卜杜拉国王科技大学、杜克大学、香港理工大学、谷歌 DeepMind 以及 加拿大高等研究院(CIFAR)等众多研究者的集体智慧

#开源#人工智能#数据挖掘
大模型分布式训练学习过程总结(万字长文)

为什么我要写这个?系统化的学习大模型,除了知道大模型是什么,也得知道大模型是如何训练的,对大模型的实际应用有更加定量的认知,该文章也算是一篇分布式训练的学习过程总结,作为循序渐进学习分布式训练的总结。类似之前写过的LLM文章,本文也建议读者先定性有个宏观认知,然后再细化到某个概念定量了解,遇到不太清楚的概念深度递归去学习。

文章图片
#分布式#学习
一文讲明白大模型显存占用(只考虑单卡)

顾名思义,混合精度训练就是将多种不同的精度数据混合在一起训练,《 MIXED PRECISION TRAINING 》这篇论文里将FP16和FP32混合,优化器用的是Adam,如下图所示:MIXED PRECISION TRAINING论文里的训练流程图按照训练运行的逻辑来讲:Step1:优化器会先备份一份FP32精度的模型权重,初始化好FP32精度的一阶和二阶动量(用于更新权重)。Step2:开

#自然语言处理#深度学习
秒杀同行!Kimi开源全新音频基础模型,横扫十多项基准测试,总体性能第一

值得注意的是,Kimi-Audio 在广泛使用的 LibriSpeech 基准测试中取得了最佳结果,在 test-clean 上达到了 1.28 的错误率,在 test-other 上达到了 2.42,显著超越了像 Qwen2-Audio-base 和 Qwen2.5-Omni 这样的模型。今天,kimi 又发布了新的开源项目 —— 一个全新的通用音频基础模型 Kimi-Audio,支持语音识别、

#音视频
黄仁勋对话软银孙正义:打造AI代理和物理AI,强调企业必须在AI浪潮中找准定位

当然,最重要的是我们的 AI 软件,这让用户可以轻松构建 AI。那么,什么是 AI?什么是 AI?我们以多种方式谈论 AI,但我认为有两种类型的 AI 将非常受欢迎。我个人非常喜欢这两种心智模型。第一个 AI 基本上是“数字 AI 工作者”。这些 AI 工作者能够理解、计划并采取行动。比如,它们可能被用于执行营销活动、支持客户、制定制造供应链计划、优化芯片设计、编写软件,甚至在药物研发行业中担任实

文章图片
#人工智能
ICLR 高分:深入研究多模态大模型的对齐策略

作者:yearn原文:https://zhuanlan.zhihu.com/p/6762892397多模态大模型(MLLMs)虽然在视觉与语言理解任务上取得了显著进展,但仍面临“幻觉”现象,即生成的描述可能不符合视觉内容。为了解决这一问题,研究人员提出了偏好对齐(preference alignment)方法来增强模型与图像内容的契合度。然而,由于偏好数据集、基模型类型和对齐方法的差异,目前尚不清

#人工智能#语言模型#自然语言处理
震惊!OpenAI突破性进展,清华天才联手破解扩散模型难题!

第三,对于给定的数据集,sCD 的 Scaling 是可预测的,在不同大小的模型中,FID 的相对差异保持一致。如图 7 所示,研究者对比了 sCD、VSD、sCD 和 VSD 的组合等(通过简单地将两种损失相加)并观察到,VSD 具有与扩散模型中应用大 guidance scale 类似的人工效应:它提高了保真度(表现为更高的精确度分数),同时降低了多样性(表现为更低的召回分数)。他们观察到,s

文章图片
#人工智能#深度学习#机器学习
    共 154 条
  • 1
  • 2
  • 3
  • 16
  • 请选择