logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

阿里云 PAI 超大规模集群:大模型训练的调度、容错与资源管理实践

阿里云PAI平台分享了大模型云上训练的工程实践,重点解决超大规模集群下的调度与容错挑战。面对大模型训练长周期、高故障率的特点,PAI构建了三层防护体系:事前30-50项指标检查(1分钟完成)、事中AImaster实时容错(分钟级恢复)、事后EasyCKPT异步快照(分钟级重启)。通过Serverless架构、拓扑感知调度和QuotaTree资源管理,实现了90%以上的资源利用率,支持万卡级训练。

文章图片
#阿里云#云计算#GPU
GitHub 一周热点 119 期:Agent Skills、苹果容器工具、NVIDIA 物理 AI 世界模型详解

本期Github热点聚焦五大前沿开源项目:1)谷歌团队推出的AI编程Agent技能包,将软件工程流程拆解为24个可复用技能模块;2)苹果官方发布的Apple Silicon原生容器工具,支持OCI标准镜像;3)英伟达物理AI世界模型平台Cosmos,专攻机器人/自动驾驶场景的物理规律理解;4)全渠道开源客服系统Chatwoot,集成AI自动回复功能;5)全球公开IPTV播放列表合集(含12万星)。

文章图片
#github#人工智能
Hadoop 是什么?HDFS、Spark、Flink、Hive、HBase 一篇讲透大数据全家桶

本文梳理了Hadoop生态系统的核心组件及其相互关系。HDFS解决PB级数据存储问题,通过分块和备份实现分布式存储;MapReduce提供分布式计算框架,配合YARN进行资源调度。Hive将SQL转化为MapReduce任务,Spark通过内存计算提升性能,Fink支持实时流处理,HBase则实现毫秒级海量数据查询。

文章图片
#hadoop#大数据#hdfs +3
通过AI大模型对IT系统蒸馏:构建独立Skills技能包的实操方案

本文介绍了如何通过AI大模型对IT系统进行"蒸馏",将业务系统转化为AI可调用的能力包。核心思路是将系统能力通过API接口暴露给AI,而非直接开放数据库,确保安全可控。蒸馏过程需要输入需求文档、架构设计等原始资料,输出包括API接口、领域对象、数据结构等结构化文档,并遵循语义分层、粗粒度API等六大原则。最终形成三层架构:常驻内存的语义层(L1)、业务API层(L2)和按需加载的明细层(L3)。

文章图片
#人工智能#自然语言处理
盘古大模型团队开源推理组件,Omni Cache以内存为中心的KV管理与推理加速实践

《Omni Cache:以内存为中心的KV管理与推理加速》提出创新架构解决大模型推理显存瓶颈。传统方案静态预分配HBM导致资源浪费和寻址复杂,团队提出将KV Block Pool移至DRAM,HBM仅作缓存,通过连续缓冲区和ReshapedAttention提升效率。该方案实现Prefill吞吐提升和Decode批量扩容,分区管理使batch size提升4-8倍,端到端性能提升3-5倍。同时优化

文章图片
#软件构建
端侧大模型的技术趋势,面壁智能的知识密度定律与产业应用观察

本文探讨了端侧大模型的技术趋势与产业应用,指出除Scaling Law外,效率问题同样关键。面壁智能提出"知识密度定律":单位参数的智能水平每100天翻倍,推动模型小型化。该定律带来三个推论:参数需求下降、推理成本降低、训练开销减少,使终端设备运行大模型成为可能。端侧智能具备隐私性、实时性和可靠性优势,硬件商业模式可能比云端更具可持续性。文章认为,将合适模型部署在终端设备是务实方向,Apple等公

文章图片
#AI#人工智能
阿里云 PAI 超大规模集群:大模型训练的调度、容错与资源管理实践

阿里云PAI平台分享了大模型云上训练的工程实践,提出超大规模集群下的调度与容错解决方案。面对大模型训练的三大挑战(分布式难度、硬件可靠性、生态成本),PAI设计了三层架构:底层异构算力、中间训练/推理服务、上层AI社区。通过事前检查、事中容错(AImaster)、事后恢复(EasyCKPT异步快照)实现稳定性保障;采用Serverless调度、拓扑感知优化和闲时资源机制提升效率;支持多框架融合(如

文章图片
#阿里云#云计算#AI +1
WISH智能体平台:面向大模型时代的AI应用开发与运行基础设施

本文介绍了面向超大规模教育场景的AI智能体系统架构演进与实践。教育AI应用具有任务复杂、流程长、高并发、多模态的特点,讯飞构建的「WISH」智能体开发平台通过统一服务化框架、CRDT无冲突负载均衡算法、崩溃处理机制等创新设计,解决了异构引擎管理、弹性调度和稳定性等挑战。平台还实现了KV-Cache亲和调度以优化大模型推理效率,并正朝着全动态工作流和智能运维闭环方向演进。该架构思路适用于需要多引擎协

文章图片
#人工智能#AI
AI-Native构建商业安全大模型:快手的多智能体风控自动驾驶实践

快手安全团队对未来的想象是一个名为「RiskOS」的AI神经中枢操作系统。它将底层模型能力、多智能体动态编排能力和上层应用整合在一起,实现审核与生成的端到端一体化。

文章图片
#安全#自动驾驶#AI +1
Lance:从多模态数据湖到Agent记忆湖的演进之路

本文介绍了Lance格式在多模态数据管理和AI Agent记忆存储中的应用。传统多模态数据管理存在数据孤岛、模式变更成本高和访问模式不匹配三大痛点,而Lance作为新兴AI数据库格式,通过支持大宽列、零成本结构变更、混合存储和高效随机点查等特性有效解决了这些问题。尤其适用于AI训练、多模态存储和向量检索场景。在AI Agent领域,LanceDB能够统一存储多模态交互数据,简化记忆和上下文管理。

文章图片
#人工智能#AI#多模态 +1
    共 144 条
  • 1
  • 2
  • 3
  • 15
  • 请选择