
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
阿里云PAI平台分享了大模型云上训练的工程实践,重点解决超大规模集群下的调度与容错挑战。面对大模型训练长周期、高故障率的特点,PAI构建了三层防护体系:事前30-50项指标检查(1分钟完成)、事中AImaster实时容错(分钟级恢复)、事后EasyCKPT异步快照(分钟级重启)。通过Serverless架构、拓扑感知调度和QuotaTree资源管理,实现了90%以上的资源利用率,支持万卡级训练。

本期Github热点聚焦五大前沿开源项目:1)谷歌团队推出的AI编程Agent技能包,将软件工程流程拆解为24个可复用技能模块;2)苹果官方发布的Apple Silicon原生容器工具,支持OCI标准镜像;3)英伟达物理AI世界模型平台Cosmos,专攻机器人/自动驾驶场景的物理规律理解;4)全渠道开源客服系统Chatwoot,集成AI自动回复功能;5)全球公开IPTV播放列表合集(含12万星)。

本文梳理了Hadoop生态系统的核心组件及其相互关系。HDFS解决PB级数据存储问题,通过分块和备份实现分布式存储;MapReduce提供分布式计算框架,配合YARN进行资源调度。Hive将SQL转化为MapReduce任务,Spark通过内存计算提升性能,Fink支持实时流处理,HBase则实现毫秒级海量数据查询。

本文介绍了如何通过AI大模型对IT系统进行"蒸馏",将业务系统转化为AI可调用的能力包。核心思路是将系统能力通过API接口暴露给AI,而非直接开放数据库,确保安全可控。蒸馏过程需要输入需求文档、架构设计等原始资料,输出包括API接口、领域对象、数据结构等结构化文档,并遵循语义分层、粗粒度API等六大原则。最终形成三层架构:常驻内存的语义层(L1)、业务API层(L2)和按需加载的明细层(L3)。

《Omni Cache:以内存为中心的KV管理与推理加速》提出创新架构解决大模型推理显存瓶颈。传统方案静态预分配HBM导致资源浪费和寻址复杂,团队提出将KV Block Pool移至DRAM,HBM仅作缓存,通过连续缓冲区和ReshapedAttention提升效率。该方案实现Prefill吞吐提升和Decode批量扩容,分区管理使batch size提升4-8倍,端到端性能提升3-5倍。同时优化

本文探讨了端侧大模型的技术趋势与产业应用,指出除Scaling Law外,效率问题同样关键。面壁智能提出"知识密度定律":单位参数的智能水平每100天翻倍,推动模型小型化。该定律带来三个推论:参数需求下降、推理成本降低、训练开销减少,使终端设备运行大模型成为可能。端侧智能具备隐私性、实时性和可靠性优势,硬件商业模式可能比云端更具可持续性。文章认为,将合适模型部署在终端设备是务实方向,Apple等公

阿里云PAI平台分享了大模型云上训练的工程实践,提出超大规模集群下的调度与容错解决方案。面对大模型训练的三大挑战(分布式难度、硬件可靠性、生态成本),PAI设计了三层架构:底层异构算力、中间训练/推理服务、上层AI社区。通过事前检查、事中容错(AImaster)、事后恢复(EasyCKPT异步快照)实现稳定性保障;采用Serverless调度、拓扑感知优化和闲时资源机制提升效率;支持多框架融合(如

本文介绍了面向超大规模教育场景的AI智能体系统架构演进与实践。教育AI应用具有任务复杂、流程长、高并发、多模态的特点,讯飞构建的「WISH」智能体开发平台通过统一服务化框架、CRDT无冲突负载均衡算法、崩溃处理机制等创新设计,解决了异构引擎管理、弹性调度和稳定性等挑战。平台还实现了KV-Cache亲和调度以优化大模型推理效率,并正朝着全动态工作流和智能运维闭环方向演进。该架构思路适用于需要多引擎协

快手安全团队对未来的想象是一个名为「RiskOS」的AI神经中枢操作系统。它将底层模型能力、多智能体动态编排能力和上层应用整合在一起,实现审核与生成的端到端一体化。

本文介绍了Lance格式在多模态数据管理和AI Agent记忆存储中的应用。传统多模态数据管理存在数据孤岛、模式变更成本高和访问模式不匹配三大痛点,而Lance作为新兴AI数据库格式,通过支持大宽列、零成本结构变更、混合存储和高效随机点查等特性有效解决了这些问题。尤其适用于AI训练、多模态存储和向量检索场景。在AI Agent领域,LanceDB能够统一存储多模态交互数据,简化记忆和上下文管理。








