logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

27届大模型面试准备(七十):大模型推理服务的负载均衡与智能请求路由

本篇是「工程实战深化」系列的第 70 篇(大模型线)。上一篇(六十九)讲了 Prefill-Decode 分离:把一个大模型推理集群拆成 prefill 池和 decode 池,各自扩缩。拆完之后立刻冒出一个问题——这看似是「负载均衡」的老话题,但大模型推理的负载均衡比普通 Web 服务难得多:请求长度天差地别、KV Cache 有明显的位置局部性、GPU 利用率和延迟不是线性关系。

#负载均衡
国产海光DCU及超算平台深度解析

尽管面临生态完善度与国际技术差距的挑战,其持续迭代的产品性能、与DeepSeek等企业的深度合作,以及国家“东数西算”战略的推动,将加速国产DCU在AI、科学计算等领域的全面替代进程。• 智算中心建设:在国家级超算中心中,海光DCU集群已支持千亿参数大模型训练,单集群算力规模达100PFLOPS(FP16),训练效率达到英伟达H100集群的65%。• 采用7nm+工艺,显存容量提升至512GB,带

文章图片
#人工智能#大数据
智能体面试准备(二十九):主流智能体框架实战——LangGraph、AutoGen、CrewAI 对比与选型踩坑

前面我们把 Agent 的核心能力拆了个遍:ReAct(B12)、Function Calling(B18)、多智能体协作(B15)、记忆(B13)、人机协作(B27)、编程智能体(B28)。但到了真正写项目,没人会从零手搓一个循环——大家都会选一个框架。2024-2025 年最主流的三剑客是 LangGraph、AutoGen、CrewAI,它们解决的是同一类"工程脏活":状态管理、持久化、并发

智能体面试准备(十九):RAG 评估体系——检索指标、RAGAS、忠实度与故障归因

上一篇《Function Calling 全链路》讲的是智能体怎么正确地调工具,这一篇回到检索这条主线。A 系列第十二篇讲过 RAG 怎么搭,但面试真正卡人的往往不是"你会不会搭",而是"RAG 是一个多阶段级联系统,任何一环坏了最终都表现为"答得不对",如果没有分段归因能力,调优就变成了盲目试参数。今天这篇把 RAG 评估体系一次讲透:从检索侧的经典 IR 指标,到生成侧的忠实度与相关性,再到

#RAG
27届大模型面试准备(七十九):大模型异构算力适配与跨芯片部署工程——算子适配、图编译与性能对齐

本文是系列第 79 篇。前几篇讲了推理服务的高可用、问题定位与容灾,默认前提都是"跑在 NVIDIA GPU 上"。但真实生产里这个前提正在被打破:国产加速卡(昇腾、寒武纪、燧原、海光等)进入采购清单、云上混部了 A100/H800/L40S 多代卡、甚至要在 CPU 或 NPU 上跑小模型。,是 2024 年之后大模型工程岗越来越常考的题。面试官真正想听的不是"我会用 vLLM",而是:面对一张

27届大模型面试准备(七十九):大模型异构算力适配与跨芯片部署工程——算子适配、图编译与性能对齐

本文是系列第 79 篇。前几篇讲了推理服务的高可用、问题定位与容灾,默认前提都是"跑在 NVIDIA GPU 上"。但真实生产里这个前提正在被打破:国产加速卡(昇腾、寒武纪、燧原、海光等)进入采购清单、云上混部了 A100/H800/L40S 多代卡、甚至要在 CPU 或 NPU 上跑小模型。,是 2024 年之后大模型工程岗越来越常考的题。面试官真正想听的不是"我会用 vLLM",而是:面对一张

智能体面试准备(五):规划与任务分解——从 Plan-and-Execute 到动态重规划的工程实现

智能体面试准备(五):规划与任务分解——从 Plan-and-Execute 到动态重规划的工程实现

#面试#人工智能
27届大模型岗面试准备(十二):RAG 从原理到落地——分块、向量检索、重排与评估的完整链路

27届大模型岗面试准备(十二):RAG 从原理到落地——分块、向量检索、重排与评估的完整链路

#RAG#面试
27届大模型岗面试准备(十一):模型蒸馏与稀疏化——从软标签到结构化剪枝的压缩全景

27届大模型岗面试准备(十一):模型蒸馏与稀疏化——从软标签到结构化剪枝的压缩全景

#剪枝#面试
RzenEmbed: Towards Comprehensive Multimodal Retrieval

本文提出RzenEmbed框架,解决多模态检索中现有方法对视频和视觉文档支持不足、训练受噪声干扰等问题。通过改进对比学习目标(假阴性样本缓解和难度加权策略)、两阶段训练(多模态预训练+微调)以及多维度优化(可学习温度参数、嵌入提示设计等),实现了文本、图像、视频和视觉文档的统一嵌入表示。在MMEB基准测试中,RzenEmbed取得最优性能,特别是在视频和视觉文档检索任务上表现突出。实验验证了各优化

文章图片
#人工智能#计算机视觉#机器学习
    共 180 条
  • 1
  • 2
  • 3
  • 18
  • 请选择