logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

sglang-omni [多模态大语言模型的推理与评测框架]

【代码】sglang-omni [多模态大语言模型的推理与评测框架]

#语言模型#人工智能#自然语言处理
SGLang 相比 vLLM 的主要优势

如果你的场景涉及多轮对话、结构化输出、大规模 MoE 模型部署或需要 TPU 支持,SGLang 会是更好的选择。如果你的场景涉及多轮对话、结构化输出、大规模 MoE 模型部署或需要 TPU 支持,SGLang 会是更好的选择。v0.3: DeepSeek MLA 快 7x,torch.compile 快 1.5x。v0.2: Llama3 服务速度优于 TensorRT-LLM 和 vLLM。大

#人工智能#python#pytorch +1
sglang-omni [多模态大语言模型的推理与评测框架]

【代码】sglang-omni [多模态大语言模型的推理与评测框架]

#语言模型#人工智能#自然语言处理
kubeedge是如何实现类似kubernetes的探针机制的?

为了探测其他节点Pod中容器的健康状态,k8s提供了以下三种探活方式:HTTPTCPExec命令HTTP方式就是通过容器的IP地址和端口号及及路径调用HTTP Get方法,如果响应的状态码在200到400之间,就认为容器状态健康。TCP通过容器的IP地址和端口号执行TCP检查,如果端口号能被访问,则认为容器状态健康。Exec:在容器中执行一个命令,如果该命令的退出码为0,则表明容器健康。那么kub

#kubernetes
DeepSpeed ZeRO 优化

ZeRO 的本质是将数据并行训练中优化器状态、梯度、参数三类冗余沿 rank 维度分片存储,通过 reduce_scatter/allgather 在需要时重建,将显存从O16ΨO(16\Psi)O16Ψ降至O16ΨNO16Ψ/N,同时保持与 DDP 相当的通信量,是目前训练千亿级大模型最主流的显存优化方案。

#python#pytorch#transformer +1
RLlib 学习指南

自定义 Environment:实现 Gym 接口或继承gym.Env,并在 config 中通过env注册或传入 callable。自定义模型:继承 RLlib 的TFModelV2或使用注册 PyTorch/TF 模型。自定义策略:在高级场景(多智能体、特殊 loss)下可实现自定义 Policy 类并在 Trainer 中使用。多智能体:通过接口或在 config 中设置multiagent

#人工智能#pytorch#transformer +1
SGLang 相比 vLLM 的主要优势

如果你的场景涉及多轮对话、结构化输出、大规模 MoE 模型部署或需要 TPU 支持,SGLang 会是更好的选择。如果你的场景涉及多轮对话、结构化输出、大规模 MoE 模型部署或需要 TPU 支持,SGLang 会是更好的选择。v0.3: DeepSeek MLA 快 7x,torch.compile 快 1.5x。v0.2: Llama3 服务速度优于 TensorRT-LLM 和 vLLM。大

#人工智能#python#pytorch +1
verl 代码库学习指南

verl(Volcano Engine Reinforcement Learning)是字节跳动开源的、面向 LLM 后训练(Post-Training)的强化学习框架,是HybridFlow 论文的开源实现。核心目标灵活支持多种 RL 算法(PPO、GRPO、DAPO 等)高效集成主流 LLM 训练/推理框架(FSDP、Megatron-LM、vLLM、SGLang)支持灵活的 GPU 资源分配

#深度学习#pytorch#transformer +1
verl 代码仓库分析总结

verl(Volcano Engine Reinforcement Learning for LLMs)是由字节跳动 Seed 团队发起、社区共同维护的一个面向大语言模型(LLM)的强化学习训练框架。它是HybridFlow论文的开源实现,已被 EuroSys 2025 收录。通过 HybridFlow 架构,将 RL 算法的灵活性与分布式训练的高性能有机结合。

#人工智能#深度学习#pytorch +2
PyTorch FSDP:大模型分布式训练的工业级分片并行方案

全分片数据并行(FSDP):将模型参数、梯度、优化器状态均匀分片到各个 GPU,每个 GPU 仅存储部分分片,训练时按需拼接完整参数,用完即释放的并行方案;DDP(分布式数据并行):传统数据并行方案,每个 GPU 存储完整模型副本,反向传播时通过 AllReduce 同步梯度,仅适用于中小模型;延迟初始化:先在虚拟 “伪设备” 上构建模型框架、记录初始化操作,再将模型拆分为小块逐一对齐到真实 GP

#深度学习#人工智能#pytorch +1
    共 16 条
  • 1
  • 2
  • 请选择