logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Qwen 3.6 在 AMD GPU 的 Day 0 支持

相较前代 Qwen3.5-35B-A3B ,它在 agentic 编程与推理任务上获得显著提升。我们很高兴宣布:阿里巴巴最新的Qwen3.6 系列模型,Qwen3.6-35B-A3B 与 Qwen3.6-35B-A3B-FP8,已在 AMD GPU 实现 Day 0 支持。2. 访问ROCm AI 开发者中心: https://www.amd.com/zh-cn/developer/resourc

AMD GPU 全面支持 Qwen 3.5:性能、上下文长度与多模态的新突破

5] 访问 ROCm AI Developer Hub,了解更多关于在 AMD GPU 上进行 AI 开发的教程、开源项目和技术博客:https://www.amd.com/en/developer/resources/rocm-hub/dev-ai.html?通过在 AMD GPU 上实现 SGLang 与 vLLM 的 Day 0 支持,我们为开发者提供了强大的算力平台和经过优化的软件栈,使其

Day 0 支持 Qwen3‑Coder‑Next:在 AMD GPU 上部署新一代代码大模型

与真实 IDE 场景的高适配性:得益于 256k 上下文长度以及对多种 scaffold 模板的适配能力,模型可以无缝接入多种 CLI / IDE 平台(如 Claude Code、Qwen Code、Qoder、Kilo、Trae、Cline 等),覆盖丰富的开发环境。- 先进的 Agentic 能力:通过精心设计的训练流程,模型在长链路推理(long-horizon reasoning)、复杂

硅谷AI空降深圳 | MakerMods × OpenClaw × AMD具身智能黑客松回顾

当代码走入现实,当复杂的模型遇见AMD的软硬件全栈支持,具身智能的落地不再是远在天边的Demo,而是触手可及的未来。3月28日至29日,由硅谷团队 MakerMods 发起,集结了来自国内及硅谷机器人领域众多社区代表、KOL及专业媒体的 “MakerMods具身智能 × OpenClaw 黑客松” 在深圳南山区火热展开。这种“统一内存、从边缘到云端”的模仿学习方案,在现场得到了参赛团队的极高反馈,

第二十一届中国研究生电子设计竞赛“AMD”赛题预发布(赛题二)

本赛题旨在引导参赛队伍基于 AMD ROCm™软件生态,依托 AMD Radeon™ PRO W系列显卡的算力与显存优势,结合真实科研场景与需求,设计与实现“智能算力赋能科研”的项目方案,展示 AMD 的先进硬件与软件生态在实际工作负载中的性能与工程化能力。在充分利用 ROCm 既有能力的基础上,围绕项目需求实现当前尚未支持的功能,涵盖但不限于:新算法的 ROCm 后端适配与实现、新算子的开发与调

硅谷AI空降深圳 | MakerMods × OpenClaw × AMD具身智能黑客松回顾

当代码走入现实,当复杂的模型遇见AMD的软硬件全栈支持,具身智能的落地不再是远在天边的Demo,而是触手可及的未来。3月28日至29日,由硅谷团队 MakerMods 发起,集结了来自国内及硅谷机器人领域众多社区代表、KOL及专业媒体的 “MakerMods具身智能 × OpenClaw 黑客松” 在深圳南山区火热展开。这种“统一内存、从边缘到云端”的模仿学习方案,在现场得到了参赛团队的极高反馈,

Day 0 支持 ERNIE-Image:在AMD Radeon AI PRO 3.4 安装 Diffusers 及依赖R9700 GPU上部署与验证文生图模型

原文作者:Zijun Wei, Huaqiang Fang, AIG摘 要本文详细呈现了百度 ERNIE-Image 文生图大模型在 AMD Radeon AI PRO R9700(RDNA 4,32 GB GDDR6)上的部署与推理验证。

Qwen-Image 从推理到 LoRA 训练实战教程(AMD GPU × DiffSynth-Studio)

1. 从AMD Developer Cloud打开:https://amd-ai-academy.com/github/ROCm/gpuaidev/blob/main/docs/notebooks/fine_tune/qwen_image.ipynb。Linux官方支持系统要求:https://rocm.docs.amd.com/projects/install-on-linux/en/lates

福利|110万美元奖金池!AMD E2E SpeedRun火力全开,等你刷新推理榜单!

utm_source=cn-ai-dev-hub&utm_medium=direct&utm_campaign=adp-aig&utm_term=join),查看预选赛阶段的参考 kernel,并通过 Popcorn CLI 完成结果提交。决赛选手将聚焦于所选LLM任务的端到端推理优化,包括DeepSeek-R1与Kimi K2.5,目标是在AMD GPU上实现标准化LLM推理基准的突破性性能。参

速度即护城河:AMD GPU 上的推理性能

基于以上优化与调优,AMD GPU 在 DeepSeek FP8 的分布式推理性能(InferenceX v2)在 7 天内获得显著提升,覆盖 1K/1K 与 8K/1K 两类场景。InferenceX 作为我们软件栈迭代速度的“试炼场”,用可复现的工程改进来验证端到端推理的提速。我们直接与vLLM、SGLang 集成,确保与标准开源工作流的即时兼容,同时在内核、通信与并行策略上持续优化。例如,我

    共 30 条
  • 1
  • 2
  • 3
  • 请选择