
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
在此基础上,用高质量的过程级标注数据训练 PRM,则相当于一种“基于 ORM 的微调”。此外,Athena-PRM 在 VisualProcessBench 上达成了最新的 SoTA(state-of-the-art)结果,相比此前的 SoTA 提升 3.9 F1,说明其在精确判别中间推理步骤正确性方面具有强大的能力。特别是,当使用 Qwen2.5-VL-7B 作为策略模型时,在Test-Time
与真实 IDE 场景的高适配性:得益于 256k 上下文长度以及对多种 scaffold 模板的适配能力,模型可以无缝接入多种 CLI / IDE 平台(如 Claude Code、Qwen Code、Qoder、Kilo、Trae、Cline 等),覆盖丰富的开发环境。- 先进的 Agentic 能力:通过精心设计的训练流程,模型在长链路推理(long-horizon reasoning)、复杂
通过解决特征通道中被忽视的冗余,并采用“剪枝与恢复”的策略,SparK 在保持模型精度的同时,相比传统方法减少了超过 30% 的 KV 缓存存储。在 解码阶段,SparK 利用 F 和从缓存分布中采样来重建被剪枝的通道,然后执行标准的完整注意力计算。图 1:示意性比较 (a) 完整 KV 缓存,(b) 基于淘汰的 KV 压缩,(c) 基于结构化通道剪枝的 KV 缩减,以及 (d) 我们提出的。通过
当代码走入现实,当复杂的模型遇见AMD的软硬件全栈支持,具身智能的落地不再是远在天边的Demo,而是触手可及的未来。3月28日至29日,由硅谷团队 MakerMods 发起,集结了来自国内及硅谷机器人领域众多社区代表、KOL及专业媒体的 “MakerMods具身智能 × OpenClaw 黑客松” 在深圳南山区火热展开。这种“统一内存、从边缘到云端”的模仿学习方案,在现场得到了参赛团队的极高反馈,
原文作者:Zijun Wei, Huaqiang Fang, AIG摘 要本文详细呈现了百度 ERNIE-Image 文生图大模型在 AMD Radeon AI PRO R9700(RDNA 4,32 GB GDDR6)上的部署与推理验证。
1. 从AMD Developer Cloud打开:https://amd-ai-academy.com/github/ROCm/gpuaidev/blob/main/docs/notebooks/fine_tune/qwen_image.ipynb。Linux官方支持系统要求:https://rocm.docs.amd.com/projects/install-on-linux/en/lates
utm_source=cn-ai-dev-hub&utm_medium=direct&utm_campaign=adp-aig&utm_term=join),查看预选赛阶段的参考 kernel,并通过 Popcorn CLI 完成结果提交。决赛选手将聚焦于所选LLM任务的端到端推理优化,包括DeepSeek-R1与Kimi K2.5,目标是在AMD GPU上实现标准化LLM推理基准的突破性性能。参
基于以上优化与调优,AMD GPU 在 DeepSeek FP8 的分布式推理性能(InferenceX v2)在 7 天内获得显著提升,覆盖 1K/1K 与 8K/1K 两类场景。InferenceX 作为我们软件栈迭代速度的“试炼场”,用可复现的工程改进来验证端到端推理的提速。我们直接与vLLM、SGLang 集成,确保与标准开源工作流的即时兼容,同时在内核、通信与并行策略上持续优化。例如,我
我们在Qwen3-32B 的 TP=2 设置下,基于 ROCm 的 AITER 框架[9],对这些规则进行了测试,并将“智能体生成的启发式”与 AITER 的“默认启发式”以及“离线调优启发式”做对比。本文介绍如何使用面向 AI 的高效内核生成(Generating Efficient AI-centric Kernels,GEAK)智能体对 HIP 代码进行自动化优化,展示 GEAK 的智能体流
如果你关心具体部署策略和性能调优实践,可以参考以下相关文章:多模态推理加速(一行配置的优化)[4],MoE 并行策略(TP/DP/PP/Expert Parallelism 指南)[5], vLLM 0.9.x 在 AMD GPU 上的性能调优实践 [6]。在vLLM-omni 发布当天,社区就确保 AMD 用户“首发同享”:vLLM-omni 从一开始就为 AMD ROCm GPU 提供了稳定、








