
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
你的显卡能跑多少算子?用 55 个检查项,给 PyTorch GPU 环境做一次冒烟测试
所以"输出还在 cuda 上"这个结论的含金量,其实比"证明该算子有高性能 GPU kernel"低得多。SDPA 会走数学 fallback,仍在 GPU tensor 上运行,但对长序列、大 batch 的 LLM workload 来说性能差距明显。——这 54 个只是"输出还在 GPU 上",不是"证明有高性能 GPU kernel"。如果你看到有人拿类似的数字说"ROCm 在 Windo
深度学习进阶(八)Swin Transformer
换句话说,DeiT 本身依然是一个全局 attention、无层级结构、内部缺乏局部归纳偏置的模型。中提出的 ViT 的另一变体:的出发点。
你的显卡能跑多少算子?用 55 个检查项,给 PyTorch GPU 环境做一次冒烟测试
所以"输出还在 cuda 上"这个结论的含金量,其实比"证明该算子有高性能 GPU kernel"低得多。SDPA 会走数学 fallback,仍在 GPU tensor 上运行,但对长序列、大 batch 的 LLM workload 来说性能差距明显。——这 54 个只是"输出还在 GPU 上",不是"证明有高性能 GPU kernel"。如果你看到有人拿类似的数字说"ROCm 在 Windo
到底了







