logo
publist
写文章

简介

AI serving 推理/优化/部署

擅长的技术栈

可提供的服务

暂无可提供的服务

[CUDA 优化实战] sgemm - 超越 cuBLAS:带你学会极致优化的矩阵乘法 cuda c++ 实现

本文详细介绍了如何通过CUDA优化实现超越cuBLAS的矩阵乘法(SGEMM)性能。作者从基础实现出发,逐步引入6种优化技术:向量化读写、block tiling共享内存、矩阵转置、swizzle解决bank conflict、写回事务合并和双buffer流水线。在RTX 5060显卡上,最终将4096x4096矩阵乘法耗时从16.59ms优化到13.85ms,超越cuBLAS的14.33ms。文

文章图片
#矩阵#c++#线性代数
白嫖 github action + Gemini 自动化每日精选论文

本文介绍了一个基于GitHub Action和Google AI Studio的AI论文精选工具,可自动从arXiv抓取论文并使用大模型进行评分分类。该工具支持自定义研究领域关键词和arXiv分类,利用Gemini等模型每天处理最多500篇论文,精选各领域最高分论文并生成摘要。项目开源在GitHub,用户可自由配置和扩展功能。

文章图片
#github#人工智能#python
白嫖 github action + Gemini 自动化每日精选论文

本文介绍了一个基于GitHub Action和Google AI Studio的AI论文精选工具,可自动从arXiv抓取论文并使用大模型进行评分分类。该工具支持自定义研究领域关键词和arXiv分类,利用Gemini等模型每天处理最多500篇论文,精选各领域最高分论文并生成摘要。项目开源在GitHub,用户可自由配置和扩展功能。

文章图片
#github#人工智能#python
[CUDA 优化实战] 纯手搓 flash decoding sm120 : 超越 flashinfer.single_decode_with_kv_cache

文章摘要 本文介绍了针对 LLM decoding 场景优化的 flash decoding 实现,对比了 PyTorch native 和 flashinfer 两个基线。作者详细阐述了 kernel 设计思路,包括: 采用 BN=64 的 kv tile 分块策略 配置 128 线程的 block 大小 动态计算 chunk_size 以充分利用 SM 使用 TMA 和 float4 向量化优

文章图片
#性能优化#c++#人工智能 +1
白嫖 github action + Gemini 自动化每日精选论文

本文介绍了一个基于GitHub Action和Google AI Studio的AI论文精选工具,可自动从arXiv抓取论文并使用大模型进行评分分类。该工具支持自定义研究领域关键词和arXiv分类,利用Gemini等模型每天处理最多500篇论文,精选各领域最高分论文并生成摘要。项目开源在GitHub,用户可自由配置和扩展功能。

文章图片
#github#人工智能#python
白嫖 github action + Gemini 自动化每日精选论文

本文介绍了一个基于GitHub Action和Google AI Studio的AI论文精选工具,可自动从arXiv抓取论文并使用大模型进行评分分类。该工具支持自定义研究领域关键词和arXiv分类,利用Gemini等模型每天处理最多500篇论文,精选各领域最高分论文并生成摘要。项目开源在GitHub,用户可自由配置和扩展功能。

文章图片
#github#人工智能#python
到底了