logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

hixl - 让分布式训练“零拷贝“通信

想象一下,你和朋友一起做PPT,但是每次改一页,都要把整个PPT文件发过来发过去。效率低吧?要是能只传"改动的那一页",甚至"改动的那个文本框",效率不就上去了?分布式训练里的通信,以前就是这么低效。hixl 要解决的,就是这个问题。

文章图片
#分布式
昇腾NPU上的FlashAttention:让大模型“算得快“又“记得准“

刚接触 FlashAttention 那会,我被一个困惑砸懵了:明明 Attention 机制的计算量已经是 O(n²) 了,业界还在拼命优化它,图什么?直到我看见一组数据才明白——训练一个 1750 亿参数的 GPT-3,光是 Attention 计算就要消耗 60% 的算力。这东西要是跑得慢,整个模型就是摆设。

文章图片
ATB - 让大模型推理“飞“起来

之前帮一个朋友看 Transformer 推理代码,发现一个坑:模型加载成功了,但是推理速度慢得离谱,4096 token 的上下文要跑 30 秒才能出第一个 token。查了半天,发现问题出在 Attention 计算没 fusion。每一层 Transformer Layer 的 QKV 计算、Attention Score 计算、FFN 计算,都是分开调算子的,NPU 的计算单元根本没吃饱。

文章图片
#大数据
asnumpy - 让昇腾NPU和NumPy无缝对接

刚学深度学习那会,最顺手的是 NumPy。各种矩阵运算、广播机制、索引操作,闭着眼睛都能写。后来跑昇腾NPU,发现 NumPy 代码没法直接跑——和np.ndarray不能混用,数据要手动转来转去,烦死了。直到我发现。

文章图片
#深度学习
ATB - 让大模型推理“飞“起来

之前帮一个朋友看 Transformer 推理代码,发现一个坑:模型加载成功了,但是推理速度慢得离谱,4096 token 的上下文要跑 30 秒才能出第一个 token。查了半天,发现问题出在 Attention 计算没 fusion。每一层 Transformer Layer 的 QKV 计算、Attention Score 计算、FFN 计算,都是分开调算子的,NPU 的计算单元根本没吃饱。

文章图片
#大数据
Flutter 状态管理终极指南:从 setState 到 Riverpod 全面对比与实战

37_isDark;// 通知 UI 重建11 }12}3状态管理没有“银弹”,只有“最合适”。理解每种方案的设计哲学,才能在正确场景用对工具。希望本文能帮你跳出“只会 setState”的困境,迈向专业 Flutter 开发!💬 你在项目中用哪种状态管理?欢迎评论区交流!❤️ 觉得有用?

文章图片
#flutter
Flutter 性能优化实战:6 大技巧让你的 App 流畅如丝

优秀的性能源于良好的编码习惯和持续的监控意识。写完功能,跑一遍 DevTools列表用builder,图片加缓存异步放initState,对象提成员让你的 Flutter App 真正做到“快、稳、省”!💬 你遇到过哪些性能问题?欢迎分享解决方案!

文章图片
#flutter#性能优化#javascript
Flutter 工程化实践:大型项目架构设计与 CI/CD 落地

工程化不是“大厂专属”,而是任何追求长期可维护性的团队必备能力。Flutter 的灵活性是一把双刃剑——它允许你快速构建 UI,也容易让你陷入混乱。唯有通过架构约束、自动化工具和团队共识,才能将灵活性转化为生产力。希望本文能为你提供一套清晰、可执行的工程化蓝图,助你打造高质量、可持续演进的 Flutter 应用。💬互动提问你在 Flutter 网络请求中遇到过哪些坑?欢迎评论区交流!

文章图片
#flutter#ci/cd
Flutter 性能优化实战:从 30fps 到 60fps 的完整路径

Flutter 的高性能不是“开箱即用”的,而是建立在开发者对渲染机制的理解与规范实践之上。精准定位性能瓶颈;针对性实施优化;建立长效监控机制。每一次 1ms 的优化,都是对用户体验的尊重。从今天开始,让你的 Flutter 应用真正达到 60fps 的丝滑体验!💬互动提问:你在 Flutter 网络请求中遇到过哪些坑?欢迎评论区交流!

文章图片
#flutter
    共 91 条
  • 1
  • 2
  • 3
  • 10
  • 请选择