登录社区云,与社区用户共同成长
邀请您加入社区
系列文章中篇。上篇解决了环境、基线和 Profile 的可信度问题;这一篇进入算子层,记录专用 Prefill Attention、Q10/Q20 Query 复用、Gate/Up Triton GEMV,以及一批看起来合理但最终没有采用的实验。
摘要: 量化通过将浮点数转换为整数来优化AI模型性能,核心公式为 ( q = \text{round}((x - \text{min}) / S) ) 和反量化 ( x' = S \times q + \text{min} )。其中,( S )(步长)由数据范围决定,例如FP32转INT8时,( S \approx 0.00784 )。量化虽会损失少量精度(如0.5→0.497),但显著提升计算效
步骤工具输出导出 ONNX.onnx转 TensorRT.engine推理关键点可视化draw_pose骨架图。
平台转换工具推理延迟功耗适用场景JetsonTensorRT3.2ms15W高性能RK3588RKNN8ms5W通用GK7206GMT15ms2W低功耗。
Python 性能优化应遵循"测量优先"原则,用性能分析工具定位瓶颈后再针对性优化。四层优化策略(算法→向量化→内存→编译)按投入产出比排序,应从低层向高层逐步尝试。向量化是投入产出比最高的优化手段,能将循环开销下沉到 C 层;Numba 适合纯数值计算的热点函数;多进程适用于计算密集且 GIL 受限的场景。每次优化都需验证收益并评估可读性代价,避免过早优化与过度优化。建议在项目中建立性能基准测试
今日候选池 89 篇,硬过滤 + LLM 打分后通过评估 7 篇。
随着互联网技术的飞速发展和社交媒体的普及,用户生成内容(User Generated Content, UGC)呈现爆炸式增长。在影视行业,各大平台如豆瓣、IMDb、烂番茄等每天都会产生海量的电影评论数据。这些评论数据蕴含着观众的真实态度和情感倾向,对于制片方、发行方、市场研究人员以及普通观众都具有重要的参考价值。传统的影评分析方法主要依赖于人工阅读和统计,这种方法不仅效率低下,而且难以全面、客观
原生格式是模型训练完成后最原始的输出,完全绑定训练框架。PyTorch 的.pt.bin、TensorFlow 的.ckpt/SavedModel 都属于这一类。它们的定位是服务于训练、微调和科研,而非直接部署。原生格式的核心特点可以用三个词概括:松散、依赖、未优化。"松散"指的是除了核心权重数组之外,还附带大量训练辅助信息;"依赖"指的是数组的解析必须依赖原始训练框架和模型结构代码;"未优化"指
本文介绍了DeepSpec训练中的关键数据管道技术——TargetCache与对话模板处理。数据生成流程分为三步:首先下载并标准化开源数据集,其次使用sglang服务重新生成回答以保证数据一致性,最后通过target模型的forward hook机制预计算多层hidden states并缓存至磁盘(约38TB)。核心创新在于将target模型的中间状态预存为缓存,大幅降低训练时的计算开销。文章详细
本文介绍了三种灰度图像增强方法及其实现:1) 反色处理(s=255-r)可将正常光照图像转为底片效果;2) 对数变换(s=c·log(1+r))通过压缩高灰度值、拉伸低灰度值来改善低照度和过曝图像;3) 线性拉伸和直方图均衡化分别通过线性映射和累计分布函数映射增强图像对比度。实验采用OpenCV和Matplotlib实现,包含图像处理、可视化对比(原图/处理图/直方图)和结果保存三个环节,系统展示
平台延迟FPS功耗适用场景RK3588 NPU12ms835W低功耗边缘5.2ms19215W高性能边缘RTX 40901.5ms667450W服务器。
梯度检查点技术通过牺牲少量计算性能换取显存优化。原生模式下(关闭时),前向传播会保存所有中间激活值,导致显存占用爆炸式增长(尤其长序列大batch时)。开启后,仅存储关键节点激活值,反向传播时临时重算所需数据,显存峰值可降低30%-50%,但训练速度会减慢10%-20%。该技术与梯度累积无关,建议显存经常爆满时开启,配合use_cache=false可进一步节省显存。LoRA微调场景下不影响参数更
预训练模型 + 你的数据 = 你的专属模型大模型在训练时已经"读"了海量互联网文本,具备很强的通用能力。但如果你想让它做特定领域的事情——比如当客服机器人、写医疗报告、生成法律合同——通用模型就不太够用了。微调就是拿一个已经训练好的模型,再用你自己准备的数据继续训练它,让它学会你的"行话"和"规矩"。就好比一个什么都会的实习生,你给他一些业务文档和案例培训几天,他就能上手干活了。LoRA已经成为微
• Transforms 是数据进入模型前的加工车间。• 预处理让输入规范,数据增强让模型泛化。• 训练集可以随机,验证/测试集必须稳定。• v2 transforms 适合复杂任务,可以同步处理 image、box、mask、video。• 源码主线是 Dataset → Compose → Transform.forward → make_params → transform → functi
本文深入探讨了RAG(检索增强生成)系统的优化策略,重点介绍了混合检索(Hybrid Retrieval)与重排序(Reranking)技术。针对传统RAG系统在语义漂移、关键词缺失等场景下的不足,提出了一种四阶段优化架构:多路召回(向量检索+BM25)、结果融合(RRF算法)、精排重排序(Cross-Encoder)和Top-K筛选。通过稠密检索与稀疏检索的优势互补,结合重排序技术,实验显示检索
车端AI技术全景摘要 汽车行业正经历从电动化向智能化转型的关键阶段,车端AI技术成为推动汽车进化为"智能终端"的核心驱动力。本文系统梳理了车端AI的四层技术架构: 芯片层:NVIDIA Orin/Thor、高通Snapdragon Ride等地平线等AI芯片提供254-2000 TOPS算力,但内存带宽和数据搬运效率是实际瓶颈。 感知层:经历了从2D检测到BEV多传感器融合,再到Occupancy
本文介绍了基于AI遥感技术的自然灾害智能解译方法,重点针对洪涝、滑坡、火灾三大灾害的自动识别与评估需求。针对灾害区域纹理杂乱、边界模糊、样本稀缺等挑战,提出多特征融合的轻量化Transformer分割模型,结合光谱指数增强和纹理特征提取技术,实现灾害区域的精准分割。文章详细阐述了从数据预处理到模型训练、灾害识别、矢量输出的全流程解决方案,并提供了可运行的Python代码示例,包括通用分割模型架构和
单神经元自适应 PID
这一段定义了桌子上不同物品的初始放置区域basket_init_region:篮子应该放在桌子的哪个位置。alphabet_soup_init_region、tomato_sauce_init_region 等:每种物品的初始放置范围(x, y 坐标区间)。contain_region:篮子里面的“可容纳区域”。这些区域保证了任务的可重复性(每次初始化位置都在一定范围内)。lisp(:fixtur
从向量加法的简单例子出发,你已经掌握了 DCU 编程的基本骨架。接下来可以进入更复杂的实战场景。在实际集群中,不同节点可能安装了不同的 DTK 版本。DCU 的软件栈称为。DCU 集群通常通过。
关键点索引与连接关系:│ 索引 │ 名称 │ 连接关系 ││ 0 │ 鼻子 │ → 左眼(1), 右眼(2) ││ 1 │ 左眼 │ → 鼻子(0), 左耳(3) ││ 2 │ 右眼 │ → 鼻子(0), 右耳(4) ││ 3 │ 左耳 │ → 左眼(1) ││ 4 │ 右耳 │ → 右眼(2) ││ 5 │ 左肩 │ → 右肩(6), 左肘(7) ││ 6 │ 右肩 │ → 左肩(5), 右肘(
本文通过Fashion-MNIST数据集实验,研究图像分类模型在颜色分布变化下的泛化能力。实验使用二值化黑白图像训练,测试时采用随机彩色背景+前景的OOD测试集,对比随机森林、CNN及颜色随机化增强CNN的性能。结果显示传统方法在颜色偏移下准确率显著下降,而颜色增强策略能有效提升模型对未见颜色的适应性。实验设计严格控制变量,重点关注颜色单一因素的泛化影响,为OOD问题提供了简洁有效的分析框架。核心
输入:10,950 个 NetCDF 格式的逐日海表温度文件(30 年 × 365 天),每个文件 1,166 × 721 网格点计算:对夏季(6–8 月)92 天,以 11 天滑动窗口(±5 天)统计 30 年间每个像素点的气候态均值(Clim)和 90% 分位数(P90)输出:92 个 NetCDF 文件验证:与参考数据逐日交叉验证 RMSE这是一个典型的数据密集型 + 尴尬并行任务——大量
模型竞争,正在从更聪明转向更实用。模型能不能独立干活,活干得好不好,干活的成本能不能承受,出了岔子能不能自己兜回来,这些都是用户真正在乎的。阶跃星辰发布了Step 3.7 Flash,一款196B参数、11B激活的高效Agent模型,最高支持400 TPS推理速度,定位直指真实场景下的智能体效率。这可能是目前同等规模下,Agent能力最均衡的Flash模型。