登录社区云,与社区用户共同成长
邀请您加入社区
本文探讨了一种在企业内网部署DeepSeek-V4大模型的低成本高性能方案。针对FP16全精度推理需要1.3TB显存的难题,提出基于4张RTX 4090(96GB显存)的多卡工作站解决方案,通过张量并行实现INT8精度推理,效果接近FP16。文章详细拆解了硬件配置(联想ThinkStation PX工作站)、分布式推理架构(GPU分工策略)和vLLM张量并行实现,对比了单卡A100与多卡4090的
从一手交付经验出发,用 30 秒显存口算法、三场景决策框架、GPU 量化与 vLLM 调优细节,算清本地部署大模型"服务器 vs 工作站"的真正分界线,附成本测算模板与四条避坑经验。
很多人学完 Self-Attention、QKV、FFN 之后,一打开 vLLM / SGLang 源码,立刻懵了。
[Bug已解决] cholesky_solve 批处理多 batch CUDA float64 在 ROCm gfx942 上数值不接近解决方案
摘要: 量化通过将浮点数转换为整数来优化AI模型性能,核心公式为 ( q = \text{round}((x - \text{min}) / S) ) 和反量化 ( x' = S \times q + \text{min} )。其中,( S )(步长)由数据范围决定,例如FP32转INT8时,( S \approx 0.00784 )。量化虽会损失少量精度(如0.5→0.497),但显著提升计算效
本文基于YOLOv5算法设计了一个口罩佩戴检测系统,旨在通过深度学习技术提升公共场景下的疫情防控效率。系统采用850张标注数据(包含佩戴口罩、未正确佩戴和未佩戴三类),通过数据增强和80/20划分训练集与验证集。详细阐述了YOLOv5网络结构、训练流程及预测实现,并展示了包括准确率、召回率等性能指标。实验结果表明,该系统能有效识别口罩佩戴状态,具有实际应用价值。最后通过PyQt实现了图形化交互界面
Python 性能优化应遵循"测量优先"原则,用性能分析工具定位瓶颈后再针对性优化。四层优化策略(算法→向量化→内存→编译)按投入产出比排序,应从低层向高层逐步尝试。向量化是投入产出比最高的优化手段,能将循环开销下沉到 C 层;Numba 适合纯数值计算的热点函数;多进程适用于计算密集且 GIL 受限的场景。每次优化都需验证收益并评估可读性代价,避免过早优化与过度优化。建议在项目中建立性能基准测试
直接可用的AOD-Net图像去雾实现,基于PyTorch框架,开箱即用。包含完整模型定义(model.py)、训练脚本(pono_train.py)、测试脚本(test.py)和简化版推理脚本(test_pytorch.py)。提供已转换的预训练权重(AOD_Net.caffemodel),支持加载后立即对雾霾图像做去雾推理;也支持在自定义数据集上重新训练或微调。资源包内置结构化目录:data存放
今日候选池 89 篇,硬过滤 + LLM 打分后通过评估 7 篇。
摘要:苏州华镁莱电子科技有限公司开发的HML-Vision深度学习训练工具,创新性地实现了工业AI视觉检测中的视频标注完整工作流。该系统包含视频抽帧、模型预标注、HML格式标签生成和视频合成四大核心模块,解决了传统视频标注效率低、一致性差的问题。技术亮点包括流式视频处理、批量模型推理、自适应阈值算法和高效内存管理,标注效率较人工提升20-30倍。该方案填补了市场空白,支持工业级大规模视频数据标注需
将答题卡区域拉正为矩形,转为灰度图,然后使用 OTSU 自动阈值二值化,并反转(BINARY_INV),使选项涂黑区域变为白色(方便统计白色像素),背景为黑色。检测所有外层轮廓,绘制出来,同时按面积从大到小排序,遍历轮廓,用多边形近似,找到第一个近似为四边形(4 个顶点)的轮廓,即为答题卡外框。遍历每 5 个轮廓(即一道题),对这 5 个轮廓按从左到右排序,对每个选项创建掩码,与二值图做按位与,统
文章摘要: 本文提供了从零实现UNet图像分割模型的完整指南。首先介绍了环境配置要点,强调使用Python 3.8/3.9和虚拟环境的重要性。随后图解UNet的核心结构,重点解析其"U"型对称设计、跳跃连接机制和编解码器工作原理。在数据处理部分,详细说明了图像与掩码的同步预处理方法,并给出自定义Dataset类的实现示例。最后通过模块化编程方式,逐步构建完整的UNet模型,包括双卷积块、下采样层、
一套开箱即用的PyTorch版SRCNN图像超分代码包,支持Windows和Linux系统。包含完整的训练流程(train.py)、数据准备(prepare.py)、推理测试(test.py)以及模块化设计的模型定义(models.py)、数据集封装(datasets.py)和工具函数(utils.py)。提供两个标准H5格式数据集:91-image_x3.h5(用于训练)和Set5_x3.h5(
直接可用的FFDNet图像去噪实现,基于PyTorch框架,覆盖灰度图和彩色图两种处理模式。包内包含模型核心代码(ffdnet.py、model.py)、通用工具函数(utils.py)、示例图像(gray.jpg、color.png)、噪声图像样本(noisy.png)、训练数据(train_data)、验证数据(val)、测试数据集(test_data)、预训练权重存放目录(models)以及
🔥这两年开始毕业设计和毕业答辩的要求和难度不断提升,传统的毕设题目缺少创新和亮点,往往达不到毕业答辩的要求,这两年不断有学弟学妹告诉学长自己做的项目系统达不到老师的要求。并且很难找到完整的毕设参考学习资料。为了大家能够顺利以及最少的精力通过毕设,学长分享优质毕业设计项目提供大家参考学习,今天要分享的是🚩毕业设计深度学习yolo11森林火灾预警烟雾检测系统(源码+论文)🥇学长这里给一个题目综合
本文介绍了DeepSpec训练中的关键数据管道技术——TargetCache与对话模板处理。数据生成流程分为三步:首先下载并标准化开源数据集,其次使用sglang服务重新生成回答以保证数据一致性,最后通过target模型的forward hook机制预计算多层hidden states并缓存至磁盘(约38TB)。核心创新在于将target模型的中间状态预存为缓存,大幅降低训练时的计算开销。文章详细
Transformer是一种序列到序列(Seq2Seq)深度学习模型,专为处理大数据量的序列数据(文本、语音、时序数据等)设计,核心解决传统RNN/LSTM串行计算、长距离依赖建模困难的问题。🏆 并行计算:摆脱RNN串行依赖,适配大数据量高效处理🏆 长距离依赖:自注意力机制精准捕捉全局关联🏆 通用适配:跨NLP/CV/多模态/时序的通用架构🏆 可扩展:支持深层堆叠、海量参数扩展,适配大模型
训练yolov5s(最通用配置)# 自定义数据集训练(替换自己的yaml即可)入门首选YOLOv5:社区成熟、文档齐全、BUG极少,是新手入门、工业落地的最优起点,稳定性优于各类新版YOLO模型场景精准选型:轻量设备用n系列、通用场景用s/m系列、高精度需求用l/x系列,分割分类任务选用专属后缀模型落地核心逻辑:训练用PyTorch原生模型,部署必做模型加速,TensorRT是GPU设备最优部署方
本文探讨了生成对抗网络(GAN)在工业界的核心应用,重点分析了超分辨率、人脸合成与数据增强三大领域。文章首先梳理了超分辨率技术的发展历程,从传统插值方法到基于GAN的SRGAN、ESRGAN和Real-ESRGAN,并介绍了感知损失函数如何解决传统MSE损失导致的模糊问题。在人脸合成方面,文章讨论了DeepFake技术原理及其检测方法。此外,还展示了GAN在医疗影像增强和数据稀缺场景中的应用价值。
大模型微调实战指南:LoRA/QLoRA技术精要 本文系统梳理了大模型微调的核心技术LoRA与QLoRA,重点解析了10个实战痛点: 秩r设置过大导致过拟合 target_modules配置不全影响效果 学习率设置不当拖慢训练 梯度累积缺失降低稳定性 数据格式不规范引发异常 推理前未合并adapter影响速度 显存管理不当导致OOM 训练过程缺少checkpoint保护 评估指标单一失真 生产环境
铁路障碍物目标检测数据集(5500+张图像)发布,包含倒树、岩石等4类铁路安全隐患目标。该数据集支持YOLO等深度学习模型训练,适用于智能铁路巡检系统开发。数据集特点包括:多类别均衡样本、复杂环境场景、高质量标注、标准化划分(训练/验证/测试集)。可应用于铁路安全监控、无人机巡检、智能预警系统等领域,助力提升铁路巡检效率和安全性。
本文介绍了LabVIEW开发者如何利用开源AI工具包提升开发效率,突破传统NI Vision的功能局限。详细对比了LabVIEW ONNX Runtime、TensorRT、OpenVINO和AI视觉工具包的核心优势及适用场景,并提供了从环境搭建到实战项目的完整指南,帮助开发者快速掌握人工智能在LabVIEW中的应用。
日耗 1亿+ Token 建议自建至少 2~4×H100(或 4~8×A100)推理集群,跑 vLLM + INT4 量化开源模型(Llama/Qwen/Mistral),配套 API Gateway + RAG + 监控;硬件 3 年左右摊销后 Token 成本约为公有 API 的 1/10~1/20,适合长期稳定高吞吐工程场景;建议混合架构把最难任务回退云端 API。
系统性分析 FlashAttention 项目的整体架构,涵盖 FA2/FA3/FA4 四代实现的目录分布、Python+C++/CUDA+CuTeDSL 混合架构,以及 FA4 作为活跃开发方向的特点。
文章摘要:本文探讨了深度学习项目中数据增强技术的重要性与应用方法。通过几何变换和色彩调整等操作,数据增强能有效提升模型泛化能力,避免过拟合问题。文章详细介绍了Python环境搭建、基础几何变换实现、色彩空间调整技巧,以及如何构建自定义增强流水线。特别强调了针对目标检测等任务时的同步变换策略,并推荐使用albumentations库实现高效数据增强。这些方法能帮助开发者在有限数据条件下提升模型鲁棒性
轴向编码(分类法):将这些标注的错误归类为不同的、可管理的类别,以识别应用中最主要的痛点(例如,检索上下文不佳、工具使用错误、或语调不当)。编写有针对性的评估:让数据分析过程中发现的模式驱动你的测试策略。构建自动化评估,专门用于捕捉这些观察到的错误,而不是编写通用或任意的测试。回顾真实轨迹:收集具有代表性的用户交互数据集(如果应用是全新的,也可以生成合成数据),并逐一回顾对话,直到不再出现新的见解
YOLO实例分割工业圆形仪表指针读数识别数据集|电力电表电流电压表深度学习视觉实战仓库10472期
本文介绍无人机地表多类别语义分割数据集,配套分割模型训练、推理、可视化全流程代码,开箱即用,快速落地国土/农业/环保低空智能解译系统。