登录社区云,与社区用户共同成长
邀请您加入社区
前面几个问题讲的都是「混合调度」(Prefill 和 Decode 在同一个 GPU 上混合执行)。V1 的统一 Token 调度 + Chunked Prefill 已经解决了大部分问题:长 prompt 被切成小块,不会一次性占光 budget,Decode 请求不会被完全阻塞。但"不会被完全阻塞"不等于"没有影响"。Step N 的 GPU 批次:│ 请求A: 算 prompt 的第 0~2
本文聚焦2026年算法工程师面试中关于大模型(LLM)核心技术的六大必考方向:预训练、微调、推理优化与显存管理。内容涵盖GPT与BERT的核心区别、LoRA微调原理、Prompt Engineering技巧、RAG流程与幻觉问题、KV Cache机制以及vLLM中的PagedAttention技术。旨在为面试者提供系统性的知识梳理与深度解析。LoRA是一种用于大模型参数高效微调(Parameter
系列文章中篇。上篇解决了环境、基线和 Profile 的可信度问题;这一篇进入算子层,记录专用 Prefill Attention、Q10/Q20 Query 复用、Gate/Up Triton GEMV,以及一批看起来合理但最终没有采用的实验。
S曲线=楼梯坡度很缓慢,不会摔倒。缓停:慢慢走下楼梯,不是直接跳下来。AccStep数组 = 楼梯。
数字滤波器 C 语言实现库,包含 FIR滤波器、IIR滤波器、自适应滤波器、多速率滤波器 等常用算法,适用于嵌入式系统、信号处理、音频处理等场景。
Q @ K.TQ @ K.T自动求导(Automatic Differentiation, Autograd)是深度学习框架的核心功能,它能够自动计算函数的梯度,无需手动推导和编写梯度计算代码。只跑一次前向(一张计算图),但是要从输出端执行≥2 次梯度回传就必须连续多次 backward + retain_graph=True。普通单 Loss 深度学习训练完全碰不到这个需求。info]- 训练循
如何在低端安卓设备上实现实时AI美颜? 当前安卓市场仍有大量骁龙6xx/7xx等低算力设备,面临高端AI影像算法与硬件性能的矛盾。本文提出分层优化方案:1)算法裁剪,包括采用轻量化模型(MobileNet)、INT8量化、传统Haar检测与色彩概率模型结合;2)工程优化,通过异构计算分配(CPU+GPU+DSP)、ROI局部渲染、分辨率动态调整及内存复用技术;3)实测数据显示,该方案在骁龙660等
涵盖机密计算、零信任、AI 安全、数据安全态势管理(DSPM)、API 安全、供应链安全等。编号类型领域子领域问题【含硬件/软件/电路电子/集成电路/芯片/数据加密/信息加密/热/光/电/力/几何/拓扑/电路/时序/器件物理/半导体/射频/其他】问题的数学分析(含逐步推理)参数列表及边界范围及数值范围关联知识CS-647安全PaaS机密计算:TEE 内数据持久化与 sealed storage硬件
《HMLVISION工业AI视觉检测系统技术白皮书摘要》 苏州华镁莱电子科技发布的HMLVISION系统,实现了工业视觉检测从"能看见"到"能思考、能自适应、能闭环"的跨越。针对当前工业视觉领域存在的训练中断、标注成本高、部署适配难等核心痛点,系统创新性地开发了四大核心技术:1)元数据自修复的断点续训机制,将模型迭代效率提升200%;2)基于SAM的智能标注
GPS 单点定位源代码(C语言实现)
随着互联网技术的飞速发展和社交媒体的普及,用户生成内容(User Generated Content, UGC)呈现爆炸式增长。在影视行业,各大平台如豆瓣、IMDb、烂番茄等每天都会产生海量的电影评论数据。这些评论数据蕴含着观众的真实态度和情感倾向,对于制片方、发行方、市场研究人员以及普通观众都具有重要的参考价值。传统的影评分析方法主要依赖于人工阅读和统计,这种方法不仅效率低下,而且难以全面、客观
原生格式是模型训练完成后最原始的输出,完全绑定训练框架。PyTorch 的.pt.bin、TensorFlow 的.ckpt/SavedModel 都属于这一类。它们的定位是服务于训练、微调和科研,而非直接部署。原生格式的核心特点可以用三个词概括:松散、依赖、未优化。"松散"指的是除了核心权重数组之外,还附带大量训练辅助信息;"依赖"指的是数组的解析必须依赖原始训练框架和模型结构代码;"未优化"指
《本地AI美颜SDK技术解析:从云端到终端的算法革命》 摘要:本文深入探讨了AI美颜技术从云端向本地迁移的技术趋势与实现路径。随着移动端算力提升,本地化处理解决了云端方案的三大痛点:网络延迟、隐私风险与持续成本。核心技术突破包括:1)基于场景自适应的色彩引擎实现一键调色;2)中性灰磨皮算法通过频域分离保留皮肤质感;3)分块处理策略实现全尺寸RAW文件的毫米级处理。针对老旧设备,采用INT8量化、算
暗通道先验(Dark Channel Prior, DCP)去雾算法实现,包含导向滤波优化、自动大气光估计、色调映射等核心技术
摘要:苏州华镁莱电子科技有限公司开发的HML-Vision深度学习训练工具,创新性地实现了工业AI视觉检测中的视频标注完整工作流。该系统包含视频抽帧、模型预标注、HML格式标签生成和视频合成四大核心模块,解决了传统视频标注效率低、一致性差的问题。技术亮点包括流式视频处理、批量模型推理、自适应阈值算法和高效内存管理,标注效率较人工提升20-30倍。该方案填补了市场空白,支持工业级大规模视频数据标注需
本文介绍了按键检测的实用方法,重点解决抖动误触发和功能扩展问题。核心方案包括:1)采用边沿检测避免电平抖动干扰;2)非阻塞式20ms消抖延时处理;3)状态机实现单击/长按识别(短按释放触发,长按持续判断);4)提供可扩展架构支持双击等高级功能。代码示例展示了基于tick计时和状态切换的实现逻辑,强调通过KEY_IDLE/DEBOUNCE/PRESS/HOLD状态转换确保检测可靠性,其中长按采用持续
指纹识别技术是生物特征识别领域中最为成熟的一门应用技术,具有悠久的历史。长期以来,指纹识别技术主要应用于刑事侦查与司法鉴定领域,不被大多数人所了解。计算机与信息处理技术的飞速发展,为这门历史悠久的应用技术开拓了更为广阔的市场,指纹识别技术与相关产品越来越多地应用于民用市场。
概念一句话解释ROP管线末端的光栅操作处理器,负责混合、Late Z、写回帧缓冲Coutα⋅Csrc1−α⋅CdstCoutα⋅Csrc1−α⋅Cdst排序缓冲区ROP 内缓冲乱序到达的 Quad,按图元 ID 重新排序后输出DRAM 页约 64 字节 = 16 像素(32bit),Tile 大小对应于此帧缓冲 Tile 存储像素不按行存储,按 Tile 打包,配合 DRAM 页最大化带宽颜
BME280是Bosch Sensortec推出的一款集成温度、气压和湿度测量的环境传感器,凭借±0.5°C的温度精度、±1 hPa的气压精度和±3% RH的湿度精度,成为气象站、无人机高度控制、智能家居等场景的首选。与DHT系列或BMP280相比,BME280的核心优势在于出厂校准——每颗芯片在Bosch工厂经过精密校准,将26字节的校准系数写入ROM。这意味着开发者无需手动校准,只需正确读取并
摘要:Claura是一个轻量级AI对话模型,通过模型蒸馏、架构精简和FP16量化等技术,将2亿参数压缩至400MB,支持纯CPU推理,兼容树莓派和老旧设备。它舍弃GPU加速,追求广泛兼容性,但性能受限,适合基础对话场景。
本文探讨了生成对抗网络(GAN)在工业界的核心应用,重点分析了超分辨率、人脸合成与数据增强三大领域。文章首先梳理了超分辨率技术的发展历程,从传统插值方法到基于GAN的SRGAN、ESRGAN和Real-ESRGAN,并介绍了感知损失函数如何解决传统MSE损失导致的模糊问题。在人脸合成方面,文章讨论了DeepFake技术原理及其检测方法。此外,还展示了GAN在医疗影像增强和数据稀缺场景中的应用价值。
本文分享了破解文字点选验证码的经验:1)通过captcha_id生成乱序映射数组还原图片顺序,注意列映射方向;2)重点解决了加密参数ac长度不足的问题,从153字节补到900多字节才能通过严格站点验证。文章提供了拼图代码和关键思路,提醒开发者注意这两个易错点。最终验证通过证明参数长度和完整性对验证码破解至关重要。
摘要 字节跳动旗下产品(今日头条、西瓜视频、番茄小说、懂车帝)采用统一账务底层架构,与抖音、巨量体系共享300至尊权限和全链路审计系统。各产品功能覆盖如下: 今日头条:支持专栏付费、问答赏金、资讯广告收益管理 西瓜视频:处理中视频分成、付费观影和直播账务 番茄小说:管理章节付费、会员订阅和作者打赏分成 懂车帝:整合汽车经销商推广、付费咨询和广告结算 系统特性包括:资金池统一管控、九级熔断机制(永久
本文深入探讨了RAG(检索增强生成)系统的优化策略,重点介绍了混合检索(Hybrid Retrieval)与重排序(Reranking)技术。针对传统RAG系统在语义漂移、关键词缺失等场景下的不足,提出了一种四阶段优化架构:多路召回(向量检索+BM25)、结果融合(RRF算法)、精排重排序(Cross-Encoder)和Top-K筛选。通过稠密检索与稀疏检索的优势互补,结合重排序技术,实验显示检索
本文面向海光 DCU 的编程初学者,全程以一套真实的气候态海温第 90 百分位计算程序为主线,从零开始介绍 DCU 上的 HIP 编程。每引入一个概念(线程、显存、stream、核函数),都立即用 SST 程序中的对应代码来演示。读者完成本文后,应能理解 SST 程序的完整 GPU 计算流程,并具备将类似气候数据计算任务移植到 DCU 的能力。关键词:海光 DCU;HIP 入门;SST 气候态;百
摘要 本期专栏聚焦农业遥感AI技术,针对耕地与作物识别的行业痛点,提出双分支网络解决方案。方案通过地块分割与作物分类双任务协同,融合时序、纹理、光谱特征,有效解决裸地与耕地混淆、地块粘连、作物错分等核心难题。关键技术包括边界感知U-Net优化、干扰剔除模块和批量后处理,支持耕地精准提取、非农干扰自动剔除、多作物分类及批量制图。代码提供完整模型架构与干扰净化实现,可适配全国不同地貌的耕地监测需求,满
这一段定义了桌子上不同物品的初始放置区域basket_init_region:篮子应该放在桌子的哪个位置。alphabet_soup_init_region、tomato_sauce_init_region 等:每种物品的初始放置范围(x, y 坐标区间)。contain_region:篮子里面的“可容纳区域”。这些区域保证了任务的可重复性(每次初始化位置都在一定范围内)。lisp(:fixtur
本文是Python高性能编程系列的收官篇,通过一个图像处理流水线的综合实战案例,展示了从纯Python实现到最终120倍性能提升的完整优化过程。案例处理1000张512×512灰度图像,包含归一化、高斯滤波、边缘检测、直方图均衡化和特征提取五个步骤。作者首先建立纯Python基准实现,然后逐步应用系列前九篇介绍的优化技术:NumPy向量化、内存优化、Numba JIT编译、多进程并行和流水线架构优
本文探讨了边缘AI技术在内河桥梁防撞预警系统中的应用优势与技术方案。传统云端架构存在时延高、网络依赖强、成本高等问题,而边缘AI通过本地化部署实现数据实时处理,显著提升系统性能:预警时延从1-2秒降至200毫秒以内,支持断网运行,带宽需求降低80%以上。文章详细阐述了边缘AI的多源数据融合、分级预警、离线自治等核心功能。
这份笔记重写自 Harvard NLP 的 The Annotated Transformer,并使用官方 GitHub 中的源码作为讲解对象。源码块按原文代码顺序保留,讲解部分用中文重新组织,不做英文逐字翻译。读这篇时建议同时打开前一篇Transformer详解,前一篇偏“看图理解 Transformer 是什么”,这一篇偏“看代码理解 Transformer 怎么跑起来”。最重要的学习路线是:
ROC(变化率指标)是一种动量震荡指标,通过计算当前价格与特定周期前价格的百分比变化来衡量价格变动速度。其核心公式为:(当前价 - N周期前价)/N周期前价 × 100。ROC以0轴为多空分界线,正值表示上涨动量,负值表示下跌动量。主要应用包括: 零轴穿越判断多空转换 结合历史波动范围识别超买超卖 价格与指标的背离预警趋势反转 数值变化反映趋势加速度 可添加移动均线生成信号线交叉信号 ROC优势在
前置工作是V9v3(3.15M参数的中文嵌入模型)的边缘部署测试与生成能力验证,当前工作是在此基础上设计更轻量的模型,并规划一个以"信息素场"为通信机制的Agent OS原型。- 仅嵌入部分(V9v3一次forward):2.84ms,约**0.014mAh**——一块200mAh电池可做约**14,000次**| 单token预测 | **收敛**(Loss 8.1→2.27,准确率81.5%)
这是一篇面向非专业开发者的 LLM 黑话科普文 ,用通俗语言解释大语言模型领域的核心概念及工程实现。每个概念都配有实现思路、伪代码和调优要点,帮助读者从“听懂”进阶到“能用”。
dataclass"""缓存配置"""block_size: int = 16 # 每个缓存块包含的 token 数max_cache_blocks: int = 4096 # 最多缓存的 KV Block 数eviction_policy: str = "lru" # 淘汰策略: "lru" 或 "lfu"enable_kv_cache: bool = True # 是否同时启用常规 KV Ca
地平线BPU部署核心:1. BPU是CNN专用加速器, 不是通用NPU2. 天工开物工具链是必经之路3. YOLOv8适配关键: C2f拆解 + 检测头简化4. 混合精度: backbone INT8 + head FP165. 能效比是BPU的最大优势(32-39 FPS/W)选型建议: 追求能效选地平线, 追求生态选Jetson地平线BPU在能效比上有着显著优势,特别适合对功耗敏感的边缘场景。
SGM 由 Hirschmüller 2005 年的经典论文提出,核心思想是:沿多个方向做 1D 动态 programming,近似全局能量最小化,既保留全局方法精度,又规避了全局方法 O(N²) 的恐怖复杂度。
本文介绍了NS航司验证码破解的技术方案,主要针对六种随机下发的滑动验证码类型(Silder/CURVE2/CURVE/WORD/MOBIE/Silder2)。方案包含三个关键环节:1) 通过接口分析获取验证码背景图;2) 采用图像处理技术(灰度化、降噪、边缘检测等)定位缺口位置;3) 模拟人类滑动轨迹(变速移动+随机抖动)。该方案通过结合缺口检测(60%)和局部方差分析(40%)的投票机制,识别准
EEG 脑电信号预处理与单次提取 技术方案,涵盖信号预处理流水线、特征提取算法、单次 trial 检测、实时实现以及代码示例。适用于 BCI(脑机接口)、癫痫检测、睡眠分期、神经反馈 等应用场景。
MOM动量指标技术分析摘要(149字) MOM动量指标通过计算当前价与N周期前价格的差值(△Price)来量化趋势速度。核心用法包括:1)零轴穿越作为基础买卖信号;2)数值正负判断多空趋势强度;3)结合历史极值识别超买超卖;4)价格-MOM背离捕捉反转机会。该指标具有计算简单、信号直观的特点,常与MACD、RSI等指标配合使用。需注意MOM无固定波动区间,参数设置(默认10周期)需根据交易品种调整