登录社区云,与社区用户共同成长
邀请您加入社区
为了将 70B 大语言模型的部署成本打下来,我们将线上 vLLM 推理集群的模型权重与激活值从 FP16 全量量化到了 INT8(采用 W8A8 方案)。量化效果立竿见影:单卡 A100-80G 的显存占用直接从 140GB(需 2 卡并行)缩减到了 70GB,单卡即可拉起,推理吞吐量(Tokens/s)提升了将近一倍。然而上线不到两天,客服渠道就接到了多起投诉。在处理复杂代码推导和长文本逻辑分析
FreeRTOS 中邮箱 = 长度为 1 的队列队列:数据流转,读取后数据删除;邮箱:数据常驻,读取后数据保留,支持覆盖更新。区分任务版 API与中断版 API:常规队列函数禁止在中断中调用,中断必须使用xxxFromISR后缀函数。阻塞时间单位:系统节拍,可通过将毫秒转为节拍数。优先级影响:队列阻塞任务的唤醒顺序,严格遵循优先级 > 等待时长规则。内存安全:引用队列 / 指针队列,必须保证内存生
保值、不占栈、生命周期全局;锁死在当前文件,外部不可访问。
本文基于高校《地理数据分析与建模》实验课程完整复现,从原始GPS数据入库、轨迹分段、OD生成、交通小区匹配、OD矩阵到QGIS可视化,全程可直接运行、所有报错一次性解决。适合GIS、交通工程、大数据、地信专业学生做实验、课程设计、毕业设计参考。本次实验完整实现了出租车轨迹从原始数据→数据库→空间分析→OD挖掘→可视化时空数据建库连续轨迹分段OD流生成空间匹配与索引优化OD矩阵制作QGIS专题制图时
防御性编程: 每个可能的故障点都有对应的检测和处理机制优雅降级: 从 Smart Shutdown → Fast Shutdown → Immediate Shutdown 的多级策略自动化恢复: Crash Recovery 无需人工干预,确保数据一致性最小权限: 信号处理器只做最少的工作,复杂逻辑延迟到安全上下文资源隔离: 共享内存、锁、文件句柄等资源都有明确的归属和清理责任这套机制使得 Po
本文探讨了生成对抗网络(GAN)在工业界的核心应用,重点分析了超分辨率、人脸合成与数据增强三大领域。文章首先梳理了超分辨率技术的发展历程,从传统插值方法到基于GAN的SRGAN、ESRGAN和Real-ESRGAN,并介绍了感知损失函数如何解决传统MSE损失导致的模糊问题。在人脸合成方面,文章讨论了DeepFake技术原理及其检测方法。此外,还展示了GAN在医疗影像增强和数据稀缺场景中的应用价值。
在 RAG 私有知识库落地场景中,Zvec 的典型技术落地架构分为四层:文档预处理层、向量化编码层、Zvec 向量存储检索层、大模型问答生成层。Zvec 的诞生精准切入轻量化嵌入式向量检索赛道,基于标准 C++17 从零开发向量检索内核,零第三方系统依赖,编译后仅生成单个可执行文件或者静态链接库,支持 Windows、Linux、macOS、ARM 嵌入式系统全平台编译运行,最低仅需要几十 MB
原作者:Linux教程在Linux显卡驱动领域,图形显示系统是绕不开的核心。今天我打算从DRM入手,结合wiki和自己的开发体会,跟大家拆解这个内核子系统。
EAI1126B-Core-L是灵眸科技研发的一款应用于AIoT领域的核心板。核心板基于瑞芯微的RV1126B处理器设计,集成了4个Cortex-A53及独立的NEON协处理器,支持4K@30fps的 H.264/H.265解码器,还支持4K@30fps的H.264/H.265编码器。引入了新一代完全基于硬件的最大 12M 像素 ISP(图像信号处理器),实现了多种算法加速器,如HDR、3A、LS
最近安装 PostgreSQL 18.4 时,遇到了一个非常奇怪的问题。安装程序最后提示:但是数据库并没有初始化成功,也无法启动 PostgreSQL 服务。PostgreSQL 下载错版本?PATH 有多个 PostgreSQL?环境变量冲突?DLL 冲突?安装包损坏?我也是这样认为的。于是开始了详细排查。真正原因完全不是 PostgreSQL 版本问题。希望这篇文章能够帮助遇到同样问题的人少走
本文是Python高性能编程系列的收官篇,通过一个图像处理流水线的综合实战案例,展示了从纯Python实现到最终120倍性能提升的完整优化过程。案例处理1000张512×512灰度图像,包含归一化、高斯滤波、边缘检测、直方图均衡化和特征提取五个步骤。作者首先建立纯Python基准实现,然后逐步应用系列前九篇介绍的优化技术:NumPy向量化、内存优化、Numba JIT编译、多进程并行和流水线架构优
数据库读写数据时,无需感知加密逻辑,磁盘层自动完成明文写入加密、密文读取解密。基于数据库访问驱动扩展(JDBC、AOP、MyBatis切面)实现加密,无需部署独立网关,通过改写数据库连接驱动、新增切面拦截逻辑,在应用与数据库的连接层完成数据加密解密,核心特性与数据库加密网关一致。数据库原生源码级加密能力(MySQL TDE透明数据加密、Oracle透明加密),数据库内核层面实现数据落盘加密,无需依
从 CANopen NMT 协议出发,结合 CANopenNode 源码解析状态切换、Heartbeat 上报、命令处理与错误降级流程。
本文详细介绍了Redis的核心特性、数据结构、持久化机制及常见问题解决方案。Redis作为高性能内存数据库,其快速响应得益于内存操作、单线程模型和高效数据结构。文章深入解析了String、Hash、List、Set、Zset等数据类型的底层实现,包括SDS、压缩列表、快速列表等结构。在持久化方面,对比了RDB和AOF的优劣及适用场景,并介绍了重写机制。针对数据丢失问题,提出了主从同步和持久化策略建
互联拓扑架构领先:自研交换芯片 + Clos 全互联,P2P 带宽 448GB/s,对分带宽 1792GB/s,对比 Fullmesh 方案有 2-8 倍的差距。大模型 TP 并行和多机 Scale-Out 场景优势明显。软件生态兼容性好:HIP 编程模型 + DTK 数学库做到了 CUDA 兼容,PyTorch/vLLM 等主流框架覆盖度 98%+,迁移成本低。全场景覆盖:从 AI 训练推理到科
本文深入解析了Elasticsearch simdvec如何通过四项关键优化实现2倍向量吞吐量提升。作者首先通过级联展开(Cascade Unrolling)技术,利用C++模板实现循环展开,最大化FMA端口利用率,获得11-13%性能提升。接着采用批处理与预取策略,通过"头部+分散"的预取方式隐藏内存延迟,带来最高30%的性能提升。针对2的幂维度导致的L1d缓存冲突问题,提出
每年到了毕设和创客大赛季,后台都会收到很多学生朋友的提问:“想做一个能跟着声音走的智能小车,有没有简单易上手的方案?”说实话,声源跟随小车看似简单,但传统实现方式门槛极高:需要 4-6 颗麦克风组成阵列,移植复杂的 TDOA 算法,还要花大量时间调参校准。对于没有专业声学和算法基础的学生来说,光是搞定声源定位这一个功能,就要耗费半个月以上的时间,最后还可能因为效果太差影响整个项目。
Redis Set 类型解析:从底层实现到应用场景 摘要 本文深入解析 Redis 的 Set 数据类型,首先从语义层面区分 Set 与 List、Hash 的差异:Set 强调元素唯一性且不保证顺序,适合去重和集合运算场景。底层实现上,Redis 根据数据规模采用不同编码策略:小集合使用紧凑的 listpack 编码(存储 header+entry+EOF 结构),大集合则转换为 hashtab
Rust 语言编写:极致的性能表现,低延迟、高吞吐量,支持百万级 QPS原生混合搜索:同时支持向量相似度检索和全文关键词检索,大幅提升召回质量丰富的过滤能力:支持复杂的 Payload 过滤条件,可与向量检索无缝结合多种量化技术:支持标量量化、乘积量化,在保持检索精度的同时降低内存占用 4-16 倍分布式架构:支持水平扩展,可处理百亿级向量数据开箱即用:提供完善的 Web UI、REST API
4、 四个BTB连接器,核心板所有的IO全部引出,最小的一个BTB连接器所引出的IO建议不要使用,这个连接器里面包含的IO主要和一些调试以及其他特殊端口,为了避免引起无法启动等问题,建议不要使用这些IO。通过第二章可以得知,需要完成锥桶的识别和交通标识的识别才能完成挑战赛任务,因此,要求在TC4上运行目标检测模型和图片识别模型,其中使用了TC4系列的PPU单元加速了神经网络部分的计算。脚本包括训练
圈子里有人去字节面试,被问了一道看起来简单、实际很容易答浅的题:> 👔 你们线上推理为啥用 vLLM 不用 Ollama?
这篇博客来聊聊vLLM到底是怎么工作的。顺便讲讲为啥需要它、它是怎么把显存玩出花的,以及在真实场景里它是怎么撑起那些动辄成千上万人同时在线的大模型服务的。
本文介绍了如何通过AMD Radeon Cloud快速部署Qwen3大模型API服务,无需自行配置云主机环境。主要内容包括: 注册AMD AI开发者计划,领取200小时GPU算力和咖啡券福利 在Radeon Cloud的Model APIs分类中一键启动预置的vLLM-Qwen3工作区 获取自动生成的OpenAI兼容API信息(Base URL/Model/API Key) 使用curl命令测试A
本文基于《Flask Web开发实战》(当当满100减50)的删减内容改写而来,更多Flask文章和开源项目可以访问helloflask.com查看。运行示例程序本文示例程序的源码托管在GitHub上(helloflask/github-login)。运行示例程序的步骤如下:$ git clone https://github.com/helloflask/github-login.git$ c.
以前公司有一个需求,将推广用的长链接转化为短链接,再通过营销短信发送给客户。虽然有很多的第三方短链的生成工具,但为了安全还是自建一个。以前用过开源的YOURLS,是基于PHP的开源方案。 https://github.com/YOURLS/YOURLS 。今天在网上发现一个更加简单的方案就是,gh-pages-url-shortener,一款完全使用 GitHub Pages 就可搭建的最小型的短
Github转到码云的方法打开码云网站,点击下图的+号有一个从Github和Gitlab导入,点击,选择 Github然后需要绑定一下Github,就可以选择,并绑定!需要更多教程,微信扫码即可...
最近一直在完善自己的扫描器和攻击链,所以也一直在GITHUB上看自动化的一些知识,脑壳痛看起来比较优秀的如下,本人只推荐哈DefectDojo 是一个安全编排和平台。DefectDojo 允许您管理您的应用程序安全程序,维护产品和应用信息、分类漏洞和将结果推送到 JIRA 和 Slack 等系统。DefectDojo 丰富并使用许多启发式算法来优化漏洞数据,这些算法随着您使用该平台的次数越多越好。
目前Oracle PAF(Private Agent Factory)官方提供配置,LLM providers只有OCI GenAI、OpenAI、Gemini以及vLLM和Ollama的方式。如果想用国内LLM或者其他中转的LLM,通常是兼容OpenAI的模式,但是OpenAI这里配置是写死的,无法自定义baseurl:如果想直接通过vLLM配置,默认无法指定api key:看来默认就无法使用其
1.SgLang代码细读-3.Cache2.SgLang代码细读-2.forward过程3.SgLang代码细读-1.从req到batch收起。
本文系统介绍了SGLang支持的多种分布式并行计算模式,包括基础并行(TP、PP、DP)、局部计算并行(DPAttention、EP)和计算时序分离并行(PD分离)。TP模式将张量拆分到多GPU并行计算;PP模式将模型层拆分到不同GPU;DP模式将请求拆分到GPU组处理。文章详细分析了每种模式的特点、实现架构和适用场景,如DPAttention专用于MLA结构,EP针对MoE模型优化。最后展望了未