登录社区云,与社区用户共同成长
邀请您加入社区
摘要:本文深度解析三大主流大模型推理引擎架构——vLLM、SGLang和TensorRT-LLM的技术路线差异。vLLM凭借PagedAttention和连续批处理成为生态最丰富的通用方案;SGLang的RadixAttention在Agent场景中通过前缀共享实现50%-70%的Prefill加速;TensorRT-LLM则通过硬件级优化在NVIDIA GPU上提供极致性能。文章对比了三者在KV
**Xinference** | 国产分布式推理 | vLLM/SGLang/llama.cpp/transformers | **国产、Dify 集成最好、分布式** | 生态新、运维门槛 | ⭐⭐⭐⭐⭐ || **TGI** | HF 生态生产推理 | Rust + Python | 稳定可靠、HF 生态原生 | LLM 为主、性能略弱于 vLLM | ⭐⭐⭐⭐ || **Xinference
本周AI领域技术进展聚焦Agent框架优化与安全治理。微软Agent Framework新增跨会话来源标记、人工审批回调等功能;Foundry Toolbox实现工具鉴权与代码分离;vLLM Ascend 0.23支持国产昇腾芯片的KVCache卸载。研究方面,AgentTrails提出结构化溯源图替代传统日志,JANUS研究推动安全防护从事后审核转向执行前预测。产业应用更关注长期任务管理,评测体
TVM 的 C++ 产物被拆成多个共享库,职责清晰、可按需部署。本文按和说明各库的功能与作用。
本文深入分析了STM32 F407系列SPI通信的底层驱动机制。一段看似简单的6行SPI数据收发函数,实际通过中断方式实现全双工通信:1. 核心流程由RXNE接收中断驱动,每次中断读取接收数据并填充下一发送数据;2. 通过状态寄存器busy标志实现同步,数据传输完成后清除busy标志;3. 支持8/16位数据帧格式,采用指针操作实现高效数据搬运。研究发现官方驱动采用"中断触发+状态机&q
基于 STM32 + 霍尔摇杆 + TFT屏幕 + 2.4GHz射频 的标准遥控器工程架构与核心源码解析。
时间戳单位为10 微秒,统一从格林威治时间 2015年1月1日开始计算。如果设备使用常规Unix时间(从1970年1月1日算起),可以加上固定偏移值1420070400秒完成换算。受设备时钟、GPS信号等影响,报文里的时间戳不一定和标准时间完全一致,协议对此不作强制要求,只要求先后顺序正常。规定:在同一组(系统ID, 组件ID, 链路ID)的通信链路中,后一条报文的时间戳必须比前一条大。如果报文发
相比 A100/A800 所在的。
2026年的大模型面试,早已不是简单的"背诵知识点",而是考察你的技术深度、工程能力、架构思维和对前沿趋势的把握。核心心法: 1. 从原理到实践:不仅要懂"是什么",更要懂"为什么"和"怎么做" 2. 从单点成体系:构建完整的技术栈认知 3. 从跟随到创新:紧跟技术前沿,培养独立思考能力最重要的是:保持对技术的热爱和持续学习的动力。AI领域变化太快,唯有不断进化,才能立于不败之地。如果说程序员已经
训练yolov5s(最通用配置)# 自定义数据集训练(替换自己的yaml即可)入门首选YOLOv5:社区成熟、文档齐全、BUG极少,是新手入门、工业落地的最优起点,稳定性优于各类新版YOLO模型场景精准选型:轻量设备用n系列、通用场景用s/m系列、高精度需求用l/x系列,分割分类任务选用专属后缀模型落地核心逻辑:训练用PyTorch原生模型,部署必做模型加速,TensorRT是GPU设备最优部署方
MSA为注意力机制优化提供了新范式,后续可能出现更多多阶段架构## 结语MiniMax M3的MSA架构不是简单的"省钱方案",而是Agent工业化的基础设施突破。- 使用低维投影快速筛选与当前Query相关的Key集合- 只保留top-k%的Key进入后续精细计算- 复杂度从O(n²)降至O(n × k),k通常为n的5-10%- 对被粗筛排除的Token,使用低秩近似计算补偿注意力- 确保长距
车端AI技术全景摘要 汽车行业正经历从电动化向智能化转型的关键阶段,车端AI技术成为推动汽车进化为"智能终端"的核心驱动力。本文系统梳理了车端AI的四层技术架构: 芯片层:NVIDIA Orin/Thor、高通Snapdragon Ride等地平线等AI芯片提供254-2000 TOPS算力,但内存带宽和数据搬运效率是实际瓶颈。 感知层:经历了从2D检测到BEV多传感器融合,再到Occupancy
请大家把屏幕放大,死死凝视我上面精心梳理的这幅 《16位实模式 MD 模拟器全局软件架构与数据流向图》。这,就是我们花费了数篇心血,在这片只有 640KB 常规内存的荒原上,徒手构筑起来的‘模拟器帝国全景沙盘’。每一个方框,都是我们用 Large 模式远指针焊死的一道合金承重墙;每一个箭头,都是我们用纯位运算和内联汇编开辟的硬件级高速公路!
GPU 芯片的 SM 总数、GPC 总数、L2 缓存大小,都随架构和型号剧烈变化。旗舰卡可能有 128 个 SM,入门卡可能只有 20 个,这是 GPU 厂商划分产品线的主要手段。
iOS音视频底层架构解析:系统通过并行处理管线实现音视频同步。音频和视频采用独立的硬件采集与处理通道,仅在最终渲染阶段通过PTS(显示时间戳)实现同步。音频通常作为主时钟基准,视频通过比较PTS差值进行帧同步控制(等待/丢弃/渲染)。核心框架包括AVFoundation(采集/播放)、VideoToolbox/AudioToolbox(编解码)、CoreMedia(时间戳管理)和CoreAnima
从向量加法的简单例子出发,你已经掌握了 DCU 编程的基本骨架。接下来可以进入更复杂的实战场景。在实际集群中,不同节点可能安装了不同的 DTK 版本。DCU 的软件栈称为。DCU 集群通常通过。
本文深入探讨了基于炬芯P1(ATS3085)和R1(ATS6095)芯片的智能蓝牙音频设备开发全流程,从底层硬件架构到上层应用开发,覆盖了十个关键层级。主要内容包括: 底层基础:详细解析了ARM Cortex-M架构在蓝牙音频设备中的应用,重点介绍了HardFault分析器、中断系统和内存管理等核心机制。 RTOS与驱动开发:探讨了任务调度、IPC通信机制以及I2S/PDM等音频外设的驱动实现,提
本文介绍了《智能影记(Memoria)》项目的设计与实现,针对个人数字影像管理中存在的隐私泄露、素材混乱和创作门槛高等痛点,提出了一套端云协同的智能解决方案。项目采用Clean Architecture分层设计,构建了包含无感净洗、时空聚类、多模态语义索引等核心功能的系统架构,并通过Figma高保真原型与Flutter实现了优雅的UI交互。特别设计了兼顾隐私保护的端侧优先技术路线,支持自然语言搜图
【摘要】本文完整记录了逆向解析抖音私信数据的过程。私信列表通过HTTPS接口返回,数据均经过编码处理。通过开发者工具分析get_by_user_init接口调用链,最终定位到核心的decode解码函数。验证发现数据采用Uint8Array格式进行base64编码转换,未使用复杂加密。成功提取解码逻辑后,可完整获取明文私信内容。该方案可为自媒体矩阵和自动化工具开发提供技术参考,关键在于耐心追踪调用栈
安全架构的关键要点:纵深防御:不要依赖单一安全措施,多层防护默认安全:安全应该是默认配置,不是可选功能最小权限:只授予必要的权限,不过度授权日志审计:所有操作都要有日志,方便溯源定期渗透测试:请专业团队定期做渗透测试安全培训:提高全员安全意识不要觉得"这只是内部接口"就不做安全。攻击者永远比你想象的更执着。你们系统有哪些接口可能存在安全漏洞?如果发现系统在遭受攻击,你能在几分钟内止血?个人观点,仅
verl代码结构采用"核心包+示例+插件"三层架构,核心包verl/包含训练、推理、检查点等基础设施,examples/提供算法示例,tests/和docs/保障质量。其设计理念体现在:1)训练(trianer/)与推理(workers/)解耦,通过DataProto协议通信;2)多后端可插拔,rollout和engine按vLLM/SGLang等不同后端实现子目录;3)分布式优先,single_
在本次综合评测、技术社区热度、推理调用热度三重维度构成的全球顶尖大模型榜单中,小米自研通用轻量化大模型 MiMo-V2.5 位列全球第三名,成为本次榜单中排名最高的国产自主研发大模型,实现了中国轻量化通用大模型跻身全球第一技术梯队的重要突破。区别于海外大模型优先布局云端通用场景的研发路线,MiMo 系列依托小米十余年移动端 AI、端侧神经网络优化、IoT 设备智能计算的技术积淀,采用端云协同双底座
本文深入解析AUTOSAR CP R23-11标准中的CAN接口模块(CanIf),重点介绍其在通信架构中的核心作用与实现细节。作为Com服务层与底层Can驱动间的"总调度",CanIf承担硬件无关的通信逻辑,通过抽象概念(L-PDU/L-SDU、HOH/HRH/HTH等)实现标准化接口。文章详细剖析了模块初始化流程、数据收发机制(BasicCAN/FullCAN模式)、软件过滤策略及硬件对象管理
Transformer架构详解摘要 Transformer是2017年提出的革命性模型,彻底改变了序列建模方式。与RNN/LSTM不同,它完全基于注意力机制,解决了传统模型的三大痛点:序列依赖导致的无法并行训练、长期依赖问题和计算效率低下。Transformer采用编码器-解码器结构,核心创新包括: 自注意力机制:允许模型直接建立任意位置间的关联 多头注意力:并行学习多种注意力模式 位置编码:弥补
阿里巴巴通义实验室开源了Wan2.2视频生成框架,基于PyTorch实现,采用Apache 2.0协议。项目提供四大核心功能:文本生成视频(WanT2V)、图像生成视频(WanI2V)、图文生成视频(WanTI2V)和语音生成视频(WanS2V)。核心创新包括:1) 采用MoE架构的DiT模型,包含高/低噪声双专家;2) 升级VAE实现1024倍压缩率;3) 支持分布式推理(FSDP+Ulysse
本文介绍了ARM Cortex-M系列单片机的内核与架构概念。主要围绕M3/M4内核展开,指出它们均基于ARMv7-M架构,因此在寄存器设计、流水线等方面高度一致,主要区别在于M4增加了FPU浮点运算单元。文章解析了内核框图,说明外设不由内核定义而是由芯片厂商实现。内核的核心部分包括通用寄存器(R0-R15)、特殊功能寄存器(xPSR、PRIMASK等)以及内核外设(NVIC、SCB、SysTic
摘要:本文深入解析AUTOSAR 23-11中的CAN接口模块(CanIf),阐述其作为Com层与CanDrv间抽象接口的核心功能。重点剖析CanIf的架构设计,包括硬件无关的通信逻辑、L-PDU管理及BasicCAN/FullCAN模式差异。详细说明HRH/HTH对硬件邮箱的抽象机制、数据流处理(发送缓冲策略、接收过滤)以及多控制器协同工作流程(初始化、BusOff处理、唤醒检测)。通过分析Ca
摘要: 端侧AI部署面临异构计算适配、资源限制与实时性要求三大技术瓶颈。其核心架构分为硬件算力、模型优化、推理引擎、设备协同与安全合规五层:硬件层通过异构SoC(CPU/GPU/NPU)提升能效;模型层依赖量化、剪枝等技术压缩模型;推理引擎需优化算子映射与内存调度;协同层采用端-边-云分级处理;安全层则确保数据隐私与模型可信。产业技术图谱呈现三类路线——感算一体(如辛米尔缩短数据搬运)、SoC+协
输入:10,950 个 NetCDF 格式的逐日海表温度文件(30 年 × 365 天),每个文件 1,166 × 721 网格点计算:对夏季(6–8 月)92 天,以 11 天滑动窗口(±5 天)统计 30 年间每个像素点的气候态均值(Clim)和 90% 分位数(P90)输出:92 个 NetCDF 文件验证:与参考数据逐日交叉验证 RMSE这是一个典型的数据密集型 + 尴尬并行任务——大量
是海光信息(Hygon)自主研发的面向高性能计算与人工智能的通用加速处理器。其核心架构基于 AMD CDNA(Compute DNA)授权并进行了国产化深度定制,本质上是一款——与 NVIDIA GPU 在概念上类似,但完全由中国自主可控的技术栈构成。DCU 目前最主流的型号为,架构代号,是当前国产异构计算平台中最具代表性的加速卡之一。