logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Tokio 异步运行时全景架构复盘:从 epoll 事件到分布式协程生态

Tokio 将 Rust 语言的编译期安全与操作系统的底层事件驱动融为一体,构建出了全人类软件工程史上最轻盈、最坚固、吞吐最恐怖的异步并发底座。掌握了 Tokio 的全景微观机制,你便掌握了驾驭百万高并发世界的终极钥匙。

文章图片
#人工智能#语言模型#后端 +1
llama.cpp 内存映射 mmap 与大模型冷启动秒级加载实录

在针对数十吉字节(如 70B 模型权重文件约 40GB)的大语言模型开展服务部署与弹性自动扩缩容(Serverless Auto-Scaling)时,是决定系统弹性和资源利用率的核心指标。在传统的模型加载实现中(如经典的 Python/PyTorchtorch.load或标准 C 语言freadmalloc利用操作系统底层的 mmap原语与实现了的工程奇迹。深入剖析mmap的虚拟页表缺页机制与按需

文章图片
#人工智能#语言模型#后端 +1
大模型推理显存碎片治理:虚拟内存分页与动态紧凑

在高并发大语言模型(LLM)在线推理服务(如 vLLM、TensorRT-LLM、自研推理引擎)中,是制约 GPU 批处理并发容量(Concurrency Capacity)的最致命杀手。借鉴操作系统经典的思想,解构与,是彻底终结显存浪费的核心技术方案。

文章图片
#人工智能#语言模型#后端 +1
基于 Tokio 的实时通信服务设计:WebRTC 信令、媒体流转发与房间状态管理

WebRTC 服务端包含信令服务器(SDP/ICE 交换)和媒体服务器(TURN/SFU 流转发)两个独立角色。Tokio 的异步 WebSocket 处理千万级并发连接,是信令服务器的天然适合技术栈。房间管理的双重索引(room → participants + participant → room)实现 O(1) 双向查找。信令消息通道使用简化了错误处理,适合低频率、小体积的信令场景。Mesh

#人工智能
视频理解模型的推理优化:从帧采样策略到时空注意力机制的 GPU Kernel 定制

Divided Attention 将时空联合注意力的 O((T×S)²) 降至 O(T×S² + S×T²),在 16 帧 196 patch 场景下计算量减少约 93%。均匀采样是帧采样策略的性能基线——当光流计算开销超过节省的推理时间时,自适应采样反而不划算。reshape 操作实现空间-时间分离注意力的批量计算,是 GPU 高效推理的关键技术。运动累计(Motion Accumulatio

#人工智能
大促前的 Unsafe 专项审计:用 Miri 揪出隐蔽的未定义行为

在百万级高并发大促活动打响之前,对核心 Rust 底座(包含手写无锁环形队列、自定义内存池、SIMD 裸指针运算与 FFI 跨语言边界)执行 全面的 Unsafe 专项安全审计,是保障系统绝对零崩溃的最后一道硬核防线。很多开发者以为:“只要我的代码通过了 ,且在高压测试下没有触发操作系统 Segfault,代码就是绝对安全的。”然而,在 Rust 与 LLVM 编译器的严谨语义世界中,存在着大量极

文章图片
#人工智能#语言模型#后端 +1
深入 Tokio 阻塞线程池的弹性扩缩容实现

std::fs很多开发者以为只是一个简简单单的固定大小线程池。如果阻塞线程池采用固定大小(如固定 16 线程),突发任务会发生严重的排队阻塞;如果采用无限创建线程,又会瞬间耗尽操作系统的内存与 PID 描述符(引发崩溃)。深入剖析 Tokio 阻塞线程池是如何通过与实现丝滑弹性扩缩容的?

文章图片
#人工智能#语言模型#后端 +1
大模型显存池化管理:Buddy Allocator 与 Slab 分配器设计

在大语言模型(LLM)与超大规模多模态模型的高性能在线推理服务(如 vLLM、TensorRT-LLM、Triton Inference Server)中,。cudaMalloccudaFreecudaMalloc借鉴现代操作系统与 Linux 内核内存管理的精髓,在用户态构建一套融合与的层级显存池,是推理引擎打通极致吞吐的工业级基石。

文章图片
#人工智能#语言模型#后端 +1
Tokio 协作式调度的自愿让出策略与长任务切片

在现代基于事件循环的高性能异步运行时(如 Tokio、Node.js、Rust async-std)中,调度器采用的核心范式是,而非传统操作系统线程使用的。在协作式模型中,调度器(Tokio Worker 线程)!.await如何通过 tokio::task::yield_now与,在不引入独立线程池的前提下实现协作式调度的极致平滑?

文章图片
#人工智能#语言模型#后端 +1
Rust 内存泄漏的隐蔽角落:循环引用、ManuallyDrop 与线程悬挂

在 Rust 的设计哲学中,内存泄漏是完全被类型系统所允许的(Safe Rust 允许Box::leak在真实的生产级中大型 Rust 系统中,内存泄漏往往不会以野指针崩溃的方式暴露,而是悄无声息地吞噬服务器的物理 RAM,直到触发 Linux OOM Killer 导致整个服务被操作系统瞬间杀死。深入排查 Rust 中三大隐蔽的内存泄漏陷阱——Rc/Arc与,是保障系统长期稳健运转的硬核必修课。

文章图片
#人工智能#语言模型#后端 +1
    共 206 条
  • 1
  • 2
  • 3
  • 21
  • 请选择