logo AMD开发者中国社区

AMD开发者中国社区
首页边缘AI开发云端AI开发ROCm开源生态开发者社区
去全站搜索看看?

登录社区云

登录社区云,与社区用户共同成长

AMD开发者中国社区

邀请您加入社区

欢迎加入社区

欢迎加入社区

k8s
  • 向量数据库内核设计:HNSW 索引原理与亿级向量检索优化

    HNSW 通过多层导航图结构,将亿级向量检索的延迟从秒级降低到毫秒级,同时保持 95% 以上的召回率。其核心优势在于图遍历的对数级跳数和贪心路由的高效性。乘积量化(PQ)解决了内存瓶颈,将存储压缩 6-64 倍,代价是距离计算精度和召回率的轻微下降。落地路线建议:第一步,根据向量维度和数据规模选择索引类型——亿级以下、维度 768 以内优先 HNSW,更高维度或更大规模考虑 IVF-PQ 混合方案

    国医中兴
    2026-06-28 09:48:12
     2911 
     11 
    #云原生#容器#微服务 +2
  • vLLM 模型服务上线前压测:Docker 镜像、GPU 和 k6 基线检查

    本文提供vLLM模型服务上线前的压测检查清单,涵盖镜像验证、GPU运行时检查、模型缓存配置和性能测试等关键环节。通过分步验证Docker镜像、GPU可用性、模型挂载方式,记录冷启动时间,并使用k6工具进行多级并发压测(10/20/50并发),最终形成包含镜像版本、GPU状态、冷启动耗时、性能指标和风险提示的完整上线报告模板,为后续扩容和问题排查建立基准。

    木雷坞
    2026-05-27 11:36:04
     293 
     6 
    #docker#java#k8s
没有更多了
回到
顶部
logo 提供社区服务与技术支持
logo 提供社区服务与技术支持
©1999-2023北京创新乐知网络技术有限公司 京ICP备19004658号