
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
摘要 我们介绍了AIBrix,一个云原生的开源框架,旨在优化和简化云环境中的大规模LLM部署。与传统的云原生技术栈不同,AIBrix遵循协同设计理念,确保基础设施的每一层都为与vLLM等推理引擎的无缝集成而量身定制。 AIBrix引入了多项关键创新以降低推理成本并提升性能,包括用于动态适配器调度的高密度LoRA管理、LLM专属的自动扩缩容机制,以及前缀感知、负载感知的路由策略。为了进一步提升效率,
这些项目提供了构建AI应用所需的全套工具,从模型加载、预处理到部署。LangChain ◦ 简介:当前最流行的用于开发由大语言模型驱动的应用程序的框架。它提供了“链”的概念,可以将大模型、外部数据源、工具(如计算器、搜索引擎)等连接起来,构建复杂的应用(如智能客服、高级问答机器人)。◦ 应用场景:聊天机器人、智能文档问答、代理(Agents)应用。LlamaIndex ◦ 简介:专注于数据索引,帮
自己部署的vllm服务:ai.inference.yaxin.cn:30132/vyc9bg也可以使用deepseek、openapi等现成的api,如果使用现成的api需准备api-key。
-compilation-config '{"level":0} 解决我机器的一个问题:vLLM试图使用PyTorch的Inductor编译器进行模型编译优化,而该过程需要调用NVIDIA CUDA编译器。--gpu-memory-utilization 0.8 :使用80%的显存。--max-model-len 61024 降低模型提供的最大序列长度,减少显存需求。即使本模型已经很小了,但对显存
这些项目提供了构建AI应用所需的全套工具,从模型加载、预处理到部署。LangChain ◦ 简介:当前最流行的用于开发由大语言模型驱动的应用程序的框架。它提供了“链”的概念,可以将大模型、外部数据源、工具(如计算器、搜索引擎)等连接起来,构建复杂的应用(如智能客服、高级问答机器人)。◦ 应用场景:聊天机器人、智能文档问答、代理(Agents)应用。LlamaIndex ◦ 简介:专注于数据索引,帮
AIBrix使用Envoy的扩展机制实现智能路由:✅请求拦截: 在请求到达后端前拦截✅智能路由: 基于KV缓存、负载等因素选择最优Pod✅透明代理: 对客户端完全透明✅指标收集: 收集响应指标用于后续决策✅错误处理: 统一的错误响应机制这种架构实现了控制平面(Go)与数据平面(Envoy)的解耦,提供了灵活的扩展能力。// Router 只是一个接口,不是服务// QueueRouter 也是接口







