
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
文章摘要: 本文深入解析了开源AI编程助手Crush的核心设计,揭示了优秀AI工具90%的价值在于其"执行外壳"(harness)而非模型本身。作者通过分析Crush源码,总结了三大harness设计原则:1)严格权限控制与用户可扩展的hook机制;2)智能循环检测避免AI陷入死循环;3)上下文压缩和串行化确保长任务稳定性。文章特别指出,Crush通过将配置设计为可执行脚本、工具自描述文档等细节,
本文分享了在AI教育产品中构建生产级多模型网关的工程实践。面对模型供应商的不稳定性(限流、超时、脏数据等),作者团队设计了一个智能路由系统,核心包括: 抽象能力(Capability)与提供方(Provider)概念,实现零代码新增供应商 优先级容灾机制:按序尝试可用模型,首个成功即返回 熔断设计:连续失败三次自动禁用,需人工恢复 智能路由:通过难度评估分流,简单题走廉价模型,难题用高级模型 多层
在Google的Colab上面采用unsloth,trl等库,训练数据集来自Google的云端硬盘,微调llama3-8b模型,进行推理验证模型的微调效果。保存模型到Google的云端硬盘可以下载到本地供其它使用。
本方案构建了一套高并发、分布式AI模型数据处理管道,旨在可靠处理ASR、LLM、TTS等模型的高吞吐量输入输出数据。系统采用生产者-消费者模式与事件驱动架构,通过Kafka实现系统解耦与异步通信。Web API基于FastAPI实现高并发接入,消费者服务采用多实例并行处理,结合连接池与批量插入优化MySQL持久化。方案通过并行处理、消息缓冲、压缩传输等策略保障低延迟与高吞吐,支持水平扩展,并具备完
基于 LangChain 构建的智能旅行助手,支持天气查询、航班查询、景点推荐和预算计算。
本文介绍了阿里最新开源的文生图大模型Z-Image的本地部署方法。内容包括环境准备(创建Conda环境、安装diffusers、PyTorch等)、从ModelScope下载模型、编写生成图像代码并测试。示例生成了一张zwplayer播放器海报和一张女孩图像,模型运行需约22GB GPU内存,生成速度快且能较好理解提示词,尽管部分汉字渲染略有瑕疵。整体上,Z-Image是一个高效、可本地部署的文生

主要说明向量数据库字符串查询要注意的问题,就是构建查询表达式要注意加单引号,否则会出现异常。

文本采用待量化模型自己生成数据集的方式,使用llmcompressor对智谱公司的GLM-4-9b-chat-hf模型进行AWQ量化。
摘要: BitsAndBytes是Hugging Face开发的神经网络高效量化库,支持8-bit和4-bit量化(INT8减少2倍内存,NF4减少4倍内存),适用于大模型部署与训练优化。通过Python示例演示了自动加载、量化(默认4-bit)及保存模型流程,量化后模型体积从18.3G降至6.5G。量化模型可通过vllm部署服务,需确保环境安装bitsandbytes。测试显示模型层成功转换为L
摘要: BitsAndBytes是Hugging Face开发的神经网络高效量化库,支持8-bit和4-bit量化(INT8减少2倍内存,NF4减少4倍内存),适用于大模型部署与训练优化。通过Python示例演示了自动加载、量化(默认4-bit)及保存模型流程,量化后模型体积从18.3G降至6.5G。量化模型可通过vllm部署服务,需确保环境安装bitsandbytes。测试显示模型层成功转换为L







