
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
STM32CubeProgrammer(简称STM32CubeProg)是意法半导体官方推出的全能型编程工具,用于在各类环境中对STM32微控制器和微处理器进行烧录。
本文记录了在Tesla V100(4×32GB)环境下使用Docker和vLLM部署Qwen3-ASR-1.7B语音识别模型的过程。由于V100显卡的Compute Capability为7.0,不支持FlashAttention 2和bfloat16,需采用float16精度并调整参数。关键步骤包括:通过ModelScope或HuggingFace下载模型,配置Docker容器时指定显存使用率(
摘要: gijela-core-chat 是一个专为 Java 大模型项目设计的联调工作台,解决了传统开发中模型切换混乱、RAG 验证分散、日志排障困难等问题。其核心价值在于整合了 LLM 调用、知识库管理、图谱抽取、附件处理等全链路能力,提供可视化操作界面,支持同步/流式验证、会话管理、实时预览等功能。通过自研 OkHttp 工具链替代第三方框架,实现了可控的模型调用与调试闭环,显著提升了开发效
《gijela-core-chat-flow:LLM工作流编排实战指南》摘要: 该工具通过可视化界面解决LLM项目开发中的流程管理痛点,提供从流程定义到调试运行的全闭环解决方案。核心功能包括: 模型配置管理,支持团队协作调试 双模式LLM节点(chat/transform)满足对话与数据处理需求 实时调试面板展示输入/输出快照 版本对比与状态管理确保发布可靠性 运行历史追溯功能提升排障效率 技术栈
摘要 本文针对长篇中文小说《三国演义》构建RAG问答系统,提出"章回识别+章节内滑动窗口"的混合切分策略,使用OpenAI兼容的BGE向量模型和Qdrant向量数据库。通过解耦数据集生成、向量入库和召回评测三个环节,形成可复现的工程闭环。重点解决了批量upsert兼容性、ID类型、维度一致性等关键工程问题,最终在15个经典问题测试集上达到Recall@5=0.8的效果。文章详细
摘要: 本文分析了 MCP 协议从 2024(SSE)到 2025(Streamable HTTP)版本的演进差异,指出 Spring AI 目前仅支持旧版 SSE 协议。当开发者错误使用新版 StreamableHttpMcpTransport 连接旧版服务时,会因 HTTP 方法不匹配(POST vs GET)导致 404 错误。建议 Spring AI 用户继续使用 HttpMcpTrans
本文介绍如何基于 LangChain4j 1.12.2 + Spring Boot 4.0.2 实现一个可独立部署的 Skills Agent 服务。核心思路:工具定义写成 Markdown 文件,AI 自动加载调用;配合 Redis 多轮记忆滑动窗口与摘要压缩解决 context 爆炸问题;前端 Vue3 提供完整的会话管理、模型切换、流式对话界面。附完整架构图、核心代码与五分钟上手指南。
文章摘要: Streamable HTTP作为AI时代的新兴协议,解决了传统SSE在AI大模型应用中的三大痛点:1)长连接管理困难,2)单向通信限制,3)云原生适配不足。其核心技术原理包括:利用HTTP分块传输实现双向流式通信,通过Fetch API+ReadableStream实现细粒度控制,采用会话ID机制支持无状态架构。相比SSE的浏览器单向推送,Streamable HTTP专为AI交互设
本文记录了在Windows环境下通过WSL2 Ubuntu-24.04编译和验证Linux内核(6.1.174版本)的完整流程。核心经验是将源码解压到Ubuntu文件系统(而非Windows盘)以避免大小写敏感问题,并提供了7个可复用的自动化任务脚本:从环境配置、源码解压、内核编译到QEMU启动验证。关键设计包括自动并发控制、文件校验和日志重定向,最终形成"源码→配置→编译→打包→启动"的闭环工作
本文探讨了向量数据库在RAG、语义检索等场景中的核心作用,指出实践问题多源于对检索机制理解不足。文章解析了向量库的本质是高维近邻检索系统,重点介绍了HNSW、IVF等索引技术如何提升检索效率,并详细拆解了Qdrant的工程实现方案:以HNSW为主索引,结合Payload过滤和量化技术,在保证检索质量的同时控制成本。最后提出完整的RAG推荐链路和调优方法论,强调建立可解释、可量化、可持续的工程闭环才







