
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本文接续上篇,深入 Agentic 智能客服的三大基础设施:RAG 检索增强生成(政策文档加载→切分→向量化→存储→检索的完整管线)、ChatMemory 多用户对话记忆(@MemoryId 隔离 + InMemoryChatMemoryStore + MessageWindowChatMemory)、Flux\<String\> SSE 真流式输出(Spring MVC 原生支持,无需 WebF

AgentCPM-Explore是面向深度研究场景的专业化LLM Agent,基于Qwen3-4B-Thinking基座模型进行专门强化学习训练,通过AgentRL框架实现工具调用与长程规划能力的高效注入。其核心突破在于:以仅40亿的参数规模,支持超过100轮的连续环境交互与多源信息交叉验证,在GAIA基准上从基础模型的25.24%跃升至63.90%,不仅刷新同尺寸模型性能天花板,更越级挑战并比肩

本文以电商售后智能客服为业务场景,深入讲解 LangChain4j Agentic AI 的核心设计范式:**1 个 @AiService + 多组 @Tool**。你将掌握:如何按"能力类型"而非"业务流程"分组工具、LLM 自主路由的实现原理与调优技巧、系统提示词如何定义 Agent 的人格与行为边界、以及 @Tool 注解的最佳实践。本文不写一行 Java 路由代码,让 LLM 自己决定调用

FireRedASR2S是小红书Super Intelligence-AudioLab开源的工业级一体化语音识别系统,集成ASR(自动语音识别)、VAD(语音活动检测)、LID(语种识别)和Punc(标点预测)四大核心模块,支持普通话、20余种方言、英语、中英混合、代码语音及歌词识别,在24个测试集上平均字错率低至9.67%,达到当前开源领域SOTA水平。该系统采用模块化架构设计,各组件既可协同工

MedASR 是一款基于 Conformer 架构的医疗语音识别模型,拥有 105M 参数,经过约 5000 小时的医学语音数据预训练,涵盖放射学、内科、全科等多种医学专业领域的语音内容。它能够精准识别复杂医学术语和专业上下文,为开发者提供可定制化的基础模型,适用于医学口述转录、临床对话记录、多模态医疗应用开发等多种场景。

**VibeVoice-ASR是微软开源的90亿参数统一语音识别模型**,基于Qwen2 Decoder架构,采用64K token超长上下文窗口与7.5 Hz超低帧率语音分词技术,实现了ASR(自动语音识别)、说话人分离(Diarization)和时间戳标注(Timestamping)三大任务的端到端联合建模。该模型支持中英双语,可单次处理长达60分钟的连续音频,输出"Who-When-What

Qwen-Image-Layered 是由 Qwen 团队开发的一种先进的 AI 图像编辑模型,能够将普通的 RGB 图像自动分解为多个语义分离的 RGBA 图层,解锁了图像的固有可编辑性。每个图层都可以独立操作,而不会影响其他内容,从而实现了真正一致的图像编辑。该模型不仅支持可变数量的图层分解,还具备递归分解能力,能够满足不同场景下的多样化编辑需求。

GLM-Image是由智谱AI研发并开源的图像生成基础模型,采用"自回归生成器+扩散解码器"的混合架构设计。该模型以GLM-4-9B-0414为初始化基础构建90亿参数的自回归模块,配合70亿参数的扩散解码器,总计160亿参数规模。GLM-Image不仅在一般图像生成质量上对标主流潜在扩散模型,更在复杂文本渲染、知识密集型内容生成、多主体一致性保持等场景下展现出显著优势,同时支持文生图、图像编辑、

本文将带你从零开始,使用 LangChain4j 构建第一个 Java AI 应用。只需 25 行代码,就能让 Java 程序与大语言模型对话。我们将深入解析 ChatModel 的核心概念,并对比 Python LangChain,展示 Java 生态在 AI 应用开发中的独特优势。

大语言模型不仅能处理文本,还能"看懂"图片、"听懂"音频、"画出"图像。多模态能力让 AI 应用从单一的文本交互升级为全方位的感官体验。本文将带你掌握 LangChain4j 的多模态开发技术,包括 GPT-4V/GPT-5 的视觉理解、DALL·E 3 的图像生成、Whisper 的语音转文字。我们将通过真实代码示例,展示如何让 Java 应用识别图片内容、根据描述生成图像、转录音频文件,并分享








