logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

LangChain4j Java AI 应用开发实战(三十):Agentic 智能客服实战(下)—— RAG + 记忆 + 流式集成

本文接续上篇,深入 Agentic 智能客服的三大基础设施:RAG 检索增强生成(政策文档加载→切分→向量化→存储→检索的完整管线)、ChatMemory 多用户对话记忆(@MemoryId 隔离 + InMemoryChatMemoryStore + MessageWindowChatMemory)、Flux\<String\> SSE 真流式输出(Spring MVC 原生支持,无需 WebF

文章图片
#人工智能#java
【AI大模型前沿】AgentCPM-Explore:清华面壁开源4B端侧智能体,以小博大实现百轮深度搜索与长程推理

AgentCPM-Explore是面向深度研究场景的专业化LLM Agent,基于Qwen3-4B-Thinking基座模型进行专门强化学习训练,通过AgentRL框架实现工具调用与长程规划能力的高效注入。其核心突破在于:以仅40亿的参数规模,支持超过100轮的连续环境交互与多源信息交叉验证,在GAIA基准上从基础模型的25.24%跃升至63.90%,不仅刷新同尺寸模型性能天花板,更越级挑战并比肩

文章图片
#人工智能#开源#AIGC +2
LangChain4j Java AI 应用开发实战(二十九):Agentic 智能客服实战(上)—— Agent 设计与工具编排

本文以电商售后智能客服为业务场景,深入讲解 LangChain4j Agentic AI 的核心设计范式:**1 个 @AiService + 多组 @Tool**。你将掌握:如何按"能力类型"而非"业务流程"分组工具、LLM 自主路由的实现原理与调优技巧、系统提示词如何定义 Agent 的人格与行为边界、以及 @Tool 注解的最佳实践。本文不写一行 Java 路由代码,让 LLM 自己决定调用

文章图片
#人工智能#java#python
【GitHub开源AI精选】小红书FireRedASR2S开源发布:集成ASR/VAD/LID/Punc四大模块的工业级语音识别系统

FireRedASR2S是小红书Super Intelligence-AudioLab开源的工业级一体化语音识别系统,集成ASR(自动语音识别)、VAD(语音活动检测)、LID(语种识别)和Punc(标点预测)四大核心模块,支持普通话、20余种方言、英语、中英混合、代码语音及歌词识别,在24个测试集上平均字错率低至9.67%,达到当前开源领域SOTA水平。该系统采用模块化架构设计,各组件既可协同工

文章图片
#人工智能#开源#语音识别 +2
【AI大模型前沿】MedASR:谷歌开源的高精度医疗语音识别模型

MedASR 是一款基于 Conformer 架构的医疗语音识别模型,拥有 105M 参数,经过约 5000 小时的医学语音数据预训练,涵盖放射学、内科、全科等多种医学专业领域的语音内容。它能够精准识别复杂医学术语和专业上下文,为开发者提供可定制化的基础模型,适用于医学口述转录、临床对话记录、多模态医疗应用开发等多种场景。

文章图片
#人工智能#开源#语音识别 +3
【AI大模型前沿】微软VibeVoice-ASR技术解析:支持60分钟长音频端到端识别的开源语音识别新标杆

**VibeVoice-ASR是微软开源的90亿参数统一语音识别模型**,基于Qwen2 Decoder架构,采用64K token超长上下文窗口与7.5 Hz超低帧率语音分词技术,实现了ASR(自动语音识别)、说话人分离(Diarization)和时间戳标注(Timestamping)三大任务的端到端联合建模。该模型支持中英双语,可单次处理长达60分钟的连续音频,输出"Who-When-What

文章图片
#人工智能#开源#语音识别 +3
【AI大模型前沿】Qwen-Image-Layered:基于分层技术的图像编辑新突破

Qwen-Image-Layered 是由 Qwen 团队开发的一种先进的 AI 图像编辑模型,能够将普通的 RGB 图像自动分解为多个语义分离的 RGBA 图层,解锁了图像的固有可编辑性。每个图层都可以独立操作,而不会影响其他内容,从而实现了真正一致的图像编辑。该模型不仅支持可变数量的图层分解,还具备递归分解能力,能够满足不同场景下的多样化编辑需求。

文章图片
#开源#人工智能#AIGC +2
【AI大模型前沿】智谱AI开源GLM-Image:自回归+扩散双引擎驱动的多模态图像生成新范式

GLM-Image是由智谱AI研发并开源的图像生成基础模型,采用"自回归生成器+扩散解码器"的混合架构设计。该模型以GLM-4-9B-0414为初始化基础构建90亿参数的自回归模块,配合70亿参数的扩散解码器,总计160亿参数规模。GLM-Image不仅在一般图像生成质量上对标主流潜在扩散模型,更在复杂文本渲染、知识密集型内容生成、多主体一致性保持等场景下展现出显著优势,同时支持文生图、图像编辑、

文章图片
#人工智能#开源#AIGC +2
LangChain4j Java AI 应用开发实战(一):LangChain4j 快速入门指南

本文将带你从零开始,使用 LangChain4j 构建第一个 Java AI 应用。只需 25 行代码,就能让 Java 程序与大语言模型对话。我们将深入解析 ChatModel 的核心概念,并对比 Python LangChain,展示 Java 生态在 AI 应用开发中的独特优势。

文章图片
#java#人工智能#开发语言 +2
LangChain4j Java AI 应用开发实战(三):多模态 AI 开发 - 图片理解与图像生成实战

大语言模型不仅能处理文本,还能"看懂"图片、"听懂"音频、"画出"图像。多模态能力让 AI 应用从单一的文本交互升级为全方位的感官体验。本文将带你掌握 LangChain4j 的多模态开发技术,包括 GPT-4V/GPT-5 的视觉理解、DALL·E 3 的图像生成、Whisper 的语音转文字。我们将通过真实代码示例,展示如何让 Java 应用识别图片内容、根据描述生成图像、转录音频文件,并分享

文章图片
#人工智能#java#计算机视觉 +1
    共 182 条
  • 1
  • 2
  • 3
  • 19
  • 请选择