登录社区云,与社区用户共同成长
邀请您加入社区
GitHub 上 2025 年 11 月底创建的仓库,十个多月攒下 39 万+ stars、8.2 万 forks(API 核验)。热闹背后是用户心智从「问 AI」到「让 AI 替我干活」的范式转移。本文拆解聊天机器人与会干活 Agent 的三条工程分界线,论证增长运营为何是最硬的落地场景,并给出用 RiseClaw玄策 编排的增长 Agent 团队拓扑、任务卡与 flow 内核、真实数据回流指标
还在做“问答机器人”?面试官一句“该查哪份文件、该不该转人工”就能问住你。这篇文章借保险后援数字分身场景,带你看清生成式到代理式的关键跃迁:控制流从代码交给模型,任务从“生成内容”走向“闭环办结”🚀 附可复现的最小代理循环代码,直接写进作品集。
不同的 AI(Claude、ChatGPT、文心一言)是由不同公司开发的,它们的输入格式、接口规范各不相同。你想让 AI 帮你查天气,给 Claude 发请求是一种 JSON 结构,给 ChatGPT 发请求又是另一种结构。也就是说,你需要为每个 AI 单独写一套调用天气功能的代码。而 MCP,就是那个统一的规定——秦始皇书同文、车同轨的感觉。MCP(Model Context Protocol)
提到 AI Agent,很多教程会先介绍规划、记忆、工具调用和多智能体协作。这些概念都重要,但初学者很容易遇到一个问题:名词大概听懂了,打开编辑器以后,还是不知道第一行代码应该写什么。。我们会逐步实现知识库问答、工单查询、草稿生成、人工确认和任务恢复。本篇先搭好项目骨架,跑通输入、调用和输出。不需要申请 API Key,也不需要安装数据库。
中电金信源启行业AI模型工厂面向金融行业大模型等混合模型开发与治理,以“统一资源管理、开放模型纳管、统一模型构建、高效模型服务”为目标,构建覆盖数据治理、建模训练、评估调优、监控安全及灵活部署的全生命周期管理平台。覆盖芯片、计算、存储、网络、操作系统、数据库、云平台、中间件和分布式技术,面向金融机构核心系统、分布式架构及国产化技术环境。涵盖数据湖仓一体、指标管理、知识图谱等能力。包括AI算力平台、
实时语音交互是AI应用的重要方向,但开发者常面临音视频传输与AI逻辑割裂的痛点。从WebRTC通信到语音识别、大模型推理、语音合成,链路复杂且需要统一调度。LiveKit Agents作为官方方案,将实时音视频基础设施与Agent运行时深度整合,提供VAD/STT/LLM/TTS可插拔组件,支持打断处理与多轮对话。它适用于语音客服、会议助手、智能硬件等场景,帮助开发者聚焦业务逻辑。本文详解其架构、
多模态AI技术旨在让机器像人类一样,综合处理和理解文本、图像、音频等多种信息形式。其核心原理是通过视觉、语音等专用模型,将非文本数据转化为富含语义的结构化描述,再由大语言模型进行高层推理与决策。这一技术价值在于打通了信息模态间的壁垒,使AI系统能够挖掘视频等富媒体中蕴含的视觉动态、语音对话和屏幕文字等高密度信息。其应用场景广泛,例如自动化生成会议纪要、智能分析教学与产品演示视频、以及实时监控安防画
多模态AI技术旨在让机器像人类一样综合理解文本、图像、音频等多种信息形式。其核心原理是通过专用模型(如视觉模型、语音识别模型)分别处理不同模态的数据,并将其转化为统一的语义表示(通常是文本),供大语言模型(LLM)进行综合推理。这项技术的核心价值在于突破了传统AI单一感知的局限,为构建能看、能听、能理解的智能体(AI Agent)奠定了基础。在工程实践中,通过将视频分解为关键帧、语音、字幕等多模态
远程运维的核心挑战在于信息传递效率低、专家经验难以复用。通过实时音视频技术实现低延迟现场感知,结合AI Agent进行智能诊断编排,并利用RAG知识库实现精准检索与安全校验,可显著提升故障处理效率。该方案适用于工业设备远程支持、技术支持平台等场景,有效降低专家出差频率,缩短平均故障处理时间,实现运维经验的系统化沉淀与复用。
远程运维是工业数字化转型中的关键场景,传统电话指挥加截图的方式难以满足现场排障需求,感知链路断裂、信息转述失真等问题频发。WebRTC作为低延迟实时音视频传输技术,能将端到端延迟控制在毫秒级,为远程协作提供接近实时的现场感知能力。而AI Agent基于大模型构建感知-决策-行动闭环,通过工具调用、知识检索与记忆机制,让AI不仅能理解问题,更能辅助诊断与操作。两者结合,可让AI“看见”现场、“听懂”
实时音视频与AI Agent的结合,正成为远程运维领域的重要趋势。实时音视频技术通过WebRTC等协议实现低延迟的现场画面回传,弥补传统电话和截图带来的信息断层;AI Agent则基于大语言模型(如DeepSeek)提供理解、推理与工具调用能力,将语音、视觉和数据融合分析,自动生成诊断结论。这种组合不仅将专家从重复沟通中解放出来,还能实现智能工单生成、辅助巡检、自动化操作等场景,显著提升故障定位效
远程运维常面临现场描述失真、知识经验难沉淀、事后无记录等痛点,而实时音视频技术结合AI Agent正成为工业设备售后与远程诊断的新范式。WebRTC凭借低延迟、双向交互和DataChannel能力,为专家与现场人员提供了接近面对面的协作体验;大语言模型与检索增强生成(RAG)则让AI能够基于结构化知识库与设备数据,输出可执行的排查建议,而非泛泛而谈。这类系统已在设备制造商、工厂运维等场景落地,通过
远程运维中,现场感缺失与决策断层是两大核心痛点。实时音视频技术能够打通现场与远端的信息通道,但仅仅“看得见、听得清”还不够,还需要一个能理解上下文、提供决策支持的“大脑”。AI Agent通过多模态感知(语音转写、视频抽帧)、分层记忆和工具调用,可以实时分析现场状态、检索历史经验并生成操作指引,与音视频管线咬合形成完整的智能协同闭环。这一架构在告警响应、空间操作指导、知识沉淀等场景中显著提升效率,
2026 年 9 月 28 日,Manus 2.0 发布,引入了 Cloud Computer 功能,从此 Agent 有了可以长期使用的工作环境。此前,Manus 已经能在远程 Sandbox 中运行代码和处理文件,也能操作浏览器,但临时环境会在任务结束后被回收。Cloud Computer 保留 Agent 运行过程中产生的文件和软件配置,可以让后续任务接着使用,程序也能持续运行。为 Agen
Chatbot 擅长围绕一句话给出回答,AI Agent 则会围绕一个目标连续处理资料、调用工具并等待确认。本文从任务步骤、信息来源和结果反馈三个角度解释两者的区别,帮助团队判断什么时候继续用聊天机器人,什么时候需要 Agent 工作流。
人工智能的发展已从模型能力比拼进入工程化落地阶段。理解大模型的安全机制、部署选型与提示词设计,成为开发者将技术转化为生产力的关键。本地部署大模型解决了数据隐私与定制化需求,而AI Agent则通过规划、执行与反思循环,让模型从生成内容进化为执行任务。同时,AI短剧与视频生成工具降低了内容创作门槛,但角色一致性与流程控制仍需人工把控。本文围绕热搜背后的核心技术逻辑,梳理从应用层入局AI开发的路径,涵
远程运维常卡在信息差上:专家看不到现场,现场人员说不清状态。要解决这个难题,核心在于构建低延迟的音视频通道,并让AI Agent真正理解所见、听见和后台数据。基于WebRTC与SFU架构,实时音视频系统能将延迟压缩到毫秒级;AI Agent则借助ReAct循环和多模态感知,对视频帧、语音及监控指标进行联动分析,通过工具调用直接执行查询与指令。这套组合不仅缩短了故障定位时间,还能自动沉淀运维经验。从
从多模态大模型的基础概念出发,视频理解不仅需要识别画面内容,更要捕捉时间维度上的状态变化与逻辑关系。传统特征拼接方式难以建模时序依赖,而显式对齐视觉与音频事件、引入结构化事件链,可显著提升模型对长视频和复杂动作的解析能力。随着AI Agent兴起,视频理解正从“看懂”走向“行动”,成为智能体感知世界、输出可执行指令的关键模块。同时,统一接口与词元化协议降低了多模态工程落地的成本。本文结合模型复现与
本文分析 ChatGPT、Codex 长任务聊了几十轮后什么时候应该继续当前上下文、什么时候适合重新开启Session,并通过Goal变化、旧假设失效、代码状态变化和Handoff Package等方法管理上下文生命周期,同时给出Plus与Pro在不同长任务强度下的独立判断。
本文分析同一个 ChatGPT、Codex Agent任务重复执行时为什么可能得到完全不同的结果,并从工作区、依赖、测试、工具输出和初始Evidence等角度拆解执行状态差异,通过“任务复现率”判断Agent Workflow能否在相同输入下稳定得到一致的工程结果。
蚁小二官网上线「本地部署 OpenClaw AI 伙伴 + CLI + 专属技能一键安装」,易媒助手推 AI 混剪与 AI 写作——矩阵分发工具集体 Agent 化。但接入 Agent 运行时不等于拥有增长闭环:本文拆解四类运行时原语,用开环/闭环控制回路辨析「一键分发」与「增长操作系统」的分野,附最小增长闭环 Python 骨架。工程示例参考 RiseClaw玄策 的增长运营 Agent 实践。
ChatGPT能「开口干活」了!🎙️ 本文带你搞懂语音驱动AI工作流的底层逻辑:从Function Calling到多模态Agent,手把手教你搭建语音知识库检索器,还有今天就能落地的3件事。想知道怎么让AI真正替你干活?点进来看看~
本文分析多Agent共享项目时为什么必须区分Fact、Hypothesis、Decision和Evidence,并从语义漂移、状态过期、决策来源和共享知识结构等角度说明如何避免Agent把假设误当成事实,通过“事实误用率”判断多Agent协作中的信息可靠性。
本文分析 ChatGPT、Codex 为什么会在“每条信息都正确”的情况下仍然得出错误结论,并从Snapshot、Live State、版本、时间和Evidence新鲜度等角度拆解状态错位问题,同时通过“状态一致率”判断Agent使用的信息是否真正描述同一个系统状态。
Agent 的核心思想就是「让大模型围绕目标自主行动」——它不是更聪明的聊天机器人,而是会用工具的 AI。而这一切的起点,不过是一个能跑 Python 的环境。地基打好了,接下来才谈得上去调用大模型。下一课,我们就获取模型 API,亲手写出你的第一个 AI 程序,并且同时支持 OpenAI 和 DeepSeek 两种模型。
视频理解是计算机视觉领域的核心任务,旨在让机器像人类一样解读动态视觉信息。其原理在于通过模型提取视频的时空特征,识别动作、物体与事件。传统的视频理解模型通常被动处理整段视频,计算效率低且易受冗余信息干扰。随着大型语言模型(LLM)和视觉语言模型(VLM)的发展,一种名为“LensWalk”的新范式应运而生,它通过赋予AI Agent主动的视觉探索能力,实现了从“全盘接收”到“按需索取”的根本性转变
从大模型对话到智能体(AI Agent)工程化,AI应用开发正进入“能干活”的新阶段。随着多步推理能力增强、上下文窗口扩大以及MCP等工具调用协议普及,开发者可以将模型与外部系统高效连接,在垂直场景中完成从概念验证到生产落地的闭环。在硬件领域,Agent可辅助生成Verilog模板和测试平台,提升规则型编码效率;在内容产业,AI短剧通过剧本生成、角色设定、分镜脚本、镜头生成、配音合成和剪辑的流水线
人工智能技术正从单一模型能力竞赛,转向以工程化为核心的系统性落地。大模型作为通用底座,其价值依赖于外围的AI Infra、AI编程、AI测试等环节的协同。理解AI应用开发的基本原理,掌握工具链与Agent机制,是把模型能力转化为业务效益的关键。在软件研发领域,AI编程已从辅助编码演进为代码审查;在内容产业,AI短剧与电商场景借助生成式AI实现了流水线生产。但无论是智能体还是内容工具,都需要明确边界
大模型能力日益趋稳,行业焦点正从模型参数转向真实业务场景中的工程化落地。要让AI真正创造价值,核心不在于调用多强的模型,而在于围绕具体任务构建可用的系统——这需要理解AI Agent的任务拆解与反馈机制,掌握AI编程工具在团队协作中的规范使用,也离不开模型部署、量化与缓存等基础设施的支撑。与此同时,AI短剧、AI视频生成等内容生产方向迅速兴起,角色一致性、提示词设计和版权合规成为实践中的关键挑战。
视频是集画面、语音、字幕与时间线于一体的复合信息流,而传统AI Agent在面对视频时往往束手无策——这一痛点恰好暴露了模型能力与工程流程之间的巨大鸿沟。本文从多模态理解的基本概念出发,剖析视频分析背后的核心技术原理:如何通过抽帧、音频转写、视觉描述与时间线对齐,将一段动态影像转化为结构化的可检索数据。在此基础上,进一步探讨技术选型的关键考量——为何Skill机制比MCP服务或模型微调更适合固定流
随着大模型能力从概念验证走向实际生产,AI Agent、本地部署、AI短剧与AI编程等方向正加速进入工程化阶段。理解Agent设计的核心挑战,如状态管理、工具调用与失败恢复,是构建可靠应用的基础。本地部署模型通过Ollama等工具降低了隐私与成本门槛,让数据不出本地即可享受智能服务。在内容创作领域,AI视频与音频工具的结合正在重塑短剧制作流程,而AI编程助手与Spring AI框架则让Java开发
本文分析复杂 ChatGPT、Codex 任务开始前为什么应该优先定义“不变量”,并从数据、兼容性、权限、副作用和架构边界等角度说明Invariant如何约束Agent长期执行,同时通过“不变量保持率”判断复杂任务是否始终守住关键工程边界。
本文分析 ChatGPT、Codex 在复杂任务中为什么会出现“每一步都合理、最终结果却偏离目标”的现象,并从局部正确、目标锚点、不变量和阶段Checkpoint等角度拆解目标漂移问题,同时通过“目标偏移率”判断Agent是否仍然朝原始目标推进。
Plan 模式 =提示注入(软)+ 权限/沙箱强制(硬),两层缺一不可,只拼提示词是假安全;提示注入的正确姿势是追加 system-reminder,不是改写用户消息或历史消息(Cache 命中率会崩);硬强制的两条技术路线:Claude Code 的工具层策略函数(精细) vs Codex 的操作系统层沙箱(彻底),可以叠加使用;计划要落成工件(文件/文档),它是人工审批门的载体,也是跨会话的知
深度学习系统的并发调度,必须深入算力与显存的物理本质。“彻底抛弃固定条数的粗放思维,以 Token 动态预算为装箱标尺,在保证显存绝对安全的前提下将 GPU 矩阵算力压榨至理论巅峰”,是保障大模型批处理服务在复杂异构长短文本冲击下实现零 OOM、高吞吐稳定交付的标准工业级范式。
矩阵工具正在换代:第一代人工逐平台搬运,第二代一键分发只解决「发得快」,选题与复盘仍是人的负担;第三代 AI Agent 全链路接管「选题-创作-发布-复盘」闭环。本文从工程视角复盘三代进化,拆解一键分发的三个架构断裂点与全托管五层架构(编排/选题/创作/发布/复盘),附机器门禁重写循环等落地避坑清单,并给出趋势判断:分发工具的终局是增长操作系统。
真正的系统级性能调优,必须直击操作系统的底层分配器。“通过开启 jemalloc 后台回收线程,将脏页衰减时间压缩至 1 秒,将 Arena 数量死死限制在 2 个”,配合 Prometheus 深层度量监控,从物理内存最底层彻底终结 Redis 碎片虚胖,是用硬核内功为企业换取数倍硬件利用率提升的工业级技术典范。
访谈的质量上限,在走进会议室之前就定了。背景功课里,ChatGPT 负责铺开面,判断哪几句值得追问是我的事。
本文分析 ChatGPT、Codex 长任务为什么容易越跑越长,并从任务扩张、无效重试、执行预算和暂停检查点等角度拆解 Agent 的执行控制问题,同时通过“有效执行率”判断每一步是否真正推动任务接近完成。
本文分析需求中途变化后,ChatGPT、Codex为什么仍可能继续执行旧计划,并从Plan Drift、失效假设、Current State与Replan机制等角度拆解长任务中的计划漂移问题,同时通过“计划失效率”判断Agent是否仍在基于过期前提执行。
未来浏览器将从“网页查看器”进化为融合AI、WebGPU、去中心化身份与实时协作的智能操作系统。通过意图驱动导航、无标签页聚合视图、原生隐私保护及低延迟协议,浏览器将重塑人与信息的关系。开发者需转型为体验架构师,以用户意图为核心构建应用。这一变革或将颠覆广告与订阅模式,推动Web迈向更高效、安全、自主的新纪元。
Jev 是 TypeSafe 推出的 System One 决策模型,专为 AI Agent 高频原子判断设计。它不生成文本,仅输出带概率校准的结构化决策(Noul/Choice/Score),解决传统 LLM 在分支判断中慢、贵、格式幻觉问题。通过并行多任务、低延迟(150ms)、低成本(输出免费)及置信度可量化,适用于无人零售、机器人调度、RAG 过滤等场景。推荐与 LLM(System2)快
本文从任务拆分、上下文独立性、并行收益和协调成本几个角度,分析ChatGPT、Codex什么时候适合单Agent、什么时候值得切到多Agent,并通过“多Agent净收益率”判断拆分是否真的提升效率。
本文从复杂Agent任务启动过程出发,拆解哪些上下文应该优先提供、哪些适合按需加载、哪些反而应该避免一开始全部塞入,并通过“有效上下文率”判断ChatGPT、Codex是否真正拿到了高质量信息。
本文从多Agent协作场景出发,分析任务状态应该放在上下文、文件、数据库还是事件系统,并给出从文件到数据库、Event Log和Event Bus的渐进式架构方案。
本文以复杂Agent开发任务为例,给出“理解→设计→实现→验证→收尾”的五阶段拆分方式,并通过“阶段返工率”判断任务拆分是否真正减少了ChatGPT、Codex在长任务中的返工与方向漂移。
本文整理自 2026 年 9 月 18 日 HDD·HarmonyOS 创新论坛上海站支付宝技术部解决方案架构师的分享。内容说明阿宝作为 AI 版支付宝的定位与生活智囊团、钱包小助手、办事小帮手三类能力,解释阿宝选择小艺的原因与小艺 20 多个系统级入口的优势,并拆解双方分工:小艺负责意图理解与智能分发,阿宝负责专业执行。场景分服务直达与服务执行两类,覆盖 70 多个场景,执行环节采用云侧规划决策
AI Agent
——AI Agent
联系我们(工作时间:8:30-22:00)
400-660-0108 kefu@csdn.net