
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
AI 会分析用户指令中的描述,比如“右上角的”“绿色的”“带购物车图标的”,然后结合 OCR 识别出的文字、元素位置、视觉特征进行匹配。它不是生成一串动作就结束,而是在“观察、决策、执行、再观察”的循环里,直到任务完成、失败退出,或者遇到必须交给人的节点。Computer Use 是 Anthropic 在 Claude 3.5 Sonnet 中推出的一项能力,让 AI 能够直接操作计算机,通过模

今天鸭鸭刷到一段挺扎心的发言:5 月 13 日,一家头部大厂的创始人在 AI 开发者大会上抛出一句让所有写代码的人心里咯噔一下的判断:“代码能力越来越重要,但代码本身正在变得不值钱。同一场演讲里他还往前推了一句:软件正在成为快消品,软件行业被重新定义。他还顺手亮了一组数字。大会上同期发布的代码智能体产品,号称 90% 的代码都是 AI 自动生成的,累计服务用户超过 1000 万,对外标的应用价值

很多人说自己会 LoRA,其实只是会写一段配置。比如简历上写:熟悉 LoRA / QLoRA 微调,使用 PEFT 完成大模型适配。面试官一般不会停在这。他会继续问:“LoRA 为什么叫低秩?“A 和 B 两个矩阵分别干什么?“为什么常见配置只挂 q_proj、v_proj?“推理时合并权重和不合并权重,差别是什么?这时候,只答一句“LoRA 省显存”,就不够了。省显存只是结果。面试官想听的是你知

它最后的回答可能没有直接泄密,但它发出去的一串搜索 query,拼在一起,反而能把内部信息暴露出来。Meta 的 Llama Guard 4 是开源的多模态安全分类模型,基于 Llama 4 Scout 裁剪微调,原生支持文本和图像安全分类,也采用了更标准化的风险分类体系。AI 护栏也是一样,它不该让模型什么都不敢答,重点是在遇到异常输入、恶意指令、敏感信息、违规输出时,把风险挡住。没有护栏的 A

LLM 推理是靠批处理把多个请求打包一起算——GPU 一次 forward 给 batch 里所有请求各算一个 token,100 个请求的 batch 和 1 个请求耗时差不多,吞吐直接翻几十倍。1)把同时到达的请求按 token 长度打包,比如用户 A 发 2 个 token、用户 B 发 4 个、用户 C 发 6 个,聚合器会把短的补齐到相同长度,打成一个矩阵扔给 GPU 一次算完。GPU

LLM 的上下文窗口是有限的,比如 Claude 的上下文是 200K token,一个 Skill 文件如果写了好几千 token,再加上用户的对话历史和系统提示词,很容易把上下文撑满。”她说,“判断一个 Skill,得看它教 Agent 怎么做事,还要看它带了哪些材料和门禁。当 Agent 碰到某类任务,就去读对应的 Skill,按里面的步骤一步步执行,不用你每次从头教它。“生成一张能看的页面

以自动化客服为例,客服 Agent 可以通过 A2A 把“核对账单”和“判断退款资格”分别委派给账务 Agent、退款 Agent;这些专业 Agent 再通过 MCP 访问 CRM、订单数据库和公司知识库。Agent 与 Agent 横向协作,Agent 与工具纵向连接。这不是协议强制规定的画法,但很适合快速讲清二者职责。

今天这场面试,一进门我就觉得不太对。桌上没有常见的算法题白板,也没有让我手写代码。面试官把一副耳机推到我面前,说:“先听一下。我戴上耳机,里面是一段实时语音 AI 的演示。用户刚说到一半,AI 已经开始接话;用户突然插嘴打断,它又能立刻停下来重新听。那种感觉不像以前的语音助手,等你说完一句,转成文字,再慢悠悠回复。它更像一个正在和你抢话的人。她说:“最近 GPT-Live 这类实时语音系统又被讨论

归一化可以理解成统一格式。工具注册时只维护一份标准 JSON Schema,真正调用模型前,系统根据目标 Provider 自动清洗和转换,把 OpenAI、Anthropic、Gemini、xAI 等模型提供商的差异挡在适配层里。这样一来,上层工具只需要描述自己叫什么、接收哪些参数、参数类型是什么。至于某家不支持。

今天鸭鸭刷到一条挺有意思的招聘新闻。外媒 Business Insider 报道称,谷歌内部文件显示,从今年下半年起,计划在软件工程师招聘的“代码理解”面试环节,允许候选人使用谷歌官方认证的 AI 助手;试点阶段将统一使用自研模型 Gemini。谷歌发言人向媒体证实了这一安排。报道里写得很具体:候选人要在现有代码库里做阅读、排错和优化;面试官会重点看“AI 应用熟练度”,包括提示词工程、对 AI








