logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Codex 已经能操作 Windows,谁敢把「确认」按钮交给它?

AI 会分析用户指令中的描述,比如“右上角的”“绿色的”“带购物车图标的”,然后结合 OCR 识别出的文字、元素位置、视觉特征进行匹配。它不是生成一串动作就结束,而是在“观察、决策、执行、再观察”的循环里,直到任务完成、失败退出,或者遇到必须交给人的节点。Computer Use 是 Anthropic 在 Claude 3.5 Sonnet 中推出的一项能力,让 AI 能够直接操作计算机,通过模

文章图片
#人工智能#面试#后端
Leader:“代码本身正在变得不值钱。” 我:“那我工资按啥定?” Leader:“按 AI 帮公司省下的那部分。”

今天鸭鸭刷到一段挺扎心的发言:5 月 13 日,一家头部大厂的创始人在 AI 开发者大会上抛出一句让所有写代码的人心里咯噔一下的判断:“代码能力越来越重要,但代码本身正在变得不值钱。同一场演讲里他还往前推了一句:软件正在成为快消品,软件行业被重新定义。他还顺手亮了一组数字。大会上同期发布的代码智能体产品,号称 90% 的代码都是 AI 自动生成的,累计服务用户超过 1000 万,对外标的应用价值

文章图片
#人工智能
面试官:“什么是低秩适配 LoRA?” 我:“省显存。” 面试官:“那 A 和 B 到底怎么训?”

很多人说自己会 LoRA,其实只是会写一段配置。比如简历上写:熟悉 LoRA / QLoRA 微调,使用 PEFT 完成大模型适配。面试官一般不会停在这。他会继续问:“LoRA 为什么叫低秩?“A 和 B 两个矩阵分别干什么?“为什么常见配置只挂 q_proj、v_proj?“推理时合并权重和不合并权重,差别是什么?这时候,只答一句“LoRA 省显存”,就不够了。省显存只是结果。面试官想听的是你知

文章图片
#人工智能#算法
去大模型安全岗面试,面试官把 MosaicLeaks 甩给我,问 Agent 为什么会泄密,我说加个提示词,他沉默了......

它最后的回答可能没有直接泄密,但它发出去的一串搜索 query,拼在一起,反而能把内部信息暴露出来。Meta 的 Llama Guard 4 是开源的多模态安全分类模型,基于 Llama 4 Scout 裁剪微调,原生支持文本和图像安全分类,也采用了更标准化的风险分类体系。AI 护栏也是一样,它不该让模型什么都不敢答,重点是在遇到异常输入、恶意指令、敏感信息、违规输出时,把风险挡住。没有护栏的 A

文章图片
#安全#面试#人工智能
面试官:“DeepSeek 半夜半价是怎么做到的?”我写下 1000 个用户一人 1 token

LLM 推理是靠批处理把多个请求打包一起算——GPU 一次 forward 给 batch 里所有请求各算一个 token,100 个请求的 batch 和 1 个请求耗时差不多,吞吐直接翻几十倍。1)把同时到达的请求按 token 长度打包,比如用户 A 发 2 个 token、用户 B 发 4 个、用户 C 发 6 个,聚合器会把短的补齐到相同长度,打成一个矩阵扔给 GPU 一次算完。GPU

文章图片
#人工智能#面试#后端 +1
面试官:“Skill 不就是存好的提示词?”我打开可编辑 PPT:“提示词会自己跑验收吗?”

LLM 的上下文窗口是有限的,比如 Claude 的上下文是 200K token,一个 Skill 文件如果写了好几千 token,再加上用户的对话历史和系统提示词,很容易把上下文撑满。”她说,“判断一个 Skill,得看它教 Agent 怎么做事,还要看它带了哪些材料和门禁。当 Agent 碰到某类任务,就去读对应的 Skill,按里面的步骤一步步执行,不用你每次从头教它。“生成一张能看的页面

文章图片
#人工智能
我说 OCR 模型够强,PDF 可以直接入库,面试官圈出错位表格:“金额都跑到公司名里了,你检索什么?”

以自动化客服为例,客服 Agent 可以通过 A2A 把“核对账单”和“判断退款资格”分别委派给账务 Agent、退款 Agent;这些专业 Agent 再通过 MCP 访问 CRM、订单数据库和公司知识库。Agent 与 Agent 横向协作,Agent 与工具纵向连接。这不是协议强制规定的画法,但很适合快速讲清二者职责。

文章图片
#人工智能
面试官戴上耳机冷笑:“你管 GPT-Live 叫语音转文字?” 我刚想点头,她直接插话:“那 AI 怎么实现边听边说?”

今天这场面试,一进门我就觉得不太对。桌上没有常见的算法题白板,也没有让我手写代码。面试官把一副耳机推到我面前,说:“先听一下。我戴上耳机,里面是一段实时语音 AI 的演示。用户刚说到一半,AI 已经开始接话;用户突然插嘴打断,它又能立刻停下来重新听。那种感觉不像以前的语音助手,等你说完一句,转成文字,再慢悠悠回复。它更像一个正在和你抢话的人。她说:“最近 GPT-Live 这类实时语音系统又被讨论

文章图片
#人工智能#语音识别
面试官嘲笑:“Agent 换个模型就瞎了,你也敢在简历上写精通?” 我把空读从 64% 干到 0,她急了:“最快多久入职?”

归一化可以理解成统一格式。工具注册时只维护一份标准 JSON Schema,真正调用模型前,系统根据目标 Provider 自动清洗和转换,把 OpenAI、Anthropic、Gemini、xAI 等模型提供商的差异挡在适配层里。这样一来,上层工具只需要描述自己叫什么、接收哪些参数、参数类型是什么。至于某家不支持。

文章图片
#面试#人工智能
谷歌面试官:“以后面试都允许用 Gemini。” 我:“那还考什么?” 面试官:“考你会不会被 AI 带沟里。”

今天鸭鸭刷到一条挺有意思的招聘新闻。外媒 Business Insider 报道称,谷歌内部文件显示,从今年下半年起,计划在软件工程师招聘的“代码理解”面试环节,允许候选人使用谷歌官方认证的 AI 助手;试点阶段将统一使用自研模型 Gemini。谷歌发言人向媒体证实了这一安排。报道里写得很具体:候选人要在现有代码库里做阅读、排错和优化;面试官会重点看“AI 应用熟练度”,包括提示词工程、对 AI

文章图片
#人工智能#面试#职场和发展
    共 46 条
  • 1
  • 2
  • 3
  • 4
  • 5
  • 请选择