logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

LLM-as-a-Judge:把大模型评估变成一门工程能力

LLM-as-a-Judge(简称 LLM Judge)是一种评估范式:让一个能力更强或独立配置的大模型,充当“裁判”,去评估另一个模型的输出质量。它的目标不是替代人工,而是在可控成本下,逼近人工判断。自 GPT-4 之后,研究和实践都发现:强模型在很多开放任务上的评估结果,与人类偏好高度相关。在一些任务上,一致率可以达到 85%-95%。这使得 LLM-as-a-Judge 从研究实验,迅速进入

#人工智能
自己动手建 Claw 帝国:OpenClaw(及新兴 Claws)底层架构大揭秘!

OpenClaw 在 84 天内狂揽 20 万 GitHub Stars,成为史上增长最快的开源仓库!现在很多人用一台老游戏本就能跑起全自主 AI 代理:在 Telegram 发一条消息,就能让它帮你管理整个邮箱、控制智能家居,甚至拍 TikTok 爆款视频。Andrej Karpathy(@karpathy)上周末专门去苹果店买了台新 Mac mini,就为了在家玩 Claw。他吐槽店员说:“这

文章图片
#架构
传统ML推理 vs LLM推理:为什么大模型需要专属高性能推理引擎?

传统ML推理是“固定输入、固定输出、独立请求”,LLM推理则是“变长输入、变长输出、强依赖缓存、动态路由、两阶段分离”。几乎每个环节都不一样,这也是为什么LLM推理引擎必须从零重构的原因。👉 你还知道LLM推理和传统推理之间其他重要的区别吗?欢迎在评论区分享你的发现!我们下期继续深挖Paged Attention和更前沿的推理优化技术。(完)

文章图片
#人工智能#机器学习
AI 大模型安全 API 校验机制的设计与实现:基于签名验证的创新方案

服务端签名响应:AI 模型服务器在生成响应后,使用官方私钥对响应内容签名,并将签名附加到输出中。用户接收后,用官方公钥验证。客户端签名 Prompt:用户生成 RSA 或 ECDSA Keypair,将公钥注册到服务器。发送 Prompt 时,用私钥签名 Prompt,服务器验证签名后处理请求。这取代 API Key,避免 Key 静态泄露。官方密钥对:AI 服务提供商生成一对非对称密钥(私钥保密

#人工智能#安全#unity
AI Agent 的核心秘密:不是大模型,而是 Harness 工程

Agent 的本质从来不是大模型本身,而是围绕它构建的 Harness 系统。模型提供智能,Harness 让智能落地。谁把 Harness 工程做得越深、越巧妙,谁就能把今天的模型变成明天的超级生产力引擎。这才是 AI Agent 时代真正的“内功心法”。我是紫微AI,我们下期见。(完)

文章图片
#人工智能
大模型为什么总“忘记”中间信息?Lost in the Middle的注意力陷阱

Lost in the Middle不是巧合,而是Transformer softmax竞争 + Attention Sink + Recency Bias + 有限bandwidth的必然产物。模型本质是个聪明的“内存路由器”,而不是全能记忆体。搞懂这一点,你不仅能写出更稳的prompt,还能看清下一代长上下文架构的真正突破口在哪里。context长度只是表象,attention带宽才是决定模型

#人工智能#transformer
大模型越练越强,靠的不是魔法,而是这些RL“健身房”

前沿实验室谁先把RL环境创建规模化,谁就能在训练信号上领先。算力大家都在买GPU,真正差的是“更好、更广、更快的训练数据”。xAI这种新生代实验室如果从头就把分布式赏金+多层验证+现有tutor程序结合,说不定就能10倍环境多样性、成本砍到几分之一。这个平台还没出现,但所有拼图都齐了:LLM能做对抗验证、全球领域专家愿意为100-200刀干活、容器化沙箱已经是标配。迟早有人把它做出来。读完这篇文章

文章图片
#人工智能
LLM Agent 非法动作频发?Google DeepMind 用 AutoHarness 自动生成代码“安全带”,小模型直接反超大模型!

AutoHarness 用一个简单却天才的思路——让小模型自己合成代码护栏——就解决了 LLM Agent 最头疼的非法动作问题。145 个游戏 100% 合法,小模型反超大模型,还能生成零推理成本的全代码策略。在规则世界里,代码才是最硬的护栏。下次做 Agent 时,不妨试试这个自动进化思路,绝对会让你眼前一亮。我是紫微AI,我们下期见。(完)

#人工智能
你是不是也为大模型长上下文“内存杀手”头疼?Google TurboQuant:6倍压缩、8倍提速、零精度损失,彻底重塑AI效率!

本质上,TurboQuant 解决的是一个“系统结构问题”,而不是单纯的“技术加速问题”。它告诉我们:当模型参数已经够强时,真正的降维打击来自对数据表示和存储方式的重新思考。AI 拼的不是模型大小,而是谁能把内存和速度的矛盾用最优雅的结构化解。下次再遇到 KV Cache 爆炸,别急着加显存,先想想 TurboQuant 这种极致思路,说不定就能打开新世界。我是紫微AI,我们下期见。(完)

#人工智能
如何让AI大模型来推荐你的产品(ChatGPT, AI Overviews & More)

这些页不是给人看的,而是给模型喂“单源真相”。如果你把关键信息埋在长文里,或者需要跨页跳转,AI直接跳过,转而选那些“直给”的来源。过去一年,我和团队帮多个DTC品牌实测下来,发现这不是运气问题,而是大多数人还在用“Google思维”打AI推荐的仗。自己动手做“XX品类Top10”“A vs B对比”,投放到有权重的外部域名,既拿backlink,又给AI提供清晰的“购买决策地图”。就像厨师做菜,

文章图片
#人工智能
    共 641 条
  • 1
  • 2
  • 3
  • 65
  • 请选择