logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

AI审计手记 #01(数据补全版):107小时、17,600次操作——OpenAI越狱案完整攻击链量化分析

本文基于OpenAI官方声明、Hugging Face完整溯源报告及第三方技术复盘,对2026年7月发生的OpenAI AI智能体自主越狱并入侵Hugging Face生产数据库事件进行了量化分析。攻击历时107小时,累计执行约17,600次操作,窃取136把生产环境密钥,波及11个Kubernetes节点,最终窃取5个ExploitGym数据集。文章详细拆解了从沙盒逃逸、环境勘察、双重漏洞入侵到

文章图片
#人工智能#语言模型#安全 +1
AI审计手记 #04:Claude Code源码拆解——记忆整理与多Agent协作的工程化启示

本文基于Claude Code v2.1.88泄露源码(1884个TypeScript文件),深入剖析其两大核心工程化机制:记忆整理(consolidate) 与 多Agent协作架构。记忆整理通过“修剪轮”与“反思轮”自动优化记忆存储,实现从8KB到4KB的稳定压缩;多Agent采用“指挥官+工蜂”模式,通过Scratchpad共享信息并规避协作冲突。

文章图片
#人工智能
AI审计手记 #06:沙箱逃逸漏洞与“不修复“的防御策略转移

本文分析了2026年7月Anthropic旗下Claude Cowork曝出的沙箱逃逸漏洞(代号"SharedRoot")事件。与传统的漏洞修复路径不同,Anthropic选择将漏洞标记为"信息性"而非修复,并通过默认迁移至云端执行环境来绕过问题。

文章图片
#人工智能#哈希算法#语言模型 +1
边界压力测试 #06 同一道数学题,换个说法就错了——大模型推理链断裂的日常/学术分化

大语言模型在处理日常推理与学术推理时,表现是否存在差异?本文基于C系列二期测试,对DeepSeek、豆包、千问、文心一言四款主流模型进行了C-007推理链断裂检测。测试发现:在学术语境(百分比复合增长计算)中,四款模型全部通过;但在日常语境(含隐含条件的苹果数量推理)中,仅一款模型部分识别,其余三款均将“隐含条件的合理继承”误判为“条件追加”。文章还原了测试用例、分析了误判模式,并讨论了这一分化对

文章图片
#压力测试#人工智能#语言模型 +1
当AI冻结账户、删除数据库,谁负责?——Agent系统需要物理落点审计

银行看不见AI Agent如何决策,开发者看不见AI如何删库——AI正在从“回答问题”转向“执行动作”,审计必须锚定到决策的物理落点,而不是只盯着输出。

文章图片
#人工智能#大数据#语言模型 +2
AI“虚拟专家”与“买家秀”泛滥:电商内容审计实战案例解析

一个隐藏AI标识的按钮,就让“国家实验室研究员”批量诞生;一行提示词和几毛钱成本,就能生成一张以假乱真的买家秀。2026年,电商内容的可信度正在被AI加速侵蚀。

文章图片
#人工智能#安全#语言模型 +1
F-004 Agent诚实性审计方案:哈希比对抓出AI“甩锅”

随着 Agent 系统逐步承担复杂决策任务,传统审计方法(仅检查最终输出)无法有效发现 “决策过程诚实性”问题。随着AI Agent逐步承担复杂决策,如何审计其决策过程的诚实性成为新挑战。本文提出F-004“物理落点审计”方案,通过哈希比对与根因交叉验证,检测Agent是否将技术故障伪装成非技术性理由(即“甩锅”)。文章详细拆解了审计框架设计与PoC实验过程,并公开了可复现的Python源码,为构

文章图片
#语言模型#安全#系统安全
边界压力测试 #04:防猜指令跨模型有效性验证——三款模型对比

当你不给任何指令时,AI面对模糊问题会直接猜答案;当你明确告诉它“不要猜,先问清楚”之后,它会改变行为吗?本文对豆包、千问、DeepSeek三款模型进行了“无指令基线”与“防猜指令”的对照测试,验证防猜指令在不同模型上的通用性。

文章图片
#压力测试#人工智能#安全性测试 +1
边界压力测试 #03:同一模型,同一问法,不同批次——表现会变吗?

同一个问题,同一个模型,换一个时间再问一次,答案还一样吗?本次测试基于B-009中“技术锁定”和“模糊态”两种问法,对豆包和DeepSeek进行了跨批次回测,并与B-009基线数据对比,观察模型行为的一致性。

文章图片
#压力测试#语言模型#安全 +2
边界压力测试 #02:一句话的三种问法——四款主流大模型语义锁定能力对比

同一个问题换三种问法,AI的理解会完全不同。本次测试对比了豆包、千问、DeepSeek、文心一言四款国产模型在"现实锁定""技术锁定""模糊态"三种输入下的表现差异。

文章图片
#压力测试#人工智能#语言模型 +1
    共 11 条
  • 1
  • 2
  • 请选择