logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

GPQA暴涨7.5分!Kimi用一个公式,终结了残差连接的十年统治

残差连接统治深度学习十年,但它的"等权累加"在百层网络中正在拖后腿。Kimi团队发现:残差连接本质上就是深度维度的RNN!既然Transformer已经在时间维度用Attention干掉了RNN,深度维度为什么不行?AttnRes应运而生——48B模型上GPQA暴涨7.5分,推理开销不到2%。十年的"公式",终于该改了。

文章图片
#架构#transformer
Claude Code 源码意外泄漏,1906个文件全曝光,我发现了这些秘密

Claude Code 源码意外泄漏,1906个文件全曝光,我发现了这些秘密

文章图片
#人工智能
我开源了一个Claude Code历史可视化工具:本地Prompt一键浏览、搜索、导出

Claude Code 的历史 Prompt 全藏在本地却看不见。一个纯本地、只读、开源的桌面工具:聚合、搜索、统计、按日期一键导出 Markdown。

文章图片
#开源#人工智能
今天火爆全球的Claude Fable 5解读:和Mythos 5其实是同一个模型

Anthropic 发布高于 Opus 的 Mythos-class 新层级:Fable 5 与 Mythos 5 同底座、差护栏。讲清订阅用户在 Claude Code 的免费窗口与额度规则、长时域自主的四个底层支柱、护栏静默降档机制与选型判断。

文章图片
#人工智能
大模型可解释性六年全景(2020–2026):SAE、归因图、人格向量三把钥匙

面向非算法岗的大模型可解释性系统梳理。以四阶段脉络串起 2020–2026 年核心成果:叠加现象(为什么神经元读不懂)→ SAE(3400 万特征与金门大桥实验)→ 归因图(虚假思维链、跨语言思维、多跳推理)→ 人格向量(AI 性格的物理开关与助手轴)。不堆公式,附五条实用启示。

文章图片
#人工智能
AI 时代最大的谎言:你以为在学习,其实在欠债—思维决定上限的反焦虑框架

MIT 实验证实:重度使用 AI 的人,大脑连接反而最弱。当所有人都会用 Cursor 和 Claude Code,"会用 AI"早就不是壁垒了。本文提出护城河堆栈模型——宽度被抹平、深度才是差异化、沉淀才是复利。你和别人的三年差距不是来自勤奋,是来自沉淀率。附今晚就能做的三个反共识动作。

文章图片
#人工智能#学习#AI
SubQ 与 SSA 架构深度解析:Transformer 的敌人不是更大模型,而是更便宜的长上下文

本文围绕 Subquadratic 发布的 SubQ 1M-Preview 与 SSA(Subquadratic Sparse/Selective Attention)架构展开分析,拆解其“1200万 Token 上下文”“52倍 prefill 加速”“成本低于 Opus 5%”等核心宣称背后的技术含义与边界。文章重点讨论 dense attention 的平方复杂度瓶颈、SSA selecto

文章图片
#架构#transformer#深度学习
Claude Tag 深度拆解:使用门槛、范式转变与国内落地

全网都在搬运官网公告,本文补两个被跳过的洞:Slack 是什么、你到底能不能用;再拆透 Karpathy「LLM 第三次重新设计」的范式三连跳(拉→推、1对1→N对1、同步→异步),并给出一份可套用飞书/钉钉的团队级 AI 同事选型清单。

文章图片
#人工智能
Claude Code 迁移 Codex 实战复盘:基于 15 天本地日志分析使用量、信任成本与失败地图

本文基于 ~/.claude/ 与 ~/.codex/ 中前后各 15 天的真实日志,从使用占比、线程数、提示词长度、工具调用、权限模式和验证行为等维度,复盘 Claude Code 切换至 Codex 的全过程。数据显示,Codex 使用占比从约 20% 提升至 70%,工具相关输入从 25.5% 降至 7.7%。文章认为,工作入口迁移并不等于生产力提升;Coding Agent 真正的迁移成本

文章图片
    共 230 条
  • 1
  • 2
  • 3
  • 23
  • 请选择