
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
残差连接统治深度学习十年,但它的"等权累加"在百层网络中正在拖后腿。Kimi团队发现:残差连接本质上就是深度维度的RNN!既然Transformer已经在时间维度用Attention干掉了RNN,深度维度为什么不行?AttnRes应运而生——48B模型上GPQA暴涨7.5分,推理开销不到2%。十年的"公式",终于该改了。

claude computer use接管你的电脑

Claude Code 源码意外泄漏,1906个文件全曝光,我发现了这些秘密

Claude Code 的历史 Prompt 全藏在本地却看不见。一个纯本地、只读、开源的桌面工具:聚合、搜索、统计、按日期一键导出 Markdown。

Anthropic 发布高于 Opus 的 Mythos-class 新层级:Fable 5 与 Mythos 5 同底座、差护栏。讲清订阅用户在 Claude Code 的免费窗口与额度规则、长时域自主的四个底层支柱、护栏静默降档机制与选型判断。

面向非算法岗的大模型可解释性系统梳理。以四阶段脉络串起 2020–2026 年核心成果:叠加现象(为什么神经元读不懂)→ SAE(3400 万特征与金门大桥实验)→ 归因图(虚假思维链、跨语言思维、多跳推理)→ 人格向量(AI 性格的物理开关与助手轴)。不堆公式,附五条实用启示。

MIT 实验证实:重度使用 AI 的人,大脑连接反而最弱。当所有人都会用 Cursor 和 Claude Code,"会用 AI"早就不是壁垒了。本文提出护城河堆栈模型——宽度被抹平、深度才是差异化、沉淀才是复利。你和别人的三年差距不是来自勤奋,是来自沉淀率。附今晚就能做的三个反共识动作。

本文围绕 Subquadratic 发布的 SubQ 1M-Preview 与 SSA(Subquadratic Sparse/Selective Attention)架构展开分析,拆解其“1200万 Token 上下文”“52倍 prefill 加速”“成本低于 Opus 5%”等核心宣称背后的技术含义与边界。文章重点讨论 dense attention 的平方复杂度瓶颈、SSA selecto

全网都在搬运官网公告,本文补两个被跳过的洞:Slack 是什么、你到底能不能用;再拆透 Karpathy「LLM 第三次重新设计」的范式三连跳(拉→推、1对1→N对1、同步→异步),并给出一份可套用飞书/钉钉的团队级 AI 同事选型清单。

本文基于 ~/.claude/ 与 ~/.codex/ 中前后各 15 天的真实日志,从使用占比、线程数、提示词长度、工具调用、权限模式和验证行为等维度,复盘 Claude Code 切换至 Codex 的全过程。数据显示,Codex 使用占比从约 20% 提升至 70%,工具相关输入从 25.5% 降至 7.7%。文章认为,工作入口迁移并不等于生产力提升;Coding Agent 真正的迁移成本








