logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

深度学习进阶(十五)通道注意力 SE

而位置体现在空间信息中,特征则体现在通道信息中。我们在之前的内容里所介绍的内容,基本都是围绕前者而展开的:自注意力、窗口注意力、可变形卷积,本质上都是在让模型更灵活地聚焦空间位置。显然,我们又发现了新的优化空间。于是,18 年的论文便从这个问题出发,提出了一种轻量级的,让网络能够,并根据全局信息对每个通道的重要性进行重新校准。

#深度学习#人工智能
现代 LLM 的核心架构设计其四:GQA

这本身是为了增加表达能力的合理设置,但 KV Cache 出现后,KV Cache 需要为每个头单独存储一份 K 和 V。个 Query Head 而言,8 个 KV Head 已经能够保留足够丰富的注意力模式,同时又能让 KV Cache 缩小到原来的。但代价也很明显:不同 Query Head 已经被证明会关注不同模式,把它们绑定到同一份 K、V 上,必然损失表达能力。KV Cache 的瓶颈

#信息可视化
记一次 Apache SeaTunnel 中 CANCELING 状态卡死问题的排查过程

因为如果 Master 上已经找不到对应的 Job,往往意味着该 Job 已经结束,并且已经从运行中的 Job 列表中移除。如果由于心跳异常等原因,Worker 节点暂时从集群视图中消失,那么循环可能会直接退出,甚至连 Cancel 请求都没有发送出去。问题不仅仅在于 Cancel RPC 可能发送失败,更重要的是,Worker 的最终状态通知有可能在 Master 恢复期间丢失。它会向正在运行的

#apache
1.3B token 的代码知识库:OpenDeepWiki 最新 wiki 质量抽检

第一,目录结构是懂项目边界的。它可以从 Git URL、ZIP 包、本地目录导入仓库,生成结构化 wiki、README 摘要、多语言内容、思维导图和可选 Graphify 产物,再把同一份知识复用到公开文档站、内置聊天、嵌入式聊天 API 和 MCP 端点里。OpenDeepWiki 的价值不在于“AI 自动写文档”这句口号,而在于它已经把代码知识库做成了一条可运营的流水线:导入、分析、目录生成

#python
墨水屏也开始加入 AI Coding 大军了?

有意思的是,Hackaday 报道称,开发者通过重新设计驱动方案,让电子墨水屏实现了接近 60Hz 的刷新体验,试图摆脱传统阅读器刷新慢、只能看书的刻板印象。随着 AI Coding 成为日常,也许未来的开发设备不一定是 RGB 灯效拉满的机械键盘,而是一块更护眼的墨水屏,陪你和 AI 安静地干一天活。最近,一台运行 Claude Code 的电子墨水屏设备在 X 上火了,不少开发者看完后的第一反

#人工智能
Claude手搓的IntelliJ Git扩展插件上线

但我总记不住,也不想去住,每次操作都要翻小本本。一直要开发一个插件,无奈不会啊。我之前是.NET专业户,VS扩展倒是开发了一些,IntelliJ插件从没开发过,年纪大了也懒点去学。

#git
关键数据字段流转

0.001 看起来极低,但实际合理:SpaceMouse 静止时输出接近 0,任何实际操作的 L2 范数通常在 0.01~1.0 量级,远超 0.001。EggFlip 的 0.5 秒冷却期是唯一的"软化"——不是 fade-in,而是延迟切回。好处:如果想把机器人从 Panda 换成 UR5,只需换掉最底层的 BaseEnv,上面的干预逻辑和图像处理逻辑直接套上去就能复用。硬切换不出问题的核心原

#windows
排障清单(看到 Failed opening required 时直接照做)

把include和require用好,不只是语法问题,而是工程能力问题。你的代码运行在操作系统、权限模型、缓存机制和部署流水线共同构成的环境里。只理解“本地能跑”,远远不够。

#android
到底了