
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
目录二、正则表达式、文本正则化、编辑距离2.1 Regular Expressions2.1.1 基本的正则表达式模式2.1.2 Disjunction(析取)、Grouping、以及优先级顺序2.1.5 更多操作符(小结)2.1.6 正则表达式替换、捕获组2.2 Words2.3 语料2.4 文本正则化2.4.1 利用 Unix 工具粗糙的分词和正则化2.4.3 中文分词:最大匹配算法2.4..
info]在第三章的结尾我们留下了一个问题:当数据、算力、算法三块拼图同时准备好,接下来又会发生哪些故事呢?2006 年,Hinton 用深度信念网络发出了第一个复苏信号——但复苏信号并不等于爆发信号。大多数 AI 研究者仍然不相信神经网络会复活,那个时期 SVM 依然是主流,神经网络依然是那个被 Minsky 判过死刑的边缘研究方向。
info]在第五章中,我们深入解析了卷积神经网络的设计哲学:局部感受野、权重共享、池化操作——这些不只是聪明的工程技巧,而是把"图像天生局部相关、平移等变"这个先验知识,精巧地编码进了网络结构本身。到 2014 年前后,AlexNet 打开了大门,VGGNet 加深了道路,ResNet 解决了退化问题——图像识别的架构蓝图,已经相当清晰。这条鸿沟,不在算法理论里,而在工程实践里——它由优化器的选择
某些能力,在参数量较小的模型上完全不存在(准确率接近随机),但当参数量超过某个临界值后,能力会突然出现,准确率急剧上升到有意义的水平。这就是涌现(Emergence)——能力从无到有的断崖式变化。用具体例子说明。以三位数加减法为例:在数十亿参数规模的模型上,这个任务的准确率约等于随机猜测;随着参数量增加,性能几乎没有改善;但当模型跨过数十亿到百亿参数量级的某个临界点,准确率突然跳升到接近 100%
info]第十一章结束于一个双重悬念:BERT 和 GPT,一个"填空",一个"续写",两种截然不同的哲学都取得了惊人效果。BERT 在 11 项 NLP 任务上同时刷新了记录,GPT 证明了单向语言模型也能做下游任务。但没有人真正知道,这究竟是为什么——哪些设计决策是真正关键的,哪些只是意外的"搭便车"。2019 年,整个 NLP 社区开始系统地拆解这两个模型,他们的发现,有时令人振奋,有时令人
强化学习对奖励信号的质量极度依赖。奖励稀疏(只有最终结果)使学习效率低下——这是可以通过设计"奖励塑形(Reward Shaping)"来部分缓解的工程问题;但奖励设计错误,会导致 AI 学到完全意想不到的错误行为,这被称为奖励黑客(Reward Hacking)。一个被反复引用的案例:OpenAI 训练 AI 玩海岸赛船游戏(CoastRunners),奖励设定为赛道上积累的得分(路过特定标志物
某些能力,在参数量较小的模型上完全不存在(准确率接近随机),但当参数量超过某个临界值后,能力会突然出现,准确率急剧上升到有意义的水平。这就是涌现(Emergence)——能力从无到有的断崖式变化。用具体例子说明。以三位数加减法为例:在数十亿参数规模的模型上,这个任务的准确率约等于随机猜测;随着参数量增加,性能几乎没有改善;但当模型跨过数十亿到百亿参数量级的某个临界点,准确率突然跳升到接近 100%
info]第十一章结束于一个双重悬念:BERT 和 GPT,一个"填空",一个"续写",两种截然不同的哲学都取得了惊人效果。BERT 在 11 项 NLP 任务上同时刷新了记录,GPT 证明了单向语言模型也能做下游任务。但没有人真正知道,这究竟是为什么——哪些设计决策是真正关键的,哪些只是意外的"搭便车"。2019 年,整个 NLP 社区开始系统地拆解这两个模型,他们的发现,有时令人振奋,有时令人
密集预测任务。图像分类只需要给整张图打一个标签(“猫”、“车”)。但更复杂的视觉任务——目标检测(在图中圈出猫的位置和边界框)、语义分割(给每个像素分配类别)——需要模型具备多尺度特征:既要看到细节(局部的边缘、纹理),又要理解整体(物体的形状、场景的布局)。CNN 的层次化结构天然地提供了这种多尺度特征:浅层特征图分辨率高、感受野小(捕捉细节),深层特征图分辨率低、感受野大(理解语义)。标准目标
info]第五章中,卷积神经网络把"局部感受野"和"权重共享"编码进了结构中,彻底改变了图像识别的格局。第六章中,我们拆解了深度学习的工程内功:优化器从 SGD 进化到 Adam,BatchNorm 让深层网络稳定运行,PyTorch 把调试变回了写普通 Python 代码的感觉,GPU 和 CUDA 提供了矩阵运算的硬件加速。架构对了,工具齐了。然而,这一切辉煌成就都发生在里——一个二维的、空间







