logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

视频理解与行为识别:3D卷积与双流网络的应用

从双流网络的“分而治之”到3D卷积的“端到端学习”,再到如今融合注意力与Transformer的“全面感知”,视频行为识别技术在短短十年间经历了飞跃式的发展。双流网络教会了我们如何显式地利用运动信息,3D卷积教会了我们如何隐式地学习时空特征。而今天的优秀模型,往往是在深刻理解这两种思想的基础上,进行巧妙的融合与创新。展望未来,随着硬件性能的提升和新架构的出现,机器对视频的理解能力将越来越接近人类。

#3d#深度学习#神经网络 +1
从印刷体到手写体:OCR文字识别技术演进与端到端实践

OCR技术的演进史,本质上是人类对“文字数字化”认知的深化史。从早期依赖规则的机械匹配,到如今具备理解能力的智能系统,每一次技术跃迁都在拓展人机交互的可能性边界。对于开发者而言,构建鲁棒OCR系统的关键不在于盲目追求最新模型,而在于深刻理解数据、算法、场景的三元协同。印刷体识别已趋成熟,手写体识别仍在攻坚,而未来的方向将是多模态融合与认知推理的深度整合——让OCR系统不仅能“看见”文字,更能“理解

#深度学习#人工智能#目标检测
Transformer:AI与深度学习领域的革命性架构

Transformer不仅仅是一种神经网络架构,它代表了一种新的AI范式——基于大规模数据和计算的通用学习框架。从最初的机器翻译任务到如今的多模态大模型,Transformer已经证明了自己作为基础架构的强大能力。然而,技术发展永无止境。Transformer的成功启发我们重新思考AI系统的基本构建块,探索更高效、更智能、更可解释的下一代架构。无论未来AI技术如何发展,Transformer都将在

#人工智能#transformer#深度学习
ResNet:深度学习中的“捷径革命”

残差网络的成功不仅仅是一个技术突破,更是一种哲学启示:有时候,最直接的路径——添加一个简单的捷径——比复杂的绕行更有效。在追求更复杂模型的时代,ResNet提醒我们优雅简洁的力量。从2015年至今,残差连接已经从一种创新设计演变为深度学习的基础构件。它的影响远远超出了计算机视觉领域,渗透到人工智能的各个方面。

#网络#深度学习#人工智能
深度信念网络DBN:引爆深度学习革命的引信

深度信念网络可以被看作一个由多个 RBM堆叠(stack)而成的生成式神经网络模型。底层:若干层构成一个有向的、自顶向下的生成模型(如 P(x∣h1),P(h1∣h2)P(x∣h1​),P(h1​∣h2​) 等)。顶层:最顶上两层之间的连接是无向的,构成一个联想记忆(associative memory),即一个RBM。这种结构赋予了 DBN 强大的表征能力:它既可以通过顶层的无向连接进行联想和补

#深度学习#人工智能
DeepLearning:深度学习的“寒武纪大爆发”前夜

重读2006年这篇《Reducing the Dimensionality of Data with Neural Networks》,我们仿佛能看到在神经网络研究的沙漠中,一位孤独的拓荒者终于找到了一眼甘泉。他没有昂贵的设备(当时甚至还需要用缓慢的CPU跑实验),也没有海量的数据,但他凭借对生物学习的深刻理解和二十年如一日的坚持,硬是在坚硬的冻土上凿开了一道裂缝,让阳光得以照进。对于今天的AI从

#深度学习#人工智能
深度学习的“活化石”:LeNet-5原理拆解与应用场景解析

python"""经典的LeNet-5架构(适配32x32输入)"""# 卷积层部分self.conv1 = nn.Conv2d(in_channels=1, out_channels=6, kernel_size=5, stride=1, padding=2)# padding=2 保持尺寸为32# 池化层self.pool = nn.AvgPool2d(kernel_size=2, strid

#深度学习#人工智能
深度学习的基石:详解梯度下降及其优化算法

从朴素的梯度下降思想,到充满噪声但高效的SGD,再到引入惯性的动量法,再到实现“因材施教”的自适应学习率,最终诞生出集大成的Adam及其变体,优化器的进化史就是一部人类探索智能的浓缩史。理解这些算法的核心思想,不仅能帮助我们更好地调参,更能让我们在构建人工智能解决方案时做出更明智的技术选型。正如在Ultralytics平台上训练YOLO模型时,无论是选择SGD还是AdamW,都取决于你对收敛速度与

#神经网络#人工智能#深度学习
超分辨率重建SR:让模糊图像变清晰的深度学习魔法

回顾超分辨率重建的发展历程,我们仿佛见证了一场从“魔法”到“科学”的进化。早期的插值法像是一种粗糙的猜测,基于重建和稀疏编码的方法像是精心的手工艺品,而深度学习则赋予了这一领域真正的“智能”。从SRCNN的开疆拓土,到ESRGAN的感知真实,再到SSR-SIM的物理融合,每一次技术突破都在拓展着超分辨率重建的能力边界。今天,这项技术已经从实验室走向真实世界,在安防监控、医学影像、科学发现、文化传承

#人工智能#超分辨率重建#深度学习 +1
从像素到文字:深度学习如何实现“看图说话”

对于人类来说,看到一幅画并说出“一只狗在追飞盘”似乎毫不费力。但这个过程实际上涉及极其复杂的认知活动:我们需要识别出“狗”、“飞盘”这些物体,理解“追”这个动作关系,判断这是“一只”狗而非多只,最后将这些信息组合成合乎语法的句子。对机器而言,这个任务的难度被放大无数倍。图像描述(Image Captioning)任务的目标正是让机器能够自动分析图像内容,并生成准确的自然语言描述。这本质上是在建立一

#深度学习#人工智能
    共 65 条
  • 1
  • 2
  • 3
  • 7
  • 请选择