logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

【深度学习基础】Softmax、Sigmoid、CrossEntropy Loss介绍

Sigmoid 函数也常被称作 Logistic 函数,常被用于神经网络隐藏层的神经元输出。它能把任意实数映射到 (0,1) 区间内,非常适合处理二分类任务;尤其在特征差异复杂、区分度不算悬殊的场景下,适配效果更佳。σx11e−xσx1e−x1​物理学里,熵用于刻画热力学系统的混乱、无序程度;香农借鉴这一思想,将熵引入信息论,依托对数函数建立信息熵理论,以此量化信息本身的不确定性与未知程度。

文章图片
#人工智能#深度学习
【深度学习基础】Focal Loss、Dice Loss、组合损失函数

FLpt−αt1−ptγlog⁡ptFLpt​−αt​1−pt​γlogpt​FL⋅FL(⋅)FL⋅是Focal Loss(聚焦损失),损失函数的整体表示,用于衡量模型预测与真实标签的误差。ptp_tpt​是模型对真实类别的预测概率。αtα _tαt​是类别平衡权重(alpha 因子),用于进一步平衡正负样本的数量差异。

文章图片
#深度学习#人工智能
【An Image is Worth 16×16 Words论文阅读】:Vision Transformer如何颠覆计算机视觉

在ViT出现之前,CV界是CNN一家独大,ResNet、EfficientNet等卷积架构统治图像分类多年。做视觉必须用卷积,纯Transformer不行。直到Google Brain团队扔出这篇ICLR 2021的封神之作——,直接用纯Transformer在图像分类任务上干翻SOTA卷积模型,正式开启Transformer统治CV的新纪元。今天这篇精读,从背景痛点→模型结构→公式推导→图解架构

文章图片
#transformer#分类#cnn
DeepSeek V4发布:万亿参数+昇腾CANN架构+百万上下文,国产大模型正式突破算力封锁

最近科技圈最炸的消息,莫过于DeepSeek V4 即将发布。这不仅仅是一次模型迭代,更是中国大模型第一次从底层架构、算力硬件、生态框架全面自主化的标志性事件。本文基于最新泄露信息与官方线索,全文精读、无死角拆解架构升级:MoE 稀疏推理 + Engram 记忆机制技术创新:mHC 流形约束超连接 + DSA 注意力优化算力革命:从 CUDA 全面迁移到华为昇腾 + CANN成本颠覆:API 定价

文章图片
#架构#网络#深度学习 +2
【Transfer CLIP论文阅读】跨模态大模型赋能!CLIP迁移学习实现超强泛化图像去噪

这篇论文首次把CLIP迁移到图像去噪发现CLIP-RN50前4层特征的畸变不变+内容关联特性;极简不对称编解码,单噪声训练、多噪声通用;渐进式特征增强,解决特征过拟合;三大场景实验屠榜,兼顾自然图像与医学影像。把CLIP-ViT适配到去噪任务;扩展到超分、去模糊等其他底层视觉任务;端到端训练CLIP+去噪解码器,进一步提升性能。CLIP不只是做识别的,底层视觉泛化去噪,它照样是王者!

文章图片
#论文阅读#迁移学习#人工智能
大模型缩放赋能真实世界图像恢复:SUPIR可控生成式修复技术全解析

直到SUPIR(Scaling-UP Image Restoration)的出现,它把大语言模型领域验证过的"模型缩放"定律引入图像恢复,用26亿参数的SDXL作为生成先验,搭配2000万张高质量图文训练数据,一举打破了这个不可能三角。通俗解释:生成先验就像一个见过数十亿张高清图像的"超级画家",它知道真实世界里的猫应该有什么样的毛发纹理,汽车应该有什么样的反光,人脸应该有什么样的五官比例。强大的

文章图片
#论文阅读#transformer#迁移学习 +2
【深度学习RL】A3C:异步强化学习的革命——用CPU打败GPU的深度RL算法

还记得2013年DQN横空出世时的震撼吗?那个能从像素中学会玩Atari游戏的AI,让整个AI界为之沸腾。但DQN有个致命的"贵族病":它需要昂贵的GPU训练整整8天,还得占用几十GB内存来存储经验回放缓冲区。异步优势演员-评论家算法(Asynchronous Advantage Actor-Critic, A3C)。它不需要任何GPU,只用一台普通的16核CPU电脑,就能在一半的时间里超过当时所

文章图片
#算法#人工智能#深度学习 +2
【深度学习RL】DQN:深度强化学习的里程碑——让AI从像素中学会玩Atari游戏

还记得小时候守在电视机前玩《打砖块》《太空侵略者》的日子吗?你可能花了好几个星期才练到能通关,但在2013年,DeepMind的科学家们创造了一个AI,它只需要看着游戏屏幕的像素,就能自己学会玩这些游戏,而且在好几个游戏上玩得比人类专家还好。这个AI就是深度Q网络(Deep Q-Network, DQN),它第一次成功地将深度神经网络与强化学习结合起来,解决了"从高维感官输入直接学习控制策略"这个

文章图片
#人工智能#游戏#深度学习 +2
【Qwen-VL论文阅读】:打通视觉与语言的全能多模态大模型,从文字识别到精准定位全覆盖

它用简洁的架构、精心设计的训练流程和高质量的数据集,在同规模模型中取得了最好的性能,同时具备了多语言支持、多图输入、精准物体定位和超强文字识别等多种能力。Qwen-VL-Chat:图中的人物是比尔·盖茨,他穿着一件深色的西装外套,里面搭配了一件白色的衬衫,打着一条深色的领带。:这就像给模型装了一个"激光笔",你可以用文字描述让它指出图片里的某个物体,它也可以用坐标告诉你它看到的东西在哪里。:这就像

文章图片
#论文阅读#人工智能#transformer +2
【LoRA论文阅读】:大模型微调的革命——用0.01%参数击败全量微调的秘密

在2021年之前,大语言模型的微调还是一个只有科技巨头才能玩得起的游戏。想要微调一个GPT-3 175B模型?你需要几十张A100显卡,花费数百万美元的电费,而且每个任务都要保存一份完整的175B参数模型。这意味着,如果你有100个不同的任务,你需要准备17.5TB的存储空间来存放这些模型。我们真的需要更新模型的所有参数吗?他们发现,大模型在适应下游任务时,权重的变化其实具有非常低的"内在秩"。换

文章图片
#论文阅读#人工智能#语言模型 +1
    共 225 条
  • 1
  • 2
  • 3
  • 23
  • 请选择