logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

超级IP迭代、数字人口播爆发、DeepShow赋能:2026年内容产业的工业化拐点

**摘要:**2026年,中国直播用户规模预计达7.73亿,但增长率仅0.1%,行业从流量竞争转向"技术+供应链"比拼。超级IP向数字化分身演进,数字人口播成为基础设施,DeepShow技术驱动产业变革,实现极简内容生成、实时互动和数据反哺。未来,技术赋能将重塑内容生态,平台竞争转向技术服务能力,从业者需把握数字资产管理和技术应用机遇,回归创意与供应链本质竞争。

文章图片
MiDaS:迈向鲁棒的单目深度估计:混合数据集实现零样本跨数据集迁移,零样本泛化能力”极强,广泛用作预训练 backbone

摘要:MiDaS模型通过跨数据集混合训练和尺度不变损失函数,解决了单目深度估计的数据依赖与泛化难题。其采用ResNet编码器+轻量解码器架构,融合3D电影等多样化数据,显著提升零样本泛化能力。尽管在细节预测和绝对尺度上存在局限,但催生了DPT、AdaBins等改进模型,推动深度估计从相对预测向绝对度量发展,最终演化为Depth Anything等通用型解决方案。该研究为计算机视觉中的三维感知提供了

文章图片
#深度学习#人工智能
Noise2Noise:无监督去噪方法-k学长深度学习专栏

Noise2Noise颠覆了传统图像去噪需要干净样本的局限,提出仅用成对噪声图像即可训练模型。其核心思想是利用噪声的随机性,通过两张独立噪声图像让网络自动学习忽略噪声、保留真实内容。该方法在数学上证明了用噪声图像替代干净标签的可行性,且适用于多种噪声类型。虽然降低了数据采集门槛,但仍需成对噪声图像,且对噪声的独立性、零均值假设较理想化,难以处理相关性噪声或带偏置的噪声。这一工作为后续无监督去噪方法

文章图片
#计算机视觉#人工智能#深度学习
Restormer:用于高分辨率图像恢复的高效 Transformer-k学长深度学习专栏

Restormer是一种高效Transformer模型,专为高分辨率图像修复任务设计。它通过三大创新解决传统Transformer的计算瓶颈:1)高效注意力机制(MDTA),将复杂度从O(N²)降为线性;2)通道-空间双注意力融合(GDFN),实现跨通道特征协调;3)分层U-Net结构,结合全局语义与局部细节。相比CNN和SwinIR,Restormer既能建模全局依赖,又保持局部精度,在去噪、超

文章图片
#人工智能#深度学习
DDRM:基于扩散模型的去噪方法-k学长深度学习专栏

DDRM:基于扩散模型的通用图像修复方法 【研究背景】 传统图像修复方法面临监督学习依赖配对数据、无监督方法效率低下的双重困境。DDRM创新性地将预训练扩散模型与退化算子SVD分解相结合,提出无需重训练的通用修复框架。 【核心创新】 多任务兼容:通过SVD分解退化矩阵H,将预训练扩散模型作为图像先验,统一处理去噪/去模糊/超分等线性逆问题 高效采样:在频谱空间分离观测分量与生成分量,20-50步即

文章图片
#人工智能#深度学习
SpA-GAN:遥感影像云移除与空间注意力生成对抗网络-k学长深度学习专栏

摘要: SpA-GAN是一种针对单幅光学遥感影像薄云去除的生成对抗网络,核心创新在于引入空间注意力机制(SAB+SAM+SARB),通过多阶段结构(特征提取→云区定位→细节重建)精准聚焦云层区域。其生成器利用四向循环神经网络(IRNN)生成注意力图,结合注意力约束损失(LAtt)引导修复,在RICE数据集上PSNR达30.232 dB,显著优于传统cGAN和CycleGAN。局限性包括对厚云泛化能

文章图片
#生成对抗网络#人工智能#神经网络
DSen2-CR:利用深度残差神经网络和SAR光学数据融合技术实现Sentinel-2影像的云层消除-k学长深度学习专栏

DSen2-CR是一种融合SAR雷达与光学影像的深度学习去云方法。主要创新包括:1)首次将能穿透云层的SAR与光学数据结合,利用SAR提供云下地物结构;2)基于ResNet构建稳定残差网络,避免GAN的不稳定性;3)提出云自适应损失函数(CARL),在云区强制学习无云目标,在晴空区保持原图不变;4)构建全球真实云数据集SEN12MS-CR。不足在于简单拼接的异构数据融合方式易导致特征错位,且缺乏显

文章图片
#神经网络#sentinel#人工智能
Former-CR首次将基于Uformer架构用于SAR-光学厚云去除-k学长深度学习专栏

摘要: 针对地球观测中云层遮挡导致的光学影像质量下降问题,研究提出Former-CR模型,创新性地结合SAR雷达与光学影像的多模态数据,通过U型Transformer架构实现云层去除。模型采用双分支设计(重建分支+残差分支),利用局部增强窗口注意力(LeWin)兼顾全局结构与局部细节,并引入感知损失提升视觉真实性。实验表明,Former-CR在厚云场景下的修复效果优于传统方法,尤其在SSIM等指标

文章图片
#人工智能#深度学习
RT-DETR:在实时目标检测中,号称击败当时的YOLO ,DETR的重大的创新改进-k学长深度学习专栏

RT-DETR:实时端到端目标检测新范式 针对YOLO系列依赖NMS导致效率瓶颈和DETR计算成本高的问题,RT-DETR通过三大创新实现突破: 高效混合编码器:分离同尺度交互(高层特征使用注意力)与跨尺度融合(低层特征采用卷积),降低60%计算量; 最小不确定性查询选择:联合评估分类置信度与定位准确性,筛选高质量初始查询,提升3%AP; 动态解码器调节:支持推理时灵活裁剪层数(4-6层可调),无

文章图片
#目标检测#人工智能
FCN:用于语义分割的卷积网络,语义分割开山作-k学长深度学习专栏

摘要:本文探讨了全卷积网络(FCN)在语义分割中的应用。传统计算机视觉方法依赖人工设计特征,难以处理复杂场景。FCN通过将分类网络改造为全卷积形式,实现端到端的像素级预测,解决了全局语义与局部细节的矛盾。网络通过转置卷积上采样和多层特征融合(FCN-32s、FCN-16s、FCN-8s),逐步提升边界精度。实验表明,FCN在高效推理的同时,能结合深层语义与浅层细节,实现更精细的分割效果。

#深度学习#人工智能
    共 98 条
  • 1
  • 2
  • 3
  • 10
  • 请选择