logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

震惊!仅用10张照片就能随意编辑3D人脸?韩国KAIST最新黑科技FFaceNeRF解析!

FFaceNeRF是一种基于神经辐射场的小样本3D人脸编辑方法,通过几何适配器将固定布局分割图调整为自定义蒙版布局。其核心创新包括:1)几何适配器和特征注入机制实现灵活编辑;2)三平面增强的潜在混合策略提升小样本学习效果;3)基于重叠的优化确保精细区域编辑精度。仅需约10个样本即可训练,支持用户自由定义编辑区域,在保持人脸身份特征的同时实现高精度局部编辑。该方法突破了传统NeRF人脸编辑对固定分割

文章图片
#3d#科技#人工智能 +4
5分钟上手!让你的强化学习模型性能暴涨的秘密武器

论文《LEARNING TRANSFORMER-BASED WORLD MODELS WITH CONTRASTIVE PREDICTIVE CODING》论文地址: https://openreview.net/forum?深度交流Q裙:1051849847全网同名 【大嘴带你水论文】 B站定时发布详细讲解视频详细代码见文章最后。

文章图片
#人工智能#transformer#python +3
告别灾难性遗忘!CoMBO让你的AI模型新老知识两不误,41.1% mIoU碾压全场!

VGGT是一个统一的视觉通用模型,通过引导式Transformer架构同时处理点跟踪、深度估计、相机位姿估计和光流预测等多项视觉任务。其核心机制包括交替注意力(帧内和全局注意力)、专用Token(相机和寄存器Token)以及多任务预测头。代码实现展示了关键组件,如多头注意力模块和密集预测头。该模型通过单一架构实现多任务处理,无需为每个任务设计专用解码器,具有高效建模时空依赖关系的能力。

文章图片
#人工智能#transformer#深度学习 +1
还在为视频发愁?3分钟学会用AI做大片,这个开源工具让文案秒变视频!

CogVideoX是一个基于扩散Transformer的文本到视频生成模型,能够生成10秒768×1360分辨率的高质量视频。其核心创新包括:1)3D因果变分自编码器在时空维度压缩视频;2)专家自适应LayerNorm处理多模态特征;3)3D全注意力机制实现连贯运动生成。模型通过渐进训练和多分辨率帧打包技术,显著提升了视频时长和运动连贯性,在定量和定性评估中均优于现有方法。完整实现代码已开源。

文章图片
#音视频#人工智能#开源 +3
到底了