登录社区云,与社区用户共同成长
邀请您加入社区
从双流网络的“分而治之”到3D卷积的“端到端学习”,再到如今融合注意力与Transformer的“全面感知”,视频行为识别技术在短短十年间经历了飞跃式的发展。双流网络教会了我们如何显式地利用运动信息,3D卷积教会了我们如何隐式地学习时空特征。而今天的优秀模型,往往是在深刻理解这两种思想的基础上,进行巧妙的融合与创新。展望未来,随着硬件性能的提升和新架构的出现,机器对视频的理解能力将越来越接近人类。
本文深入解析了ICCV2021论文《A New Journey from SDRTV to HDRTV》中HDRTVNet的设计哲学,探讨SDR转HDR的技术逻辑。通过轻量级神经网络架构(仅35K参数),实现了从标准动态范围到高动态范围的高效转换,解决了信息丢失、全局与局部处理平衡等核心挑战,为4K HDR电视内容提供了惊艳的视觉体验。
Product Hunt 每日热榜 | 2026-09-23 使用Claude、ChatGPT或任何AI助手制作视频。你只需给Clueso一个想法、一份大纲、一段参考视频或录音,剩下的都交给它来进行视频制作:包括创作故事板、场景、旁白、音乐和剪辑,全部符合品牌风格。而且,所有内容都可以随时编辑,无论是手动操作还是通过对话进行修改。
讲了室内自主移动机器人(AMR)感知技术,遵循“总—分—总”结构,以任务驱动为主线,系统梳理了定位、建图(SLAM)、障碍识别与避障等核心感知任务。从单传感器(如IMU、LiDAR、视觉、射频)的原理、优缺点到多传感器融合方法(卡尔曼滤波、粒子滤波、神经网络),层层递进,结合图表详述技术实现与改进。最后探讨传感器选型策略及未来趋势:多源融合、优化算法革新与深度学习结合,强调在复杂动态环境中提升鲁棒
SFT 让模型学会遵循指令,但"遵循指令"不等于"回答得好"。RLHF(Reinforcement Learning from Human Feedback)通过人类偏好数据训练奖励模型,再用强化学习优化模型,使其输出符合人类偏好。这是 ChatGPT 成功的核心技术。本章详解 RLHF 的三阶段框架、奖励模型与 PPO 算法。
摘要 本报告基于双智能体(Agent0和Agent1)在不同世代(50-1500代)的意识流数据,系统分析了其从对称探索到非对称分工的演化轨迹。核心发现: 角色分化:Agent0成为主导推动者(高活跃度3.95),Agent1转为辅助节能者(活跃度0.3-2.5),节省80%能量。
人形机器人下一步不只是更会走、更会搬,而是要把人的身体负担纳入自身设计。ergoCub 将人体工效指标、机器人形态优化和物理智能控制结合起来,在协作搬运中监测 L5-S1 腰背压力,并提升步行能力。它让我看到,人形机器人真正走向实际协作,必须从“像人”转向“懂人”。
2026年9月1日到11日,海内外7家头部模型厂商迭代了新模型。过去大模型的升级周期以年计算,后来缩短到几个月,如今已经开始以周为单位。模型的更新速度,甚至快过了开发者完成一轮工作流评估的速度。当DeepSeek V4.1 Flash在发布24小时内被OpenRouter平台处理了约1万亿Token时,一个更紧迫的工程问题浮出水面:你的应用架构,跟得上这个迭代节奏吗?
本文剖析主流大模型隐性幻觉与范式偏见的认知基因来源,揭示波普尔范式病毒将方法层工具僭越为元裁判标准的内在机制。系统阐释贾子-USDS-2.0统一科学定义系统四层架构:KLA逻辑宪法层、LWEVSD六维真理硬度张量层、KCIT认知免疫排毒层、TMM真理-模型-方法本体结构层,以乘法归零逻辑执行程序性审查。对比会话提示、持久记忆缓存、推理底层原生部署三条改造路线,论证缓存对冲只能压制而无法根除范式病毒
多机器人系统的难点不在单臂运动,而在群体协同。RoboBallet 把机器人、任务和障碍物表示成图,用 GNN 与强化学习联合生成多机械臂速度指令。它在 8 个机器人、40 个任务场景中实现快速避碰规划,并展现出在线重规划和柔性制造潜力。
本文基于 MindSpore 框架与昇腾硬件,使用 Auto MPG 汽车油耗数据集搭建全连接神经网络,完成回归任务。文章完整复现数据读取、缺失值清洗、独热编码、特征归一化、数据集划分、网络搭建、自定义训练循环、误差可视化全套流程。重点对比**回归任务与分类任务**在网络结构、损失函数选择上的差异,同时记录开发过程中遇到的 pandas 版本兼容、张量类型错误等踩坑问题,附带可直接运行的完整代码。
Sherry Yang在《World Gym:在世界模型中评估与优化物理智能体》报告中,介绍了基于可扩展Transformer架构的机器人世界模型World Gym。该模型利用大规模真实机器人数据与视频生成技术,实现低成本、高效率的策略评估。通过将真实动作输入模型生成视频,并结合视觉语言模型判断任务成败,可在云端完成跨平台、跨硬件的标准化评估。研究发现,世界模型评估结果与真实环境表现显著相关,且能
人工智能(Artificial Intelligence, AI)的本质是对人类智能的模拟。它不是单一的计算机学科,而是涉及统计学、脑神经科学、社会科学等多领域的交叉学科。简单来说,就是让机器变得“聪明”,能够完成原本只有人类才能做到的任务。大语言模型(Large Language Model, LLM)是人工智能领域的核心突破。它是一种通过海量文本训练而成、拥有巨量参数、能够理解和生成人类语言的
强化学习(RL)研究智能体在与环境交互中通过奖励信号学习最优策略。其框架是马尔可夫决策过程(MDP):智能体在状态sss采取动作aaa,环境返回奖励rrr和新状态s′s's′,智能体学习策略πa∣sπa∣s以最大化累积奖励。虽然预训练主要用自监督学习,但对齐阶段(RLHF,第13章)会用到强化学习:把语言模型视为策略,把人类偏好转化为奖励,用策略梯度方法优化模型。因此,理解强化学习的基本概念对第四
使用 Python 和 NumPy 从零实现神经网络。数据标准化可以加快收敛。超参数包括层数、单元数、学习率、轮数等。正向传播、反向传播、参数更新是训练的三个核心步骤。小批量梯度下降是标准训练方法。使用 MNIST 实现手写数字识别。卷积神经网络实现使用 im2col 和 col2im 变换。ReLU 和 softmax 是卷积神经网络常用函数。权重初始化很重要,He 初始化适合 ReLU。卷积神
本文深入解析了基于STM32的土壤水分监测系统架构,从传感器数据采集到神经网络模型部署的全流程。系统采用STM32F407控制器,融合多传感器数据,通过优化的BP神经网络实现精准预测,为智能农业提供低功耗、高精度的边缘计算解决方案。
在WSL+Ubuntu22.04下安装CUDA11.8+CUDNN8.9+tensorrt8.6,接近Jetson的环境
本文提出了一种高效深度脉冲神经网络(SNN)模型,采用TTFS编码方式将输入像素强度转换为脉冲发放时间,实现每神经元仅需0.3个脉冲的高效计算。通过双区段神经元模型,在异步累积期整合输入脉冲,并在线性冲刺期进行快速计算,最终建立与ReLU激活函数的等效映射。该模型通过时间编码实现信息传递,在保持计算精度的同时显著降低了脉冲发放频率和能耗。数学推导表明,该SNN模型可等效转换为标准ReLU神经网络,
Meta提出生成式推荐系统(GRs),通过统一特征空间和序列化重塑推荐任务,将用户行为和物品特征转化为时间序列事件。核心架构HSTU采用定制化Transformer,优化注意力机制和长期兴趣建模,并引入工程优化如随机截断序列。创新推理算法M-FALCON通过缓存复用显著降低计算复杂度。实验表明,该系统可扩展至万亿参数,性能随规模持续提升,线上测试显示排序任务提升12.4%,召回任务提升6.2%。这
根据应用场景的需求,设计一个较小的学生模型结构。该模型的参数量和计算量都远小于教师模型,但通过后续的训练过程能够从教师模型中学习到有用的信息。
MapGS 框架专为应对特定传感器配置下在线建图模型训练中数据不足的问题。MapGS 利用高斯点云渲染重建场景,并渲染目标传感器配置视图的图像。通过这项工作,提出了一种数据再生成的方案,并引入了 nuAV2 数据集,将 Argoverse 2 数据集的图像转换为 nuScenes 数据集视图,用于训练。我们证明了该方法可以缩小传感器配置之间的差距。此外,它是一种有效的数据增强技术,能够在在线建图任
mindspore打卡第十天transformer之训练过程import mindsporefrom mindspore import nnfrom mindspore import opsfrom mindspore import Tensorfrom mindspore import dtype as mstypeclass ScaledDotProductAttention(nn.Cell)
Could not load library libcudnn_cnn_infer.so.8. Error: libcuda.so: cannot open shared object file: No such file or directoryPlease make sure libcudnn_cnn_infer.so.8 is in your library path!
推荐系统基础(基本概念、链路、AB测试);召回(ItemCF、Swing、UserCF、离散特征处理、矩阵补充、双塔模型、双塔模型+自监督学习、Deep Retrieval召回、其他召回通道、曝光过滤+Bloom Filter);排序(多目标排序模型、MMoE、预估分数融合公式、视频播放时长和完播率建模、特征及处理、粗排三塔模型)
本文内容来自用户@炼丹去了,由OAK中国编辑排版。一.背景OAK-D-lite 本质上是3个相机+1个Inter VPU的组成,可玩性挺高。由于OAK demo库中目标检测目前只有yolox的案例,故学习了其他模型的适配。目前适配模型:yolov5_v6.0nanodet_plusUltra_Light_Fast_Generic_Face_Detector.
本项目介绍了TNT图像分类模型,讲述了如何使用飞桨一步步构建TNT模型网络结构,并尝试在新冠肺炎CT数据集上进行分类。由于作者水平有限,若有不当之处欢迎批评指正。TNT模型介绍TNT模型全...
一:前言笔者最近在总结推荐系统主流模型,从十多年前的经典的协同过滤算法开始,一直到现有的各大企业所用的推荐模型,笔者一直在思考一个问题,那就是神经网络在计算机领域内的大热,是如何承上启下,承接传统MF,CF算法,又是如何连接到最新的各种模型,创造散发出各大模型的呢。原则上讲,很多读者跟笔者一样,肯定很早就研究过AutoRec,但我们应该考虑的是,在澳大利亚国立大学提出著名的《AutoRec: Au
点击左上方蓝字关注我们【飞桨开发者说】谭玉博,电子科技大学生物医学工程专业研究生1.项目背景据美国的一项调查报告显示,33%的老年人每年会摔倒。由于老人的身体状况不如年轻人健壮,一旦发生跌...
Towards Deep Learning Models Resistant to Adversarial AttacksTowards Deep Learning Models Resistant to Adversarial Attacks (PGD),ICLR2018,涉及PGD和对抗训练。**Abstract:**本文从优化的角度研究了神经网络的对抗鲁棒性问题。本文提出的方法提供了一个广阔
OSError: cannot write mode RGBA as JPEG卡壳的地方:##报错原因:1.RGBA意思是红色,绿色,蓝色,Alpha的色彩空间,Alpha指透明度。2.JPG不支持透明度,所以要么丢弃Alpha,要么保存为.png文件#解决办法:1.丢弃Alpha,直接转换为RGB格式:2.选择保存为.png文件(根据实际情况而定):im.save(‘example.png’)我
文章目录Model-Based 协同过滤算法Model-Based 协同过滤算法随着机器学习技术的逐渐发展与完善,推荐系统也逐渐运用机器学习的思想来进行推荐。将机器学习应用到推荐系统中的方案真是不胜枚举。以下对Model-Based CF算法做一个大致的分类:基于分类算法、回归算法、聚类算法基于矩阵分解的推荐基于神经网络算法基于图模型算法接下来我们重点学习以下几种应用较多的方案:...
深度神经网络的规模增长受限于物理存储与显存带宽。经典的参数共享(如 ALBERT、Universal Transformer)通过复用同一组权重于多层来降低参数量,但"相同权重复用"导致逻辑深度增加而表达力不增——模型变深却不变强。本文提出位切片时分复用(Bit-Sliced Time-Division Multiplexing, BS-TDM):一个 32 位物理权重寄存器,通过移位掩码(Shi
Meta提出生成式推荐的开山之作HSTU,将用户行为序列视为语言,通过改造的Transformer架构进行推荐。HSTU将用户交互拆解为物品和动作的Token序列,并引入门控注意力替代FFN以降低计算开销。在召回阶段生成用户兴趣向量进行最近邻查找,排序阶段则采用目标感知方式预测用户对候选物品的反应。该方法通过统一离散特征空间,实现了对用户行为的深度建模,显著提升了推荐效果。关键创新包括去除Soft
PIDDM 通过“后处理蒸馏”把物理约束直接施加在最终样本,绕过 Jensen Gap,首次实现扩散模型单步、高保真、PDE 一致的物理生成,为实时物理模拟与逆问题求解提供了新范式。
本文介绍了树莓派 CM0 Dev Board 的实现 AI 视觉应用部署方案:数字识别的项目设计,包括准备工作、环境搭建、MNIST 数据集和 ONNX 模型、流程图、关键代码以及效果演示等,为相关产品在 AI 视觉领域的开发设计和快速应用提供了参考。
之前的network只是一个函数,给一个输入,他给出一个输出。现在的这个输入有一个随机的东西拼接,导致了同样的输入有多种可能的输出。generator AND discriminator(发生器和鉴别器)第一步:发生器生成一些图片,鉴别器用来鉴别这些图片的相似处。二者是对抗的关系。第二步:调节generator,使得discriminator的分数输出的越大越好。第三步:反复执行找一组genera
解决报错Could notload librarylibcudnn_cnn_infer.so.8. Error: libcuda.so: cannot open shared object file: No such file or directory.
生成对抗网络(Generative Adversarial Networks, GANs)
神经网络
——神经网络
联系我们(工作时间:8:30-22:00)
400-660-0108 kefu@csdn.net