logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

torch之分布式训练

绝大多数情况下,分布式训练使用数据并行,每张卡独立工作,只在梯度同步时通信极少数情况下(模型太大),使用模型并行,需要层层传递自动处理数据并行的通信,对用户透明。

#分布式
Linux kernel media framework(阅读理解与记录)

1.Abstract media device model在系统内部的拓扑结构中,快速找到设备,并进行实时配置,是设计该模型的一个重要目的,为了实现它,把那些具有方向图表性的构件抽象为通过pads相连的entities的硬件设备模型。三要素:entity:实体,sensor, controller等。pad:entity用于连接其他entity的端点。link:pad间的点对点连接。2.Media

cuda编程之内核执行配置参数-网格参数

(如图像处理中的2D网格或体积计算的3D网格),避免手动计算多维索引。:一维和三维网格的总线程块数相同时,最终能启动的线程总数相同。:根据问题的自然维度选择匹配的网格布局,避免不必要的索引计算。:多维网格可能提升内存访问局部性,减少计算索引的开销。(尤其是处理2D/3D数据时),减少缓存行浪费。:一维网格适合通用场景,但需手动处理多维索引。:直接映射图像坐标,无额外计算。(如图像、矩阵),可直接用

#人工智能
AI之Transform encoder/decoder抽象理解

维度Encoder-Decoder 架构 (如T5, BART)Decoder-Only 架构 (如GPT系列)核心任务序列到序列的转换(如翻译、摘要)自回归语言生成(预测下一个词)信息流向双向理解 + 单向生成,分工明确纯粹的单向,从左到右生成优势对输入的理解更全面、深刻,非常适合需要对源信息进行精确重构的任务。架构简单统一,训练效率高,能够利用海量无标注数据进行训练,并涌现出强大的上下文学习能

#人工智能
onnx之模型文件语法介绍

我们可以把它想象成一个俄罗斯套娃,最外层是模型,打开后是计算图,再打开是节点和张量。

#人工智能
Orangepi 4B

www.orangepi.cn1.orangepi 4B利用python3使用snowboy实现语音唤醒以及使用腾讯AI api实现语音识别、回复以及合成https://blog.csdn.net/q310139033/article/details/108873825

cuda编程之内核执行配置参数

在CUDA编程中,是调用CUDA内核(kernel)时的执行配置(execution configuration)语法,用于指定内核如何在GPU上执行。这个语法中的参数确实有固定的成员个数(通常是4个),每个参数都有特定的功能。

#算法
AI之Transform encoder/decoder抽象理解

维度Encoder-Decoder 架构 (如T5, BART)Decoder-Only 架构 (如GPT系列)核心任务序列到序列的转换(如翻译、摘要)自回归语言生成(预测下一个词)信息流向双向理解 + 单向生成,分工明确纯粹的单向,从左到右生成优势对输入的理解更全面、深刻,非常适合需要对源信息进行精确重构的任务。架构简单统一,训练效率高,能够利用海量无标注数据进行训练,并涌现出强大的上下文学习能

#人工智能
AI之attention机制(self-attention,multi-head attention)

✅ 捕获长距离依赖✅ 并行计算能力强✅ 模型可解释性较好(可可视化注意力权重)✅ 能捕获多层次的关系。

#人工智能
onnx之模型文件语法介绍

我们可以把它想象成一个俄罗斯套娃,最外层是模型,打开后是计算图,再打开是节点和张量。

#人工智能
    共 16 条
  • 1
  • 2
  • 请选择