logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

全品类存储芯片汇总/DRAM/flash/HBM

近期存储行情大涨,我们借这个机会完成对存储芯片的扫盲工作。先从存储的分类开始,无论何种存储芯片,都属于以下三种:1、Volatile Memory(易失性存储)断电丢数据,速度极快,做运行内存。2、Non-Volatile Memory(非易失性存储)断电不丢数据,长期存文件。3、Special Storage(专用存储)特定场景用,比如缓存、桥接、安全存储。

文章图片
#算法
深度学习常用数据集整理-随时更新

深度学习算法的效果离不开高质量数据集,因此在此对项目中用到的经典数据集进行梳理,本帖长期更新。1、TID2008TID2008是由乌克兰国家航空航天大学的N504信号接收、传输与处理系建立,包括25幅参考图像,四种不同变换幅度,1700幅失真图像。失真类型有17种包括:加性高斯噪声、颜色分量强于照明分量的加性噪声、空间位置相关噪声、掩膜噪声、高频噪声、脉冲噪声、量化噪声、高斯模糊、图像噪声、J..

大语言模型RAG,transformer,rerank原理

第一张图是比较经典的RAG知识图谱,第二张图是更加详细扎实的介绍图。

文章图片
#语言模型#transformer#人工智能
vLLM中的enable-prefix-caching和Chunked-Prefill

PagedAttention 架构:vLLM 的核心设计就是围绕 KV Cache,没有 KV Cache,vLLM 就无法进行高效 decode,Decode 阶段必然依赖 KV Cache。enable-prefix-caching参数控制的是:不同请求之间不会共享 KV Cache,多轮聊天中:每一轮都会重新计算前缀的 KV,TTFT 会更高。在 vLLM中:KV Cache 是强制开启的基

Flash-atten/Cross-atten/SSM/Mamba/Jamba技术演进

在传统序列模型(如 RNN 或 LSTM)中,模型处理文本时必须像人类看书一样,从左到右逐字读取。由于隐藏状态(Hidden State)的容量有限,随着句子变长,前面的信息会被后面的信息逐渐“冲淡”,这就是经典的长距离依赖问题(Long-Range Dependency)。2017 年,Google 在论文中彻底颠覆了这一模式,提出了Self-Attention(自注意力)机制。消除时序的先后顺

#深度学习
对于相同问题大模型的生成为什么会不同?

对于LLM来说,有好几种采样算法。但是要记住LLM既需要准确性也需要多样性。

文章图片
#深度学习
LB HA(high avaliablity)和nginx

负载均衡(LB):将客户端海量访问流量,按照预设策略,分发到后端一组业务服务器集群,实现流量分摊、压力分散、故障容错、提升系统并发能力与整体可用性。化单点压力为集群压力,避免单服务器过载宕机。LB 本质:流量转发调度器,分摊压力、提升可用;两大层级:四层(IP+端口,高性能)、七层(HTTP解析,功能强);Nginx 定位:标准七层负载均衡器,依靠 upstream 实现集群转发;核心算法:轮询、

文章图片
#nginx#运维
物联网 - MQTT、EMQX、Broker

IP 开通端口访问,只是给设备「进门的资格」(能连接 Broker);订阅和发布是「进门后的操作权限」,由 Broker 的 ACL、数据库权限等规则独立控制;「能订阅」和「能发布」没有必然关联,生产环境中更推荐「最小权限原则」:例如传感器仅允许发布数据主题,控制端仅允许订阅指令主题,避免权限滥用。

#物联网
显存和算力的关系、主流显卡参数

我们在模型的使用过程中,经常会发现一些模型显存够用但是算力跟不上,这时就会出现有关显存和算力之间的关系,尤其是有些模型会出现不吃显存但是很吃算力的情况,需要具体情况具体进行分析。

文章图片
#深度学习
RAG Embedding Reranker 、Bert、CLIP&T5、池化模型

线上推理时,需要对召回的每个候选集都和 Query 一起输入模型计算,速度较慢(适合小批量数据)。对于双塔结构,其实本质上是说有一个并行的网络结构,结构上是两个独立的子网络(塔),分别处理 查询(Query)和候选(Candidate) 的特征,最后通过向量相似度(如内积、余弦相似度)计算匹配分数。T5 摒弃了 BERT 的 MLM(掩码语言模型)和 GPT 的 CLM(因果语言模型),采用了全新

文章图片
#bert#人工智能#深度学习
    共 33 条
  • 1
  • 2
  • 3
  • 4
  • 请选择