
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
近期存储行情大涨,我们借这个机会完成对存储芯片的扫盲工作。先从存储的分类开始,无论何种存储芯片,都属于以下三种:1、Volatile Memory(易失性存储)断电丢数据,速度极快,做运行内存。2、Non-Volatile Memory(非易失性存储)断电不丢数据,长期存文件。3、Special Storage(专用存储)特定场景用,比如缓存、桥接、安全存储。

深度学习算法的效果离不开高质量数据集,因此在此对项目中用到的经典数据集进行梳理,本帖长期更新。1、TID2008TID2008是由乌克兰国家航空航天大学的N504信号接收、传输与处理系建立,包括25幅参考图像,四种不同变换幅度,1700幅失真图像。失真类型有17种包括:加性高斯噪声、颜色分量强于照明分量的加性噪声、空间位置相关噪声、掩膜噪声、高频噪声、脉冲噪声、量化噪声、高斯模糊、图像噪声、J..
第一张图是比较经典的RAG知识图谱,第二张图是更加详细扎实的介绍图。

PagedAttention 架构:vLLM 的核心设计就是围绕 KV Cache,没有 KV Cache,vLLM 就无法进行高效 decode,Decode 阶段必然依赖 KV Cache。enable-prefix-caching参数控制的是:不同请求之间不会共享 KV Cache,多轮聊天中:每一轮都会重新计算前缀的 KV,TTFT 会更高。在 vLLM中:KV Cache 是强制开启的基
在传统序列模型(如 RNN 或 LSTM)中,模型处理文本时必须像人类看书一样,从左到右逐字读取。由于隐藏状态(Hidden State)的容量有限,随着句子变长,前面的信息会被后面的信息逐渐“冲淡”,这就是经典的长距离依赖问题(Long-Range Dependency)。2017 年,Google 在论文中彻底颠覆了这一模式,提出了Self-Attention(自注意力)机制。消除时序的先后顺
对于LLM来说,有好几种采样算法。但是要记住LLM既需要准确性也需要多样性。

负载均衡(LB):将客户端海量访问流量,按照预设策略,分发到后端一组业务服务器集群,实现流量分摊、压力分散、故障容错、提升系统并发能力与整体可用性。化单点压力为集群压力,避免单服务器过载宕机。LB 本质:流量转发调度器,分摊压力、提升可用;两大层级:四层(IP+端口,高性能)、七层(HTTP解析,功能强);Nginx 定位:标准七层负载均衡器,依靠 upstream 实现集群转发;核心算法:轮询、

IP 开通端口访问,只是给设备「进门的资格」(能连接 Broker);订阅和发布是「进门后的操作权限」,由 Broker 的 ACL、数据库权限等规则独立控制;「能订阅」和「能发布」没有必然关联,生产环境中更推荐「最小权限原则」:例如传感器仅允许发布数据主题,控制端仅允许订阅指令主题,避免权限滥用。
我们在模型的使用过程中,经常会发现一些模型显存够用但是算力跟不上,这时就会出现有关显存和算力之间的关系,尤其是有些模型会出现不吃显存但是很吃算力的情况,需要具体情况具体进行分析。

线上推理时,需要对召回的每个候选集都和 Query 一起输入模型计算,速度较慢(适合小批量数据)。对于双塔结构,其实本质上是说有一个并行的网络结构,结构上是两个独立的子网络(塔),分别处理 查询(Query)和候选(Candidate) 的特征,最后通过向量相似度(如内积、余弦相似度)计算匹配分数。T5 摒弃了 BERT 的 MLM(掩码语言模型)和 GPT 的 CLM(因果语言模型),采用了全新








