logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

#Paper Reading# DeepSeekMath_V2

论文大体内容本文为了优化LLM的数学推理能力(严谨性),提出「会自省的学生 -> 老师 -> 督导」的模块来训练LLM,最终达到IMO金牌的水平。

#DeepSeek
#Paper Reading# DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model

本文发布了DeepSeek-V2模型,使用了8.1T tokens去训练,属于236B的MoE模型,激活参数量是21B,特别经济高效。其主要创新点是MLA(Multi-head Latent Attention),相比DeepSeek 67B模型,节省了42.5%的训练花销,减少93.3%的KV cache。

#DeepSeek
#Paper Reading# DeepSeekMoE: Towards Ultimate Expert Specialization in MoE Language Models

本文将DeepSeek LLM从Dense模型改为MoE模型,这也是follow了GPT的发展之路。主要工作是探索MoE的结构,包括增加专家的数量以及拆分为共享专家和独享专家。通过这样的操作,虽然模型参数量增大,但是实际infer的时候激活的参数量并不大,从而达到效果提升且成本降低的成效。

#DeepSeek
#Paper Reading# OneRec

论文大体内容本文介绍了快手团队提出的新一代推荐系统OneRec,旨在解决传统多阶段级联推荐架构存在的计算碎片化、优化目标冲突及与AI前沿技术脱节等问题。Motivation推荐系统框架是级联式的多层框架,该非End2End的框架存在碎片化和优化不一致的问题。因此本文对推荐系统的范式做优化,使用End2End的生成式推荐来重塑推荐系统。Contribution本文提出了End2End的推荐系统新框架

#推荐算法
#Paper Reading# OneRec

论文大体内容本文介绍了快手团队提出的新一代推荐系统OneRec,旨在解决传统多阶段级联推荐架构存在的计算碎片化、优化目标冲突及与AI前沿技术脱节等问题。Motivation推荐系统框架是级联式的多层框架,该非End2End的框架存在碎片化和优化不一致的问题。因此本文对推荐系统的范式做优化,使用End2End的生成式推荐来重塑推荐系统。Contribution本文提出了End2End的推荐系统新框架

#推荐算法
#Paper Reading# Stochastic Optimization of Sorting Networks via Continuous Relaxations

论文大体内容:本文主要提出了NeuralSort模型,通过引入松弛,对置换矩阵变换为单峰行随机矩阵来解决sorting问题,使之前不能end2end训练(不可微分)的模型也能进行梯度下降优化。Motivation:Sorting问题不可微分,引入松弛来克服这个问题。Contribution:①提出NeuralSort模型,克服不可end2end训练问题;②应用NeuralSort模型到排列问题中(

#机器学习#深度学习
#Paper Reading# Model-Agnostic Meta-Learning for Fast Adaptation of Deep Networks

论文题目: Model-Agnostic Meta-Learning for Fast Adaptation of Deep Networks论文地址: http://proceedings.mlr.press/v70/finn17a论文发表于: ICML 2017(CCF A类会议)论文所属单位: OpenAI论文大体内容:本文主要提出了与模型无关的Meta Learning框架,能够用于有效解

#Book Reading# 算法交易员——会赚钱的人工智能

书名: 算法交易员——会赚钱的人工智能链接: https://item.jd.com/12696862.html这本书主要写了宽客(量化交易员)的发展历史,以及作者作为一名宽客,从入行到目睹这一行业的种种瞬间、变化、发展的感悟。其实这本书更多的还是类似闲聊或者从讲作者自身目睹的故事来写的,并没有我所期待的“干货”,但是看了之后能对一个想了解这一行业的小白有所帮助。我最早了解量化交易这一领域,是本科

到底了