logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

金鱼损失:大模型“记性差一点”反而更聪明!随机剔除token,让AI不再死记硬背

实验显示,LLaMA-2在使用金鱼损失后:记忆化内容显著减少:模型不再复现训练数据下游任务性能几乎不受影响:仍然能流畅生成文本用网友的精辟评论概括就是:dropout,但损失函数!

#人工智能#机器学习#深度学习
数据组织范式:DELT:调整训练数据出场顺序,大模型就能变聪明!无需扩大模型/数据规模

它集成了数据评分(Data Scoring)、数据选择(Data Selection) 和数据排序(Data Ordering) 三大核心组件。DELT(Data Efficacy in LM Training)是一种创新的文本数据组织范式。

#深度学习#人工智能#自然语言处理
大模型里使用的pytorch dataset 和dataloader详细解析和介绍

打乱顺序后,第一次就可能抽出来{“A”:“this is A1”, “B”:“this is B1”}作用是用来随机抽取所需要的数据,每行代表一条数据,做一些sample的事情。可以是json, jsonl格式:一行是一个数据。也可以是txt格式,一行是一个json格式数据。也可以是parquet格式。例如:原本按顺序抽取。

#pytorch#人工智能#python
大模型知识蒸馏的方法: DeepSeek, Llama 4 & Gemma 3中使用的技术

在用于按物种对动物图像进行分类的模型中,最早的隐藏层可能只是辨别照片的一部分中存在动物形状;捕捉样本之间的关系或特征间的关联性,例如通过对比学习的方式传递相似性信息。这些关系和相关性可以通过多种方式进行建模,包括特征图之间的相关性、表示不同层之间相似性的矩阵、特征嵌入或特征表示的概率分布。例如,在主要用于图像分割等计算机视觉任务的卷积神经网络中,随着数据在网络中传输,每个连续的隐藏层都会逐渐捕获更

#人工智能#深度学习
机器学习相关知识点--朴素贝叶斯,贝叶斯网络,半朴素贝叶斯

github机器学习总结一 线性回归线性回归是什么是一种预测模型,利用各个特征的数值去预测目标值。线性回归的主要思想是给每一个特征分配一个权值,最终的预测结果是每个特征值与权值的乘机之和再加上偏置。所以训练的目标是找到各个特征的最佳权值和偏置,使得误差最小。线性回归的假设前提是噪声符合正态分布。线性回归也可以做分类,但是效果不好。线性回归的五大假设https://blog.csdn.net/Noo

#机器学习#网络#人工智能 +1
DSA---deepseek sparse attn

论文通过引入 DeepSeek 稀疏注意力(DSA)机制,成功地在保持高性能的同时,显著提升了大型语言模型在长上下文场景下的训练和推理效率。提出了一种有效的稀疏注意力架构(DSA):通过结合一个轻量级的“闪电索引器”和一个细粒度的 Top-k Token 选择机制,DSA 实现了一种灵活且高效的动态稀疏注意力模式。这种“先粗筛,后精算”的范式,在理论和实践上都被证明是可行的。

#人工智能
强化学习入口整理

强强化学习基础:强化学习分类,强化学习表示,值函数,策略迭代/值迭代, 主要的强化学习技术(蒙特卡洛学习/时间差分学习,DQN.REINFORCE,策略梯度/PPO/AC/A2C/A3C/DDPG/PDPG/TD3)马科夫过程(MP) -> 马尔科夫奖励过程(MRP) -> 马尔科夫决策过程(MDP)基于策略的迭代和基于价值的迭代(Model-based RL&动态规划)强化学习策略更新方法on-

#机器学习#python#人工智能 +1
模型训练-关于token【低概率token, 高熵token】

下图是作者的统计结果,可见基础模型中初始熵较高的 token 在 RL 后往往表现出更大的熵增,这与三中的实验结论不谋而合,表明 RL 带来推理性能提升的原因之一,很可能就是因为高熵 token 的不确定性更强了,提高了大模型推理的灵活性。这一关系清晰地表明,词元概率越低,其梯度贡献越大,反之则越小。可见在 RL 训练过程中,尽管与基础模型的重叠逐渐减少,但在收敛时(第 1360 步),基础模型的

#人工智能#自然语言处理#算法
强化学习训练方法:超参设置技巧-Polaris的强化学习训练配方

4B小模型数学推理首超Claude 4,700步RL训练逼近235B性能 | 港大&字节Seed&复旦Polaris的成功的秘籍就是:训练数据及超参数设置都要围绕待训练的模型来进行设置。

#人工智能#python
BeyondWeb:大规模预训练合成数据的启示

摘要使用的 prompt:总结以下文本。直接从总结开始。不要说其他任何话。简单摘要与 cosmopedia 的效果近似,且摘要所使用的计算资源远少于 cosmopediaHQ 表示高质量的网络数据,LQ 表示低质量的网络数据。深蓝色的线表示 BeyondWeb(50.4%),深青色的线表示 HQ Synth + HQ Web(49.2%),其中合成数据是高质量网络样本的改写版本,浅青色的线表示 L

#人工智能#深度学习#机器学习 +2
    共 76 条
  • 1
  • 2
  • 3
  • 8
  • 请选择