
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
经过2年多的发展,预训练模型已经比之前好了太多,包括预训练阶段加了更多的推理数据,退火阶段引入更多的高质量推理数据等等,让base-model在zero-shot上的效果已经可以比肩上一代的instruct模型。无疑给了另一条base-model的优化方向:看最优分布采样样本的pattern、效果,修正base-model的数据分布,进而提升base-model的数据分布覆盖率,以及纠正base-
正如我们将看到的,它是这类模型中第一个完全放弃了任何监督训练的模型,表明复杂的推理能力可自然地从使用强化学习的大规模训练中涌现。这样的结果与我们在封闭式推理模型中看到的性能趋势是一致的 ——DeepSeek-R1-Zero 在强化学习训练后实现了令人印象深刻的性能,并且可以通过并行解码策略进一步提高其性能。此外,即使是最小的蒸馏模型也比未针对推理进行优化的标准封闭式 LLM 表现更好(例如 GPT
作者|Lukan整理|NewBeeNLPhttps://zhuanlan.zhihu.com/p/698416915今天分享一篇小红书今年3月的论文,介绍了大语言模型在小红书笔记推荐场景下的落地应用,主要是围绕如何利用LLM的表征能力来生成更适用于i2i召回的文本embedding,思路简单,落地也容易,个人觉得实践价值非常高,值得学习。NoteLLM: A Retrievable ...
『运筹OR帷幄』发源于德国海德堡大学数学博士留德华叫兽2016年初创办的知乎专栏,2018年1月1日,由MIT计算科学博士生覃含章、美国西北大学刘晗教授联合创办,目前由全球超过60名OR相...
写在前面上一篇 机器学习算法总结之Boosting family:AdaBoost提到Boost但是没说它的整个框架及分类,在这里记一下。Boosting(提升方法) = 加法模型 + 前向分步算法 + 损失函数AdaBoost = Boosting + 损失函数是指数函数(基函数任意)Boosting Tree(提升树) = Boosting + 基函数是决策树(损失函数任意...
写在前面K近邻(K-nearest neighbor,k-nn)是一种常用的机器学习监督学习方法,可用于分类和回归问题。其工作机制为:给定测试样本,基于某种距离度量找出训练集中与其最靠近的K个训练样本,然后基于这K个邻居来预测给定样本。对于分类任务,可使用“投票法”;对于回归任务,可使用“平均法”,即取这K个邻居的平均值最为预测结果,进一步地,还可以对K个邻居距离的远近进行加权处理后预测结果。..
写在前面贝叶斯分类是一类分类算法的总称,这类算法均以贝叶斯定理为基础,故统称为贝叶斯分类。而朴素朴素贝叶斯分类是贝叶斯分类中最简单,也是常见的一种分类方法。它是基于贝叶斯定理和特征条件独立假设分类方法。对于给定训练集,首先基于特征条件独立性的假设,学习输入/输出联合概率(计算出先验概率和条件概率,然后求出联合概率)。然后基于此模型,给定输入x,利用贝叶斯概率定理求出最大的后验概率作为输出y。朴..
写在前面最近在写小论文的时候接触到了XGBoost,才发现这算法真的是神一般的存在,去网上搜了一下居然绝大多数竞赛winner用的也是这个算法(这算不算开挂haha~)。发现这么好用的算法如果只是会用的话真是可惜,所以决定放下手头的论文,先仔细地研究研究。但是在网上看XGBoost资料的时候觉得自己以前看的树模型算法都忘得差不多了,所以就趁着这个机会把机器学习里的树模型算法重新再...
作者|Lukan整理|NewBeeNLP今天继续分享一篇大模型在推荐系统中的落地应用工作,是快手今年5月份发表的论文《Knowledge Adaptation from Large Language Model to Recommendation for Practical Industrial Application》。太长不看版这篇文章主要做了两个工作:工作1:使用冻结的LLM提取...
作者|番茄爱鸡蛋整理|NewBeeNLPhttps://zhuanlan.zhihu.com/p/688913185大家好,这里是 NewBeeNLP。今天看看 Meta 关于深度学习推荐系统 Scaling Law 的研究。 零、论文信息论文题目:Wukong: Towards a Scaling Law for Large-Scale Recommendation论文链接:http...







