
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
生存分析生存分析是研究直到发生一个或多个事件的预期时间的一系列统计分析方法。取名生存分析是最早应用于医学领域,研究病人从诊断出癌症后使用不同药物治疗后的死亡时间。TTT 表示生存时间,是非负连续的随机变量f(t)f(t)f(t)表示TTT的概率密度函数 pdfF(t)=P(T≤t)=∫0tf(x)dxF(t) = P(T\le t)=\int_0^t f(x)dxF(t)=P(T≤t)=∫0tf
上一篇我们分析了XDL的framework的架构设计,了解了XDL的模型构建和运行机制,以及XDL如何将tensorflow作为自己的backend。本篇继续分析XDL的架构设计,重点关注XDL的参数训练过程。样例还是以XDL自带的deepctr(代码位置:xdl/xdl/examples/deepctr/deepctr.py)为例:def train():...emb...
摘要深度学习已经成为推荐算法研究者们理想的选择。随着机器学习领域研究兴趣的强力增长,已经很难跟踪谁才是TopN推荐问题的最先进算法。与此同时,最近有几篇文章指出现在机器学习领域实践方面的一些问题,比如结果可复现性,以及baseline的选择问题。本文报告了对TopN推荐算法的系统性分析结果。我们分析了最近几年在顶级研究会议上发表的18种算法。其中只有7种算法,经过合理的尝试后复现了结果。并且,..
提示策略(Prompting Strategy) : 该系列研究通过将推荐任务重构为自然语言处理问题,设计了多种提示策略来引导大语言模型(LLMs)生成准确的(系统)冷启动推荐。多步提示(Muti-Step Prompting ): 尽管直接提示法可用于零样本/少样本推荐任务,但其性能表现仍逊色于经过完整用户-物品交互数据训练的传统推荐方法。检索增强(Retrieval-Augmented Rec

摘要深度学习已经成为推荐算法研究者们理想的选择。随着机器学习领域研究兴趣的强力增长,已经很难跟踪谁才是TopN推荐问题的最先进算法。与此同时,最近有几篇文章指出现在机器学习领域实践方面的一些问题,比如结果可复现性,以及baseline的选择问题。本文报告了对TopN推荐算法的系统性分析结果。我们分析了最近几年在顶级研究会议上发表的18种算法。其中只有7种算法,经过合理的尝试后复现了结果。并且,..
接着上篇介绍聚类算法,本篇介绍图团体检测算法。图团体检测当我们的样本以及样本之间的关系可以被表示为一个网络或图(graph)时,可能存在这样的需求:我们想找出来网络中联系比较”紧密”的样本。举个例子,在社交网站中,用户以及用户之间的好友关系可以表示成下面的无向图,图中的顶点表示每个用户,顶点之间的边表示用户是否为好友关系:直观上我们可以看出a,b,e,f之间的关系比较密切,c,d,...
我们具有一个从总体中采样得到的样本 D,根据格里纹科定理,样本 D 的经验分布在样本容量 时等于总体的分布,也就是说当 n 较大时,样本 D 的经验分布是总体分布的很好的近似。上面的计算步骤其实是有些问题的,因为 p 值的定义是在原假设H_0成立的条件下计算的,上面第一步从总体中采样并不能满足原假设一定成立,因此依据这里采样的样本计算的并不能近似 p 值。这是基于抽样分布定理的假设检验方法,依赖

背景深度学习领域的关键挑战之一,就是耗时。耗时的原因来自于两个方面,一方面是模型越来越大,参数越来越多,千万甚至数十亿,另一个方面是训练数据量的增多。所以更低的耗时、更快速的实验,对于模型的的开发效率至关重要,使研究者有机会探索更多的超差组合。分布式深度学习算法是降低耗时问题的重要方法。2017年6月,Facebook发布论文,文中说他们用32台服务器256块GPU,将Resnet-50模型在..
上一章中,我们学习到深度网络比浅层网络难以训练。这很可惜,因为我们有充分的理由相信,如果我们可以训练深度网络,它将比浅层网络强大很多。虽然上一章的消息很令人沮丧,但是我们不会放弃。本章中,我们来看看一些可以训练深度网络的技术。我们还将看看更广阔的画面,看看深度网络最近取得的进展,在图像识别,语音识别,和一些其他方面。然后我们简单展望一下深度网络的未来,人工智能的未来。本章会比较长,为了帮助一导..
最近几年中,深度模型在推荐领域里的预测任务上取得的令人满意的成果。但大部分工作的焦点放在的模型,只有有限的少数工作注意到了输入的特征,但实际上特征决定了模型效果的上限。本文的工作也关注到了特征层面,特别是商业推荐系统中的特征。为了确保离线训练和在线服务的一致性,现实的应用中我们通常采用两个环境下都可以获取的特征。只有训练期间才能获取到的一批具有识别能力的特征因此被忽略。以电商推荐中的转化率预测为例







