logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

推荐系统王树森(三)粗排&精排

该文介绍了多目标排序模型在推荐系统中的应用,重点分析了粗排和精排阶段的模型架构与特征处理。文章详细阐述了特征工程方法,包括笔记统计特征、用户统计特征、场景特征的处理方式。在多目标建模方面,提出了MMoE专家混合模型解决多指标预测问题,并讨论了视频播放时长和完播率的特殊处理技巧。最后对比了粗排三塔模型与精排模型的差异,指出粗排通过简化计算提升效率,而精排追求更高准确性。文中还涉及负采样、特征融合等实

#人工智能
推荐系统王树森(二)双塔模型等多种召回

双塔模型是推荐系统中的重要结构,通过用户和物品两个神经网络塔生成向量表示。其训练需解决样本不平衡问题,包括过采样冷门物品或降采样热门物品,并采用不同负样本策略。线上应用时,通过向量数据库快速召回相似物品,并采用全量和增量更新结合的方式。针对长尾物品表征不足,引入自监督学习增强特征学习。此外,还介绍了DeepRetrieval、地理位置召回等扩展方法,以及曝光过滤的Bloom Filter应用。这些

#人工智能
力扣每日一题(一)双指针 + 状态转移dp & 矩阵快速幂

本文介绍了四道算法题的解题思路,主要涉及双指针和动态规划两种方法。第一部分“雨水三件套” 通过双指针解决容器盛水、接雨水等经典问题;第二部分展示如何用动态规划处理网格涂色、多米诺平铺等问题,并引入矩阵快速幂优化计算。文章还提供了Python代码实现,包括使用NumPy库进行矩阵运算的技巧。这些方法在解决特定类型的算法问题时具有高效性和通用性。

#leetcode#算法#动态规划 +2
推荐系统王树森(五)重排&多样性提升

本文介绍了推荐系统中提升多样性的重排方法。首先探讨了物品相似性的度量方式,包括基于属性标签和向量表示的方法,其中双塔模型和CLIP预训练可用于跨模态表征。其次详细讲解了MMR多样性算法,通过平衡候选物品的reward和与已选集合的相似度来优化多样性,并引入滑动窗口降低计算复杂度。然后说明如何结合业务规则(如首屏限制、广告频控等)对候选集进行预筛选。最后介绍了基于行列式的DPP算法,将多样性建模为向

#人工智能#机器学习
李宏毅深度学习教程 第6-7章 自注意力机制 + Transformer

李宏毅深度学习教程 第6-7章 自注意力机制 + Transformer。编码器、解码器的操作原理,以及有哪些特定情形的优化变形手法,如多头注意力,截断自注意力,束搜索,复制机制。

#深度学习#transformer#人工智能
SME-人工智能(六)习题(优化理论 损失函数 梯度下降)

本文聚焦优化理论核心知识点与神经网络参数计算实操内容。优化理论部分,以矩阵求导为基础,推导标签y∈{-1,1}场景下逻辑回归损失函数,通过Hessian矩阵证明损失函数凸性,还深入探讨强凸函数特性、log-sum-exp函数性质及梯度下降(GD)的线搜索特性与收敛性;神经网络部分,详细讲解MLP与CNN的参数计算逻辑,包含单/多卷积层输出维度求解、池化对维度的影响等,为相关领域的理论学习与实践应用

#人工智能#神经网络#逻辑回归 +1
周志华《机器学习导论》第13章 半监督学习

南京大学周志华院士《机器学习导论》第13章 半监督学习:在监督与无监督之间,少量标记样本的情况下,如何相比纯监督学习充分利用无标记样本的分布特征,相比无监督学习利用少量的已知信息?对高斯混合分布、SVM、k-means进行一些修正和改进。建模图论节点、边权迭代的思想;多视图协同训练、互相学习的思想。

#机器学习#人工智能
RL4LLM_Survey 强化学习在大语言模型后训练综述

海量文本语料的预训练及后续的监督微调奠定了LLM核心能力,但强化学习(RL)已逐渐成为优化LLMs不可或缺的范式,尤其在使其与人类价值观对齐、学习推理与遵循复杂指令方面发挥着关键作用。在本综述中,我们从三个关键维度追溯了 rl4llm 的发展脉络。 1. 由LLMs离散、高维特性带来的独特算法挑战,以及为解决这些挑战而发展的专门方法。 2. 使大规模强化学习训练成为可行的计算框架,这些框架推动了相

#人工智能
强化学习 -- 无导数随机优化算法玩俄罗斯方块Tetris(交叉熵方法CE + ADP近似动态规划CBMPI)

本文综述了一种基于近似动态规划的俄罗斯方块求解算法 CBMPI。针对传统 ADP 依赖值函数近似导致性能受限的问题,该算法创新性转向策略空间搜索,通过 “采样 - 回归器 - 分类器” 三步流程实现策略优化:基于 m 步截断滚动采样估计价值函数,利用最小二乘拟合回归器近似值函数,借助 CMA-ES 优化分类器得到近似贪婪策略。实验表明,在 20×10 大型棋盘上,CBMPI 平均消除 5100 万

#人工智能
TD3 双延迟深度确定性策略梯度(对 Actor-Critic DDPG 高估和方差的改进)

TD3(双延迟深度确定性策略梯度)是针对 DDPG 在 Actor-Critic 架构中存在的过估计偏差与高方差问题提出的优化算法。其核心围绕价值高估与方差膨胀两大痛点,借鉴双 Q 学习思想设计截断式双 Q 机制,通过双评论家网络取最小值抑制高估;搭配目标网络、延迟策略更新、动作扰动平滑三大方差削减策略,稳定训练过程。算法采用 “单演员 + 双评论家” 及对应目标网络的架构,以低成本实现连续控制任

#人工智能
    共 94 条
  • 1
  • 2
  • 3
  • 10
  • 请选择