logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

使用xgboost4j-spark进行模型训练

代码说明xgboost作为数据挖掘类比赛的必备算法,之前参加jdata比赛时,也学着使用了下xgboost4j-spark,觉得很好用,既支持分布式,同时效果和速度都比spark自带的gbdt,rf算法效果要好。模型代码包含:-train:训练-train_cv:训练带交叉验证进行参数选择-predict_eval:预测并在验证集上验证准确率-predict:预测-train_le...

广告行业中那些趣事系列12:推荐系统中融合注意力机制的DIN模型

本篇一共5432个字摘要:本文主要介绍阿里的深度兴趣网络DIN模型。为了解决推荐领域中用户历史行为包含大量用户兴趣信息,但只有一小部分用户兴趣信息会最终影响用户点击行为的问题,阿里引入A...

hive 将一个分区表数据全部插入另外一个分区表

假如现在hive有个分区表A,分区字段为inc_day需求是:需要将A表中的数据全部插入到分区表B中具体步骤如下:1.create B like A;2.插入数据set hive.exec.dynamic.partition=true;set hive.exec.dynamic.partition.mode=nonstrict;insert overwrite table ...

#hive
大数据面试题汇总(不断更新中)

    结合自身面试经历,包括BAT、SF、中信等等公司所做的面试题汇总。主要包括以下几大类:一、spark相关1.Spark的Shuffle原理及调优?2.hadoop和spark使用场景?3.spark如何保证宕机迅速恢复?4.hadoop和spark的相同点和不同点?5.RDD持久化原理?6.checkpoint检查点机制?7.checkpoint和持久化机制的区别?8.Spa...

AI那些趣事系列103:当AI开始“胡言乱语”---揭秘大模型幻觉的根源与破局之道

大模型在面对不确定问题时会选择“合理编造”而非说“不知道”,本质是评估体系在鼓励模型猜测,就像考试中“答对得1分,空题或者答错得0分,但是蒙题会有有概率答对从而得分”的规则,催生了学生的冒险行为。:模型的“胡言乱语”也分很多种,有的是低级的拼写错误(现已很少),有的是逻辑推理的失误(如计数错误),有的则是严重的事实虚构(如编造生日)。一个最简单的判断原则是:蓝色的柱子越贴近那条黑色的对角线,说明这

#人工智能
AI那些趣事系列104:大模型 Agent:从 “一问一答” 到 “自主办事”,上下文工程是关键

未来,随着上下文工程的发展,Agent 会变得更 “聪明”:它能记住你的长期偏好(比如 “你喜欢喝美式咖啡,不加糖”),能处理更复杂的任务(比如 “帮你规划整个职业生涯”),甚至能和其他 Agent 协作(比如 “订票 Agent 和酒店 Agent 协作,完成你的旅行安排”)。大模型的 “上下文窗口” 是有限的 —— 比如 GPT-4 的上下文窗口是 128k tokens(大概相当于 10 万

AI那些趣事系列105:大模型 Agent 上下文工程实践分享

比如 “上次订的晚上去上海的二等座” 和 “帮我订和上次一样的票” 的向量相似度很高,调用器就能关联到上次的信息。从技术拆解来看,上下文工程的实现本质是 “信息的全生命周期管理”—— 从 “采集(源头)” 到 “处理(整理)”,再到 “存储(仓库)”,最后到 “调用(使用)”,每个环节都围绕 “让 Agent 更高效、更精准地利用信息” 展开。短期关联能力:比如用户说 “帮我订明天去上海的票”,后

AI那些趣事系列106:大模型 Agent 的 “记忆瘦身术”:上下文压缩工程如何破解性能与成本困局?

当前遇到的问题是,生成折线图时,工具提示 “日期格式错误”,需要确认数据中的日期字段是否为 “YYYY-MM-DD” 格式。Agent 的上下文也是如此:任务过程中积累的历史对话、工具返回结果、中间计算步骤不断堆积,轻则导致大模型响应延迟,重则超出上下文窗口限制(比如 GPT-4 Turbo 的 128K 窗口,看似很大,处理多轮代码调试时仍会捉襟见肘),甚至推高 Token 消耗成本(按当前市场

#人工智能
AI那些趣事系列107:大模型 Agent 陷入循环调用工具?从运维实战聊聊问题根源与破解之道

可以尝试在系统中添加一个简单的检测逻辑:如果 Agent 连续两次调用同一个工具,且工具返回的核心结果(比如告警组 ID、关键指标)完全一致,就判定为 “重复调用”,系统会阻止本次调用,并提示 Agent:“已获取相同结果,无需重复调用,请基于现有信息分析”。这是最简单也最有效的方法。这种“自主决策” 的特性,既是 Agent 的优势(灵活应对复杂场景),也埋下了 “循环调用” 的隐患 —— 如果

#人工智能#运维
中国巴菲特段永平 2025 专访深度学习笔记:普通人能抄的投资心法,藏在 “买公司” 和 “慢生活” 里

段永平举了个例子:“我孩子小时候想学编程,我没反对,但我告诉孩子:‘编程很难,你可能会遇到很多挫折,如果你决定学,就要坚持下去,不能半途而废。而他的投资生涯,更是把 “懂行” 发挥到了极致:2001 年左右,网易因财务问题股价跌到 1 美元以下,濒临退市,段永平重仓买入,后来网易股价涨了几百倍,这一笔投资就让他赚得盆满钵满;段永平相信苹果会出手机大屏,是因为段总相信苹果是非常重视用户体验的,用户需

#生活
    共 53 条
  • 1
  • 2
  • 3
  • 6
  • 请选择