logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

说说使用AI或者大模型主动分析大数据组件的warn和error日志有什么价值

传统日志分析是 “日志产生→人工排查→故障修复” 的被动流程,而 AI / 大模型构建了 “日志实时采集→AI 降噪 / 关联 / 预测→主动告警 / 自动预处理→故障根因定位→业务影响评估→解决方案推荐→案例沉淀迭代” 的主动闭环。其最终价值不仅是 “提高运维效率”,更是通过 “预防故障、减少中断、优化资源”,为大数据驱动的业务(如实时推荐、数据分析、AI 训练)提供稳定、可靠的底层支撑,间接提

文章图片
#人工智能#大数据
我有4篇PPT转PDF的文件,我想从这4个文件中提取大数据平台、数据中台、数据安全相关的内容,并根据这些内容规划出2026年可以建设和升级的功能,如何给大模型提问

要让大模型(如ChatGPT、Kimi、文心一言等)高效地完成这个任务,关键在于结构化、分步骤的提问,避免一次性抛出一个过于复杂和模糊的指令。

文章图片
#大数据#人工智能
org.apache.hadoop.yarn.server.nodemanager.NodeStatusUpdaterImpl | Unexpected error starting NodeStat

恢复功能异常是可能导致 NodeStatusUpdater 启动失败的原因之一,核心在于恢复过程中的状态加载或 IO 操作异常会阻断 NodeManager 整体初始化流程。通过临时禁用恢复功能、检查状态文件和目录状态,可快速验证并定位问题。

文章图片
#apache#hadoop#大数据
什么情况下org common会内嵌到org hadoop的package下面,比如:org/apache/hadoop/org/apache/commons/StringUtils.class

org/common(即Apache Commons库)内嵌到org/hadoop的包下,主要是Hadoop项目为了依赖隔离和避免冲突而采取的阴影化技术所致。这是一种常见的最佳实践,确保Hadoop在分布式环境中稳定运行。如果你在开发或使用Hadoop时遇到类加载问题,理解这一点有助于调试依赖冲突。

文章图片
#hadoop#apache#大数据
Spark 3.1.1 自适应执行核心配置清单

Spark 3.1.1 的自适应执行:动态调整执行计划,无需手动优化 join 策略、数据分片大小等细节。针对数据倾斜、小表广播判断不准等问题,能自动修正执行逻辑,提升稳定性。对复杂查询(多表 join、聚合嵌套)的优化效果更明显,减少人工调优成本。

文章图片
#spark#大数据#分布式
kyuubi+spark3.4.1单用户提交任务,yarn队列使用不满

Kyuubi 引擎共享级别是user级别,单个用户的任务跑在一个spark on yarn的集群上,队列大小为30TB,但是Spark executor内存8G+offheap8G、vcore4核,在次前提下,spark3.4.1启动的动态executor,但是最大的executor数量为500,最大才能使用队列8TB内存,这时候需要改下最大的executor数量为1500,才能使用到24TB的内

#spark
文章图片
deepseek-r1 1.5b 7b 8b 14b 32b 70b 671b,有什么区别

DeepSeek-R1系列通过参数分级覆盖全场景需求:轻量级模型(1.5B-8B)实现普惠化AI,中大规模模型(14B-70B)满足专业领域需求,顶级模型(671B)探索技术边界。选型需综合任务复杂度、硬件预算和数据安全要求。

文章图片
#人工智能
    共 33 条
  • 1
  • 2
  • 3
  • 4
  • 请选择