logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Agency-Agents 多智能体协作系统落地指南

本文深入探讨了多智能体协作系统的工程化落地方案,旨在帮助企业应对复杂业务流程的自动化挑战。通过将宏观目标拆解为原子任务、基于技能与负载的角色分配、依赖感知的任务调度等核心机制,构建出高效、稳定的Agent集群。文章提供了完整的供应链优化模拟代码,展示了从任务拆解、角色分配到结果汇总的全流程,并强调系统扩展性、成本控制等实际部署考量,为技术团队构建可演进的多智能体系统提供实用指南。

#人工智能#大数据#算法
SparkCore 之 Spark RDD 五大特性及弹性分布式容错原理剖析

RDD 论文获奖不是因为它"比 MR 快",而是它提出了一种新的分布式计算抽象——通过五个特性的精心设计,在容错、并行、数据本地性、内存计算四个维度上找到了最优平衡点。Partitions→ 并行粒度Dependency→ Stage 划分基础→ Shuffle 分布策略→ 数据本地性保证→ 惰性求值 + 计算容错**RDD 五大特性不是孤立的知识点,而是一个有机整体。**理解它们如何联动,才算真

文章图片
#分布式#spark#大数据
SparkCore 之 Spark Action 类算子详解

Action 算子虽然数量不多(约 20 个),但理解它们的数据流向和内存压力:数据向 Driver 汇聚 → 控制数据量foreach/saveAsTextFile → Executor/存储:数据向外发散 → 无内存压力reduce/aggregate → 聚合后返回:Executor 间聚合 → 关注 Shuffle选对 Action,不仅决定性能,更决定你的 Driver 会不会 OOM。

文章图片
#spark
SparkCore 之 Spark Transformation 类算子详解

本文系统拆解了Spark核心Transformation算子,按照功能分为五大类:映射过滤类(map/filter等)、聚合排序类(reduceByKey等)、连接类(join等)、分区调整类(repartition等)和集合操作类(union等)。重点分析了各算子的语法、依赖类型(窄/宽)、执行原理和性能特点,特别指出: 映射类算子(如mapPartitions)通过分区级操作可显著提升性能 聚

文章图片
#spark#大数据#分布式
SparkCore 之 Spark 运行模式系统讲解

我的计算任务应该跑在哪里、由谁来管理资源?写代码时→local[4],IDE 里打断点上测试环境→,看着日志调参数上生产环境→,开动态分配、配 Shuffle Service上云原生→,用 Operator 管理生命周期模式的选择,决定了你的 Spark 作业有多稳定、多高效、多省钱。

文章图片
#spark#大数据#分布式
Spark Core 之 Spark 基于开发工具的详细配置讲解

Spark 开发环境配置是第一道门槛,也是最容易被跳过的一步。很多人照着网上的 pom.xml 复制粘贴,出了问题不知道从哪里排查。本文从全链路拆解,配合完整 pom.xml 模板(可直接复制)、WordCount 源码逐行注释、10 个高频错误排查、4 张架构图、四阶段学习路线。希望能帮你一次性搞定 Spark 开发环境。环境稳了,代码才能飞。👨‍💻starzy| AI Data Engin

文章图片
#spark#大数据#分布式
LangChain深度解析:模型、链、Agent三大核心,解锁大模型落地的正确姿势

LangChain 不是银弹,但它为大模型应用开发提供了一套经过大量生产验证的最佳实践框架。对于 Java 和大数据工程师而言,LangChain 的模块化设计理念与后端开发中"分层架构 + 依赖注入"的思路一脉相承,学习曲线相对友好。几点建议供参考:新手入门:从 LCEL + RAG 开始,这是 80% 应用场景的基石进阶方向:掌握 Agent 和 LangGraph,解锁复杂工作流编排生产落地

文章图片
图解 Spark Standalone-Client 模式: 源码级深度拆解

要点一句话总结Driver 位置Client 模式在提交客户端 JVM,Cluster 模式在 Worker 节点四步启动注册 → 申请资源 → Master 调度 Worker → Executor 反向注册反向注册Executor 是 Worker fork 的子进程,主动连接 Driver 注册Task 调度Driver 的 DAGScheduler + TaskScheduler 负责,M

文章图片
#spark#大数据#分布式
Spark 核心之 Application 和 Job 原理剖析

要点总结层级关系Job 触发每个 Action 算子调用 sc.runJob() 创建新 JobStage 切分遇到 ShuffleDependency 即切分Task 生成Stage 最后一个 RDD 的 Partition 数量 = Task 数金句:Transformation 是"画图纸"(构建 DAG),Action 是"按下启动键"(触发 Job)。一个 Application 可以画

文章图片
#spark#javascript#大数据
Spark 核心之 Stage 和 Task 原理剖析

要点总结Stage 切分遇到 ShuffleDependency 即切分,递归提交(先父后子)Task 生成每个 Partition → 一个 Task,类型由 Stage 决定两种 StageShuffleMapStage(写 Shuffle) + ResultStage(返回结果)序列化Task 闭包必须可序列化,推荐 Kryo金句:Stage 是 Spark 的"流水线工位",Task 是每

文章图片
#spark#大数据#分布式
    共 73 条
  • 1
  • 2
  • 3
  • 8
  • 请选择