logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

DeepAgents 上下文管理(全网最细)

本文详细介绍了DeepAgents智能体的四层上下文管理架构: 输入响应层:包含系统提示、记忆文件、技能和工具说明,在启动时加载 运行时上下文:每次调用动态传入的用户上下文,解决工具执行时的身份识别问题 子代理隔离:各子智能体相互隔离不可见 长短期记忆:分为同一会话的短期记忆和跨会话的长期记忆 重点解析了输入响应层四个组件的加载机制和区别,以及运行时上下文的实现方式(通过定义数据类型和调用时传入)

#人工智能#python
python中进程池 Pool 的 map 方法 = 一次提交多个任务,自动分配给进程执行

pool.map(函数, 参数列表)→一次提交多个任务,自动分配进程,按顺序返回结果。

#python
python语法-------strptime + strftime + timedelta 终极区分(一次看懂)

转换用strptimestrftime计算用timedelta三者经常搭配使用,是 Python 处理时间的标准三件套。

#python#开发语言
机器学习之皮尔逊相关系数

整套代码 =读数据 → 洗数据 → 算相关性 → 可视化corrwith()算单个特征相关性,corr()算全量矩阵皮尔逊相关系数,判断两个变量的线性关系业务价值:直接告诉老板哪个广告渠道最值得投钱。

#机器学习#人工智能
机器学习特征工程之特征降维PCA

人工构造带冗余、噪声的3D数据 → 用PCA降为2D → 验证“降维不丢核心信息”,掌握PCA基础用法和核心逻辑。方差与信息量:方差越大 → 数据波动越大 → 信息量越多(核心:pc1>pc2>噪声)。关键输入输出:3D特征矩阵(样本数×3)→ PCA降维 → 2D特征矩阵(样本数×2)。核心:左图3D散点(呈长条状),右图2D散点(形状与3D一致),证明降维未丢关键信息。PCA本质:找数据“方差

#机器学习#人工智能
机器学习之损失函数(四大常见的损失函数学习)

最朴素的损失函数,仅判断预测值与真实值是否一致,一致则损失为0,不一致则损失为1。又称均方误差(MSE),计算预测值与真实值差值的平方,放大较大偏差的损失。又称平均绝对误差(MAE),计算预测值与真实值差值的绝对值,对偏差的惩罚是线性的,不放大异常值。基于概率似然思想,衡量模型预测概率与真实标签的匹配度,核心用于分类任务(二分类、多分类),常被称为交叉熵损失(二分类场景下,对数似然损失与交叉熵损失

#机器学习#人工智能
机器学习正则化超详细讲解(重点吃透 L1、L2)

正则化:给模型权重加惩罚,限制复杂度,专治过拟合L1:绝对值惩罚 → 权重可归零 →自动删特征、做筛选L2:平方惩罚 → 权重只缩小不归零 →平滑稳定、通用防过拟合日常干活优先用 L2;特征太多想自动降维再用 L1;不稳就用 L1+L2。

#机器学习#人工智能
手搓gpt_model

这篇文章详细讲解了如何使用PyTorch手动实现GPT-2模型的核心组件。主要内容包括: 层归一化(LayerNorm)的实现,解释了其数学原理和参数(γ,β)的作用 GELU激活函数的近似计算实现及其优势 前馈神经网络(FeedForward)的结构,包含升维-激活-降维的设计思路 关键维度变化说明,如输入形状(2,4,768)的处理过程 文章采用"逐行解析"的方式,结合运行示例(B=2,T=4

00 背景知识速成-----全流程实现chatgpt2(预训练->sft->ppo)

文字 --tokenizer--> token id 列表 --embedding--> (B, T, 768) 向量[6821, 1726, ...] 每个 token 一个 768 维向量B:batch,一次喂几条样本。T:seq_len,一条样本里多少个 token。形状就是"整个模型世界的主语"——几乎所有操作都在这个形状上进进出出。

#算法
00 背景知识速成-----全流程实现chatgpt2(预训练->sft->ppo)

文字 --tokenizer--> token id 列表 --embedding--> (B, T, 768) 向量[6821, 1726, ...] 每个 token 一个 768 维向量B:batch,一次喂几条样本。T:seq_len,一条样本里多少个 token。形状就是"整个模型世界的主语"——几乎所有操作都在这个形状上进进出出。

#算法
    共 44 条
  • 1
  • 2
  • 3
  • 4
  • 5
  • 请选择