logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

nanoGPT 数据准备全解:文本→整数→二进制

**nanoGPT** 是 Andrej Karpathy 开源的最小 GPT-2 复现项目,代码量小、注释清晰、能完整跑通文本生成,是理解 GPT 训练全流程的经典教学仓库。它把"训练一个大模型"拆成了几份关键文件:数据准备、模型定义、训练循环、采样推理。其中,**数据准备**由 `data/shakespeare_char/prepare.py` 完成——它把 Shakespeare 原始文本

文章图片
#pytorch#深度学习#python +1
DeepSeek Harness 内核拆解:Cordis 元框架、能力缝隙与子代理调度

DeepSeek Harness(dsh)表面是一个开源 Agent 框架,底层是一套「无特权核心、一切皆插件」的运行时。它把模型、工具、会话、沙箱、调度、UI 全部下沉为可热替换的插件,而支撑这种「随时拆装」的元框架叫做 Cordis——一份被 DeepSeek 整体 vendor 进仓库、改了 18 处的 TypeScript 微内核。

文章图片
#人工智能#语言模型
深度学习正则化:防止过拟合的关键技术

文章摘要: 深度学习中过拟合问题的解决方法主要包括以下几种正则化技术: Dropout:训练时随机丢弃部分神经元输出,防止模型过度依赖单个神经元,增强鲁棒性。使用时需注意在验证/测试阶段关闭,并合理设置丢弃率。 权重衰减(L2正则化):在损失函数中添加权重平方项,防止参数过大导致过拟合。需注意区分参数类型,通常不对归一化层参数和偏置项做衰减。 Early Stopping:监控验证集损失,在最优表

文章图片
#深度学习#人工智能
RAG 进阶保姆级教程:从玩具 demo 到稳定可用,全链路优化原理 + 可运行代码

本文详细介绍了从NaiveRAG到AdvancedRAG的全链路优化过程。首先实现了一个基于LangChain框架的NaiveRAG最小demo,分析其存在的检索前预处理不足、索引层单粒度分块缺陷、检索后无精排降噪等核心问题。然后针对这些问题提出了多阶段优化方案:检索前通过文本预处理、Multi-Query扩展和HyDE生成提升召回率;索引层采用双粒度分块策略和双层FAISS索引解决上下文割裂;检

#python#人工智能
到底了