
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
机器学习核心组件摘要 激活函数:神经网络引入非线性的关键组件,包括Sigmoid(0-1输出)、ReLU(简单高效)、Leaky ReLU(解决神经元死亡)、Tanh(-1-1输出)和Softmax(多分类概率输出)。 损失函数:衡量预测误差的核心指标,MSE/MAE用于回归,交叉熵系列(Binary/Categorical/Sparse)用于分类,Hinge Loss适用于SVM。不同函数对异常
Ollama 是一个轻量级本地大模型运行环境,可以在 Windows / macOS / Linux 上运行主流开源模型。它支持:前往官网:🔗 https://ollama.com/download选择 Windows Installer (.exe) 下载。安装完成后,Ollama 会自动在系统中注册命令行工具 。打开 PowerShell 或 CMD,执行:如果输出版本号(例如 ),说明安装
近年来,大语言模型(LLM)以前所未有的速度进入公众视野。从 ChatGPT 到 DeepSeek,从“能聊天”到“能干活”,模型的能力边界不断被刷新。但与此同时,**模型参数**、**Token**、**Embedding**、**自注意力**、**RAG**、**Agent** 等概念,也让不少人产生了一种“看不懂但很厉害”的距离感。
在深度学习模型训练中,“优化器”是决定模型能否快速收敛、避免过拟合、达到最优性能的核心组件。而**指数加权平均(EWA)、动量梯度下降(Momentum)、RMSprop、Adam** 这四个算法,更是贯穿了优化器的发展历程——EWA是基础工具,Momentum解决梯度震荡,RMSprop解决学习率适配,Adam则融合三者优势成为工业界标配。
在深度学习的模型训练中,有两个“不起眼但缺一不可”的核心组件——Batch Normalization(批量归一化,简称BN)和Layer Normalization(层归一化,简称LN)。它们没有激活函数那样“注入非线性”的亮眼作用,也没有注意力机制那样“聚焦关键信息”的强大能力,却默默解决了深度网络训练中最棘手的“数值分布混乱”问题,让模型训练更稳定、收敛更快、效果更优。
在深度学习领域,卷积神经网络(CNN)凭借强大的空间特征提取能力,成为图像、视频等网格结构数据处理的首选;而针对**序列数据**——比如文本、语音、时间序列(股票价格、气象数据),循环神经网络(Recurrent Neural Network, RNN)则占据了核心地位。与CNN的“静态特征提取”不同,RNN最大的优势的是“**记忆性**”,它能利用历史序列信息,捕捉数据中的**时序依赖关系**,
本文深入解析了大模型的核心原理与推理流程,重点包括:1)Token、Token-ID与Embedding的三层转换关系;2)自注意力机制中Q/K/V矩阵的动态生成原理;3)Encoder-Decoder与Decoder-only架构的本质区别;4)Prefill和Decode两阶段推理的工作机制;5)KV缓存的底层逻辑与优化策略。通过大量示例和公式推导,系统性地阐述了大模型从文本处理到矩阵运算的完
机器学习周志华学习笔记-第16章<强化学习>

摘要 本文解析了ChatGPT如何通过三层架构优化智能体循环效率:调度层(Harness)、API网关层和推理层。调度层采用持久WebSocket连接和增量差分请求减少网络开销,稳定提示词前缀复用缓存,延迟工具检索和代码运行模式降低冗余。API网关层实现增量分词、并行安全检测与推理。推理层通过缓存感知路由、KV缓存管理、投机解码等技术最大化GPU利用率。OpenAI的实践表明,优化系统级协作(而非

在深度学习领域,卷积神经网络(CNN)凭借强大的空间特征提取能力,成为图像、视频等网格结构数据处理的首选;而针对**序列数据**——比如文本、语音、时间序列(股票价格、气象数据),循环神经网络(Recurrent Neural Network, RNN)则占据了核心地位。与CNN的“静态特征提取”不同,RNN最大的优势的是“**记忆性**”,它能利用历史序列信息,捕捉数据中的**时序依赖关系**,







