logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

机器学习基础知识【 激活函数、损失函数、优化器、 正则化、调度器、指标函数】

机器学习核心组件摘要 激活函数:神经网络引入非线性的关键组件,包括Sigmoid(0-1输出)、ReLU(简单高效)、Leaky ReLU(解决神经元死亡)、Tanh(-1-1输出)和Softmax(多分类概率输出)。 损失函数:衡量预测误差的核心指标,MSE/MAE用于回归,交叉熵系列(Binary/Categorical/Sparse)用于分类,Hinge Loss适用于SVM。不同函数对异常

#机器学习#python
ollama本地化部署deepseek/大模型及其api流式调用

Ollama 是一个轻量级本地大模型运行环境,可以在 Windows / macOS / Linux 上运行主流开源模型。它支持:前往官网:🔗 https://ollama.com/download选择 Windows Installer (.exe) 下载。安装完成后,Ollama 会自动在系统中注册命令行工具 。打开 PowerShell 或 CMD,执行:如果输出版本号(例如 ),说明安装

#语言模型
解码AI大模型:从神经网络到落地应用的全景探索

近年来,大语言模型(LLM)以前所未有的速度进入公众视野。从 ChatGPT 到 DeepSeek,从“能聊天”到“能干活”,模型的能力边界不断被刷新。但与此同时,**模型参数**、**Token**、**Embedding**、**自注意力**、**RAG**、**Agent** 等概念,也让不少人产生了一种“看不懂但很厉害”的距离感。

#人工智能#神经网络#深度学习
深度学习优化器详解:指数加权平均EWA、动量梯度下降Momentum、均方根传递RMSprop、Adam 从原理到实操

在深度学习模型训练中,“优化器”是决定模型能否快速收敛、避免过拟合、达到最优性能的核心组件。而**指数加权平均(EWA)、动量梯度下降(Momentum)、RMSprop、Adam** 这四个算法,更是贯穿了优化器的发展历程——EWA是基础工具,Momentum解决梯度震荡,RMSprop解决学习率适配,Adam则融合三者优势成为工业界标配。

#深度学习#人工智能
深度学习必懂:BN与LN标准化详解,从原理到实战一文吃透

在深度学习的模型训练中,有两个“不起眼但缺一不可”的核心组件——Batch Normalization(批量归一化,简称BN)和Layer Normalization(层归一化,简称LN)。它们没有激活函数那样“注入非线性”的亮眼作用,也没有注意力机制那样“聚焦关键信息”的强大能力,却默默解决了深度网络训练中最棘手的“数值分布混乱”问题,让模型训练更稳定、收敛更快、效果更优。

#深度学习#人工智能
深度学习RNN详解:原理、变体、应用

在深度学习领域,卷积神经网络(CNN)凭借强大的空间特征提取能力,成为图像、视频等网格结构数据处理的首选;而针对**序列数据**——比如文本、语音、时间序列(股票价格、气象数据),循环神经网络(Recurrent Neural Network, RNN)则占据了核心地位。与CNN的“静态特征提取”不同,RNN最大的优势的是“**记忆性**”,它能利用历史序列信息,捕捉数据中的**时序依赖关系**,

#深度学习#rnn#人工智能
彻底吃透大模型核心:Attention、QKV、KV Cache、Prefix缓存、Decoder-only架构

本文深入解析了大模型的核心原理与推理流程,重点包括:1)Token、Token-ID与Embedding的三层转换关系;2)自注意力机制中Q/K/V矩阵的动态生成原理;3)Encoder-Decoder与Decoder-only架构的本质区别;4)Prefill和Decode两阶段推理的工作机制;5)KV缓存的底层逻辑与优化策略。通过大量示例和公式推导,系统性地阐述了大模型从文本处理到矩阵运算的完

#transformer#人工智能#架构
机器学习周志华学习笔记-第16章<强化学习>

机器学习周志华学习笔记-第16章<强化学习>

文章图片
#机器学习#学习
【解读ByteByteGo 长文】ChatGPT Agent Loop 深度性能优化全解:Harness、API 与推理三层工程落地

摘要 本文解析了ChatGPT如何通过三层架构优化智能体循环效率:调度层(Harness)、API网关层和推理层。调度层采用持久WebSocket连接和增量差分请求减少网络开销,稳定提示词前缀复用缓存,延迟工具检索和代码运行模式降低冗余。API网关层实现增量分词、并行安全检测与推理。推理层通过缓存感知路由、KV缓存管理、投机解码等技术最大化GPU利用率。OpenAI的实践表明,优化系统级协作(而非

文章图片
#性能优化#人工智能
深度学习RNN详解:原理、变体、应用

在深度学习领域,卷积神经网络(CNN)凭借强大的空间特征提取能力,成为图像、视频等网格结构数据处理的首选;而针对**序列数据**——比如文本、语音、时间序列(股票价格、气象数据),循环神经网络(Recurrent Neural Network, RNN)则占据了核心地位。与CNN的“静态特征提取”不同,RNN最大的优势的是“**记忆性**”,它能利用历史序列信息,捕捉数据中的**时序依赖关系**,

#深度学习#rnn#人工智能
    共 43 条
  • 1
  • 2
  • 3
  • 4
  • 5
  • 请选择