
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本文记录了作者从零开始训练一个MiniGPT的学习过程。首先介绍了机器学习的基本概念,通过一个三次函数拟合的极简示例展示了梯度下降原理。然后重点解析了Transformer架构,特别是Decoder-only模型中多头自注意力的工作机制,包括其解决长距离依赖问题的优势。在实现部分,作者使用Qwen2分词器处理文本数据,并详细说明了预训练阶段的数据准备过程(添加结束符、分块切分等)。最后展示了带ma

中文命名实体识别技术方案对比分析 本文对比了两种中文命名实体识别(NER)技术方案。数据集采用CLUENER2020,包含10类实体,以短文本为主,实体平均长度4.5字。 方案一:LLM API调用 使用DeepSeek-V4-Flash模型,严格匹配准确率仅26.66% 存在识别错误、输出不稳定、速度慢(0.74s/条)等问题 面临隐私保护、长期成本高等落地挑战 方案二:BERT微调 采用BIO

文本分类实践:从数据探索到方案对比 本文探讨了文本分类在实际场景中的应用及两种实现方案。文本分类广泛应用于内容平台分类、电商评论分析、风控合规等领域,核心价值在于自动化处理海量文本数据。实验基于CLUE/TNEWS数据集展开,分析显示数据存在类别不均衡(23倍差异)、文本短(平均22字)等特点。 方案一测试了调用DeepSeek-V4大模型API的效果,结果显示:DeepSeek-V4-Pro零样

前言与模板需要读者对最短路之不含负权边:Dijkstra算法朴素和堆实现有所了解。bellman-ford适用情况:与拓展次数有关可用于负权。因为有次数限制,所以可以有负环(负权回路)简要介绍:暴力法。每次大循环的含义是向外拓展一次,每次大循环将所有的边遍历一次。模板://循环k次(拓展k次边) 每次循环尝试更新所有的节点最小值int bellman_ford(int n, int m, int
C++实现简易线程池







