
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
小岛与河的两岸有七条桥连接。又是板子题, 由于没说是通路还是回路, 所以我们先按无向图找通路起点, 找不到就说明是回路, 随便找个起点就行。我们继续观察,发现我们把数字当作结点,每块骨牌当作边,问题就转化成了一个有n条边的图,我们要让每条边出现一次。由于每个结点出度入度相等都为k,且强连通,于是图中存在欧拉回路,我们求欧拉回路即可得答案。本题时间限制卡在0.25 second,但是点也就7个,边也

2026年3月16日,更新了复杂度分析

dp数组的计算其实是经典问题,假如不是环而是一条链的话,我们按照dp[i] = dp[i - 1] + dp[i - 2] 即可处理,但现在是环,所以需要分第一个边 选 / 不选分别dp再累加结果。P, Q 两个排列其实就是一个置换,由该置换我们可以得到一个置换环,环上一条边就代表原数组中的一对 <P[i], Q[i]>我们需要预处理出一个数组dp,dp[i] 代表从长度为i 的环中,选出若干条边

在最基础的神经网络中,我们是一层一层计算的:输入层 -> 隐藏层 -> 输出层。但是,现在的网络太深了(比如ResNet有152层),如果按“层”来写代码,太过于复杂。块(在PyTorch中叫 nn.Module)。块”就像是乐高积木:单层(比如一个nn.Linear)是一个小积木块。多层组合(比如 线性层 + 激活函数 + 线性层)拼在一起,可以封装成一个大一点的积木块。整个神经网络,其实就是把

这一章作者带着手搓了一下GPT 2的architecture,架构还是比价清晰易懂的。ch04。

之前手搓过GPT-2(),然后一时兴起想梳理一下GPT1~3的技术路线。维度GPT-1GPT-2GPT-3论文时间201820192020最大参数量117M1.5B175B架构训练目标自回归 next-token prediction自回归 next-token prediction自回归 next-token prediction主要数据WebText上下文长度512 tokens下游适配核心贡

这篇论文就是后面经典的Vision Transformer,核心思想很直接:将一张图片切成一系列固定大小的patch,把一个 patch 当作NLP任务中的一个token,然后送入标准 Transformer Encoder 做图像分类。它证明了在足够大规模数据预训练的条件下,纯架构可以在图像识别任多上达到基至超过CNN。打破了 cv 和 nlp 在模型上的壁垒。paper code网站上 Ima

这篇论文就是后面经典的Vision Transformer,核心思想很直接:将一张图片切成一系列固定大小的patch,把一个 patch 当作NLP任务中的一个token,然后送入标准 Transformer Encoder 做图像分类。它证明了在足够大规模数据预训练的条件下,纯架构可以在图像识别任多上达到基至超过CNN。打破了 cv 和 nlp 在模型上的壁垒。paper code网站上 Ima

本章主要讲了下如何评价llm生成文本的质量,如何进行预训练。ch05。

很久没读英文文本了,原作第二章读了有俩小时……总体来说还是非常简单的,主要就是为 llm training 做一些文本预处理的工作。ch02。








