1. 为什么我用“线性表示”做深度学习项目的第一步
先说个我观察到的现象。很多人学深度学习,一上来就啃CNN、Transformer,看了一堆结构图,能背出ResNet的残差块长什么样、Attention的公式怎么算,但一旦自己动手写模型,就卡在那些最基础的问题上:全连接层的输入输出维度到底怎么对上的?数据流经过一个Linear层之后,特征空间发生了什么变化?为什么有的模型叠了很多层还是学不好?
这些问题的答案,全都在“线性表示”这四个字里。
线性表示,简单说就是神经网络里最基本的那个操作:对输入做一次矩阵乘法再加上偏置,也就是 y = Wx + b。你别看它形式简单,整个深度学习大厦的地基就是它。卷积层本质上是局部共享的线性变换,注意力机制里的QKV映射是线性变换,Transformer里几乎每个模块的前后都挂着线性层,Embedding本质上也等价于查表后做线性表示。可以说,你见过的绝大多数深度学习模型,不管名字多花哨,骨子里都是大量线性变换和非线性激活组合出来的。
我建议每一个深度学习入门者,都认真地拿“线性表示”当一个正式项目来做一遍,而不是在教科书的公式里扫一眼就过去。原因很简单:这是整个领域里投入产出比最高的一件事情。你花一个周末把它彻底吃透,后面再去看经典的图像分类网络、序列模型,甚至大语言模型的结构,都会有一种“原来都是这玩意儿在变花样”的通透感。反过来,如果这块地基是虚的,后面你写再多代码、跑再多实验,遇到玄学问题也只能靠瞎试。
这篇内容里,我会用自己的一个实际小项目作为主线,把线性表示的原理、代码实现、实验设计和踩坑记录完整拆开。项目本身不复杂,但设计思路和排查过程是那些教程里最不容易讲透的部分,也是我认为价值最高的部分。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 项目的核心思路与设计拆解
2.1 线性表示到底在做什么:一个坐标变换器
聊线性表示,得先从“表示”这两个字说起。深度学习里所谓的“表示学习”,就是要找到一组合适的特征,让数据在特征空间里变得好处理。而线性表示做的事情,就是把原始输入通过一个仿射变换投影到另一个空间里。
我用一个生活化的类比来理解这件事。假设你面前有一堆散落在地上的积木,有长条的、方形的、圆形的。你想让一个机器人把它们分类放进三个箱子里,但机器人眼睛看到的原始数据是一堆坐标和三通道颜色值,这些值在原始空间里并不能直接告诉你“这是长条还是圆形”。于是你先让机器人做一次线性变换,把每个积木的坐标和颜色映射到一个新的三维空间里——比如第一维代表“长条程度”,第二维代表“圆润程度”,第三维代表“颜色深浅”。这时候再分类,就变成了在这个新空间里画三条界线的问题。
神经网络里的线性层干的就是这件事。输入是一批向量,权重矩阵 W 的每一行可以理解为“新空间里一个维度的定义方式”,偏置 b 则是“这个维度上的原点偏移”。输入信号和 W 的每一行做点积,得到的就是在该维度上的投影值。
从几何上看,不考虑偏置时,矩阵乘法对输入做的是缩放和旋转的组合;加上偏置之后,还多了一个平移。这就是线性变换的全部几何含义。理解了这一点,你就可以解释为什么线性层能改变数据的分布位置和方向,但无法改变数据之间本质的拓扑关系——比如两条原本纠缠在一起的螺旋线,线性变换永远扯不开它们。
这也是本项目设计的第一个关键点:我必须用一组可视化数据,让读者亲眼看到线性变换在空间中对数据做了什么。与其空谈理论,不如让特征点在坐标图里动起来。
2.2 为什么堆再多的线性层也不行:非线性的必然性
你可能会想,既然线性变换已经能做缩放旋转平移,那我是不是可以堆很多层线性层来增强表达能力?理论上,两层线性变换复合在一起,数学上仍然是一个线性变换。也就是说,不管你把 W1、W2 叠多少层,结果等价于用一个新的 W 矩阵做一次变换。层数再多,能实现的映射类别也不会比单层多。
这就像你连续多少次“乘2加1”,最后依然可以合并成一个“乘8加7”,并不会因为你多做几次操作就获得什么新能力。神经网络之所以强大,全靠非线性激活函数在每次线性变换之后“打断”这种可合并性。ReLU、sigmoid、tanh 这些激活函数引入的是一道弯折,让下一层线性变换可以作用于一个被“扭曲”过的空间里,继续细分不同区域。
所以,线性表示和非线性激活就像一个双人组合:线性层负责把特征重新组合、变换到合适的坐标系,激活函数负责在坐标系里制造决策边界的弯曲能力。没有前者,后者缺少变换手段;没有后者,前者再深也只是单层的线性分类器。
这个认知直接指导了本项目的对比实验设计:我要做一个“纯线性模型”和一个“线性+非线性模型”在同一份数据上的对照,看看它们的决策边界差异有多大。这是整篇项目最直观、也最具有说服力的一环。
2.3 数据维度设计:一张表讲清楚输入输出怎么流
动手写代码前,还有一道绕不过去的坎:维度匹配。我见过太多人在这里翻车,尤其是从别的编程语言转过来的。Pytorch的Linear层,初始化的参数是 in_features 和 out_features,也就是输入维度和输出维度。
大多数人的困惑在于:一个批次的数据送进来形状是 (batch_size, input_dim),经过 Linear 层后变成 (batch_size, output_dim)。batch size那一维是“并行的样本数量”,不参与权重矩阵的乘法,只是整个批次一起过。真正发生矩阵乘法的是最后一个维度和权重矩阵的第二维之间的运算。
实践里最容易搞混的是,当你拿到 (seq_len, batch_size, hidden_size) 这样三维的序列数据时,Linear层默认只对最后一维做变换。如果你想对序列维度做变换,就得手动把维度换到最后一维再操作,或者用专门处理序列维度的模块。类似这种问题,我在后面的常见问题章节会展开讲。
本项目我特意把数据维度设计得很小,方便在代码里跟踪每一步的形状变化。核心维度流程是:输入 (N, 2) 的二维坐标点,经过第一个线性层变成 (N, 4),再过激活函数,第二个线性层输出 (N, 2) 用于分类或者可视化,最后读出来画图。整个过程简单到一张纸就能写完,但每一行变换的几何意义都是清晰可感的。
3. 核心细节解析与实操要点
3.1 用哪个数据集:人造数据反而比公开数据更合适
很多初学者做项目喜欢直接用MNIST或者CIFAR,但我这个项目选的是自己合成的二维螺旋数据,两类样本各500个,分布在两条旋转的螺旋臂上。之所以不用MNIST,原因针对性很强:这个项目的目标是“看清线性表示的效果”,而MNIST图片嵌入高维空间后,你没法在二维平面上直观观察特征变换。螺旋数据天然是线性不可分的,能够直接验证一个关键结论:纯线性模型无法完成这个分类任务,而加了非线性的模型可以。
生成螺旋数据的代码非常短,核心是根据角度生成半径和坐标,然后按类别交错分布。收集这两个类别的点集后,我会特意打乱顺序,按7:3划分训练集和测试集。这里有一个容易被忽视的细节:为了让实验结论可靠,必须固定随机种子。我在项目里固定了三个地方的随机种子:numpy生成数据的随机种子、PyTorch初始化模型参数的种子、DataLoader打乱数据顺序的种子。不固定种子的话,每次跑出来的结果都不一样,尤其是发现最优超参之后就没办法稳定复现,这会浪费大量调参时间。
3.2 模型设计:一个对比实验至少要控制住六个变量
前面说我要做纯线性和线性+非线性两个模型的对比,但对比实验不是随便跑两个代码就完事的。要得出可靠结论,至少要把下面几个变量控住:
第一,输入数据完全相同,包括同样的划分、同样的批量大小。第二,模型体量尽量一致,比如纯线性模型是三层的 Linear 层,另一个模型就是同样的三层 Linear 层,只是中间插入 ReLU。第三,优化器和学习率相同。第四,初始化方式相同,我都采用 PyTorch 默认的 Kaiming 初始化。第五,训练轮数相同。第六,评估指标口径相同,同一份测试集。
可能有人会问:“为什么不让两个模型的参数量完全相同?”这是个好问题,但在本项目里,真正要比的是“相同容量的线性堆叠”和“相同容量但带非线性的堆叠”,所以层数和宽度保持一致是最直观的做法。实际结果里,纯线性模型即使增加宽度到很大,测试集上的准确率也上不去,而带ReLU的小模型很快就能占领优势,这就是表达能力的差异,而不单单是模型大小的问题。
3.3 训练配置与技巧:学习率、损失函数和过拟合小技巧
训练配置看起来是个老生常谈的话题,但真正写起来还是有几个值得注意的点。本项目用的是交叉熵损失,优化器选择Adam,初始学习率 0.01。对于这种小规模合成数据,0.01的Adam表现很稳定,基本上50个epoch以内就能看到损失显著下降。
我特别想说一个初学者少用的技巧:先跑过拟合。在正式训练之前,我会先在一小批数据(比如64个样本)上训练,看模型能不能把损失降到非常低。如果连这一小批都过拟合不了,说明模型结构、数据输入、损失函数这三个环节里一定有bug。这个技巧可以帮你把“代码逻辑问题”和“模型能力问题”分开。等小批量过拟合跑通后,再放大到全量数据训练,整个调试过程会顺畅很多。
还有个细节是关于数据归一化的。虽然二维螺旋数据的数值范围不大,但为了让线性层的初始化表现更稳定,我仍然对特征做了标准化处理:每一维减去均值、除以标准差。这个操作会直接影响模型的收敛速度和最终精度。很多初学者会忽略标准化,结果发现模型一开始loss下降极慢,还以为是学习率太小。
3.4 可视化:如何把“特征空间发生了变换”变成人能看懂的东西
这个项目最有意思的部分是可视化。我采用两层可视化方案。第一层,画出决策边界:把整个二维平面密集地取样,比如网格点 200x200,每个点都输入模型,得到预测类别,然后在背景上画出填充色块。这样能直接看出纯线性模型的决策边界就是一条直线(或者多条直线拼出来的折线),而带ReLU的模型能画出弯曲的、紧密贴合螺旋结构的边界。
第二层,画出中间特征分布。我修改模型,在第二层的输出位置加了一个“钩子”(hook),把中间特征保存下来。因为是4维特征,不能直接画图,所以我在测试阶段把这个4维特征做了PCA降到2维,再画散点图。你能清楚看到,经过第一层线性变换后,两类点仍然纠缠在一起;而经过激活函数再变换后,两类点被拉开到两个方向。特征空间中的“拉开”,本质上就是“线性表示 + 非线性激活 + 又一次线性变换”共同作用的结果。
这几张图一出来,整个项目几乎不需要更多文字解释。这也是我推荐这个项目的原因:它能让抽象的“表示学习”变得肉眼可见。
4. 实操过程与核心环节实现
4.1 环境准备:用PyTorch搭一个最小可复现的框架
先交代一下环境,我是在一台没有GPU的普通笔记本上跑的,PyTorch CPU版就够用,因为数据量非常小。环境清单如下:Python 3.10,PyTorch 2.x,NumPy,Matplotlib。装好之后,我用下面的命令验证了一下安装:
bash复制python -c "import torch; print(torch.__version__)"
整个项目目录结构我控制在三个文件夹加两个脚本:data.py负责数据生成与划分,models.py放两个对比模型,train.py负责训练和画图,checkpoints目录存放模型权重,figures目录存放可视化结果。很多入门项目的问题就是所有代码堆在一个几百行的文件里,改一个实验要到处找,后期写论文或者复盘时很难维护。早期就养成模块化的习惯,后面做复杂项目会省很多事。
4.2 数据生成:核心代码与参数设计
螺旋数据的生成代码是这个项目的入口,先贴出来。
python复制import numpy as np
import torch
from torch.utils.data import TensorDataset, DataLoader, random_split
def generate_spiral(n_samples=500, noise=0.2):
n_per_class = n_samples // 2
theta = np.linspace(0, 4 * np.pi, n_per_class)
radius = np.linspace(0.5, 2.0, n_per_class)
x1 = radius * np.sin(theta) + noise * np.random.randn(n_per_class)
y1 = radius * np.cos(theta) + noise * np.random.randn(n_per_class)
theta2 = np.linspace(0, 4 * np.pi, n_per_class) + np.pi
x2 = radius * np.sin(theta2) + noise * np.random.randn(n_per_class)
y2 = radius * np.cos(theta2) + noise * np.random.randn(n_per_class)
x = np.concatenate([x1, x2])
y = np.concatenate([y1, y2])
labels = np.concatenate([np.zeros(n_per_class), np.ones(n_per_class)])
return x.reshape(-1, 2), y.reshape(-1, 2), labels
设计参数时有两个点值得说明。第一,角度范围选的是 0 到 4π,也就是两圈螺旋。圈数太少,两类点会离得太开,线性模型也能赢,看不出差异;圈数太多,噪声不加大也会让模型难学,干扰我们演示“非线性表达力”这个重点。两圈配 0.2 的噪声,刚好让纯线性模型在测试集上准确率低于70%,而带激活函数的模型能做到95%以上,差距明显又不至于学不动。
第二,噪声的选择我试过0.05和0.5。0.05时数据太干净,线性模型甚至也能靠一条折线勉强分开;0.5时数据重叠太多,带激活的模型也上不了80%,影响教学效果。最终0.2是最佳平衡点。这种参数调整看起来不起眼,但直接决定了实验对比是否“有说服力”。
生成数据后,我把它们封装成TensorDataset,并划分训练集和测试集。样本数1000,在深度学习里算是袖珍数据集,但这就是我要的效果:在小数据上能清晰看到模型容量的作用,而不被大数据训练的随机性干扰。
4.3 模型实现:线性堆叠对比线性+ReLU堆叠
项目里定义了三个类,分别是单层线性模型(用于基线对比)、三层纯线性模型和三层带ReLU模型。实际训练我只用后两个做对比,单层模型留着直观展示“一条直线就只能把平面切一份”。
简单贴一下两个核心模型的结构:
python复制import torch.nn as nn
class PureLinearNet(nn.Module):
def __init__(self, in_dim=2, hidden_dim=4, out_dim=2):
super().__init__()
self.net = nn.Sequential(
nn.Linear(in_dim, hidden_dim),
nn.Linear(hidden_dim, hidden_dim),
nn.Linear(hidden_dim, out_dim)
)
def forward(self, x):
return self.net(x)
class LinearWithReLU(nn.Module):
def __init__(self, in_dim=2, hidden_dim=4, out_dim=2):
super().__init__()
self.net = nn.Sequential(
nn.Linear(in_dim, hidden_dim),
nn.ReLU(),
nn.Linear(hidden_dim, hidden_dim),
nn.ReLU(),
nn.Linear(hidden_dim, out_dim)
)
def forward(self, x):
return self.net(x)
注意,PureLinearNet里连续三层Linear,数学上等价于一层Linear,但参数量和计算图结构与带ReLU的模型几乎一致,这样对比起来公平。我在代码里特意不写激活,就是为了让读者亲眼看到这个等价性会在训练结果中如何体现。
在权重初始化方面,PyTorch的nn.Linear默认会对权重做Kaiming均匀初始化,偏差初始化为0附近的一个小值。这个默认配置在这种小项目里足够稳定,我没有额外修改。如果你遇到训练不收敛,再考虑把权重初始化换成范围更小的分布,比如 init.xavier_normal_。
4.4 训练主循环与钩子函数:把中间特征抓出来
训练主循环的代码很常规,我直接用交叉熵损失和Adam优化器,训练200轮。每轮结束在测试集上算一次准确率。我加上了一个“特征钩子”来抓取中间层输出,方便后面可视化。
python复制def train_model(model, train_loader, test_loader, epochs=200, lr=0.01):
optimizer = torch.optim.Adam(model.parameters(), lr=lr)
criterion = nn.CrossEntropyLoss()
history = {"train_loss": [], "test_acc": []}
for epoch in range(epochs):
model.train()
total_loss = 0.0
for xb, yb in train_loader:
optimizer.zero_grad()
out = model(xb)
loss = criterion(out, yb)
loss.backward()
optimizer.step()
total_loss += loss.item() * xb.size(0)
avg_loss = total_loss / len(train_loader.dataset)
history["train_loss"].append(avg_loss)
model.eval()
correct = 0
with torch.no_grad():
for xb, yb in test_loader:
out = model(xb)
pred = out.argmax(dim=1)
correct += (pred == yb).sum().item()
acc = correct / len(test_loader.dataset)
history["test_acc"].append(acc)
return history
钩子函数的用法是在register_forward_hook时传入一个函数,等模型前向传播经过该层时自动触发,把该层的输出保存下来。要注意钩子函数里保存的 tensor 仍属于计算图的一部分,如果后面要做numpy操作或画图,记得先 .detach().cpu().numpy()。这是我最初经常漏掉的一步,不改的话会在反序列化和可视化阶段遇到各种诡异的报错。
4.5 可视化输出:决策边界和特征散点图
画决策边界的思路很简单,就是创建一个密集网格,然后把网格点批量喂给模型。网格范围取数据坐标的最小值和最大值各扩展0.2,然后生成一个 (200, 200) 的网格,变成 (40000, 2) 的输入张量。模型预测后把类别标签重新reshape成 (200, 200),用matplotlib的 pcolormesh 画成背景色块,再叠加原始数据点。
特征散点图需要修改前向逻辑。我打算直接在训练好的模型上,把 want_features 参数设为True,返回中间层特征。这样我们一次能拿到三个图:模型结构图(可选)、决策边界图、中间特征分布图。我在实际做的过程中,最意外的发现是:带ReLU模型的中间特征空间里,两类点分别簇在一起,并且线性边界已经基本能分开;而纯线性模型的中间特征仍然是一团乱麻。这就是“线性表示 + 非线性”共同作用的效果——线性部分把特征旋转拉伸到了合适的坐标方向,非线性部分则把不同类别的点进一步“推开”。
4.6 实验结果记录:一组可以抄作业的数字
下面是训练200轮后得到的典型结果。每次训练有随机性,但我固定随机种子后多次运行结果基本稳定:
| 模型 | 测试准确率 | 训练损失(最终) | 决策边界 |
|---|---|---|---|
| 单层线性 | 62.3% | 0.68 | 一条直线,无法分开螺旋 |
| 三层纯线性 | 63.1% | 0.67 | 仍是一条有效直线,略微扭曲,但无本质变化 |
| 三层带ReLU | 96.7% | 0.11 | 弯曲边界,紧贴螺旋结构 |
这三组数字本身就把结论讲完了:纯线性模型再怎么叠层,准确率稳定在62%~64%之间,和随机猜测(50%)相比只有微弱提升。带ReLU的模型则能逼近完美分类。如果你把hidden_dim从4改成64,纯线性模型的准确率也几乎不变,这再次证明了“表达能力上限”不由参数量决定,而由变换类型决定。
顺带说一句,训练时我打印了每一轮的loss,发现纯线性模型的前50轮loss下降非常慢,看起来好像模型可以学,只是学得慢,但到了100轮以后基本就进入平台期,再也下不去了。这个平台期值得各位留意:当你发现loss下降到某个值后无论怎么调学习率或者加训练轮数都不动,很可能不是优化器的问题,而是模型结构的表达能力到头了。
5. 常见问题与排查技巧实录
5.1 维度不匹配:八成新人会遇到的报错现场
训练时最常见的报错是矩阵乘法维度不匹配,英文通常长这样:“mat1 and mat2 shapes cannot be multiplied (…)”或者 “size mismatch”。遇到这类问题,我建议按三步排查。
第一步,确认输入数据的维度。打印 x.shape 和 y.shape。第二步,确认线性层的定义。比如你的输入图片是单通道28x28,展平后是784,那输入维度就得设784。如果用了卷积层,最后接全连接层之前必须手动把特征图 view(batch, -1) 展平。忘了展平是经典错误,你会看到类似 “mat1 shape (64, 28, 28)” 的报错,就说明原来三维的没展平成二维。第三步,确认全连接层的输出维度对得上标签数量。分类任务的最后一步通常是输出类别数,而不是输出特征的任意维度。
我在这个项目里把维度设计得简单,就是为了减少干扰。但事实上,即使这么简单,我还是踩过一个坑:生成数据时返回的是 (N,) 的一维数组,没有reshape成 (N,1),导致后续拼接特征时维度不一致。所以建议所有中途要concat、stack的tensor,先打印shape确认再往下写。
5.2 损失不下降:先怀疑线性层,别看模型结构
损失不下降是最让人头疼的问题。经验之谈:往下查之前,先做一个“过拟合小批量”测试。我从训练集里抽出64个样本,让模型在这个mini-batch上反复迭代50次,看loss能不能降到接近0。如果过拟合失败,说明数据管道或者模型定义有bug。如果成功,说明全量训练遇到的问题多半来自训练策略。
如果过拟合测试也通过了,但全量训练还是loss高居不下,我会检查几件事。
一是学习率。Adam在0.01左右是安全的,但如果你用了SGD,0.01对于这个小项目可能就偏大或偏小,需要来回调整两个量级。
二是输入是否标准化。螺旋数据的坐标范围大致在[-2, 2]之间,不标准化也能跑通,但一旦数据范围拉到[-100, 100]或者包含几个极端值,初始化的小权重作用在这样的大数值输入上,会让初始logits非常大,softmax梯度趋近于0,模型就“学不动”。这个项目里数据范围适中,标准化带来的提升不明显,但我仍然习惯性加上,因为后面迁移到真实数据时,标准化几乎是救命的。
三是检查损失函数是否加在了正确的维度上。如果输出形状是 (batch, 2) 而标签形状是 (batch),PyTorch的CrossEntropyLoss能正确匹配;但如果输出是 (batch, 1) 而你传入了多分类标签,就会报错或者算出一个完全错误的loss。很多人在二分类任务里习惯输出单维,然后配BCEWithLogitsLoss,这又是另一套逻辑。线性表示项目里最好让输出维度直接等于类别数,避免混淆。
5.3 特征分布崩塌:偏置、学习率和激活泄漏
本项目里还遇到一个很有意思的现象:在把隐藏特征拿出来做PCA可视化的过程中,我发现带ReLU模型的中间特征分布不是均匀铺满空间的,而是集中在一小片区域,几乎贴着一个线性子空间。因为ReLU在负数区间的输出是0,这会导致特征经过ReLU后大量神经元的输出为0,数据变成稀疏的。这是正常现象,甚至可以视为一种特征选择的机制。
但如果出现所有点几乎挤成一个点,那才是真正的问题。常见原因有三个:第一个,隐藏层宽度设为1,信息瓶颈太窄,所有样本都被压到一个维度上。第二个,初始化的权重过大或者学习率过大,导致网络输出进入ReLU的“死亡区”,大量神经元永久输出0,特征自然没法区分。第三个,偏置初始化为负的较大值时,也会加大神经元死亡的概率。PyTorch默认偏置初始化的范围不大,一般不会触发,但如果你手动改了初始化,就要小心了。
遇到这种崩塌,最直接的解决办法是把 hidden_dim 调大,同时把学习率降低一个量级,让网络有空间“展开”特征。这个小项目里 hidden_dim=4 时特征就已经能被拉开,如果你在做真实项目发现特征可视化时所有点堆在原点附近,先检查宽度和学习率,不要急着换复杂模型。
5.4 调参记录:一组直接可用的完整配置
为了让读者能直接复现,我整理一下最终实验里用的全部关键配置。
| 配置项 | 数值 | 说明 |
|---|---|---|
| 数据样本量 | 1000 | 每类500,噪声0.2 |
| 数据划分 | 训练700 / 测试300 | 固定随机种子42 |
| 批量大小 | 64 | 小批量即可 |
| 优化器 | Adam | 对新手友好,自适应学习率 |
| 学习率 | 0.01 | Adam下的稳妥起点 |
| 训练轮数 | 200 | 足够收敛且不易过拟合 |
| 隐藏层宽度 | 4 | 特征可视化不冗杂 |
| 损失函数 | CrossEntropyLoss | 多分类标配 |
| 激活函数 | ReLU | 简单有效,避免梯度消失 |
| 初始化 | PyTorch默认 | Kaiming均匀初始化 |
| 随机种子 | 42 | 全程固定,保证可复现 |
如果你跑出来准确率比我高或者低几个百分点,不用太惊讶,因为CPU上的操作顺序和浮点舍入会产生极小差异。但整体趋势一定是一致的:纯线性模型始终突破不了70%,带激活的模型至少90%以上。
5.5 一个容易被忽略的复现性细节:shuffle参数和随机种子
最后一个坑,我认为值得单独拿出来讲。即便你固定了模型初始化种子和数据生成种子,DataLoader里的 shuffle 参数如果不设置随机种子,每次打乱顺序时使用的随机流没有被固定,实验结果依然无法完全复现。PyTorch文档里的推荐做法是给DataLoader也传一个 generator,或者在设置全局随机种子时连同PyTorch的CPU和CUDA种子一起固定。
python复制import random
import numpy as np
import torch
def set_seed(seed=42):
random.seed(seed)
np.random.seed(seed)
torch.manual_seed(seed)
torch.cuda.manual_seed_all(seed)
这个小细节在机器学习实验中极其重要。尤其是你现在只是做个小项目,看不出影响,等到了做毕设或者写论文投稿需要对比多组结果时,不能复现的实验等于白做。
本来这种小技巧写起来不起眼,但它是我在实际项目中浪费过不少时间才总结出来的。希望看到这篇内容的你,不需要再踩一遍同样的坑。
6. 这个项目做完之后,我留下的一点体会
最后再说点超出代码本身的东西。做完这个线性表示小项目,我最大的感受是:深度学习入门最难的不是记住那些花哨的模型结构,而是建立对特征变换的直觉。线性表示是这种直觉的最底层,它不复杂,但极端重要。往后的卷积、注意力机制、图神经网络,本质上都在做类似的事情——把数据重新安排到一个更方便后续处理的空间里。
我个人真心建议,学深度学习的顺序可以先从这个最小实验开始,而不是一上来就抱着大模型的推理代码啃。因为前者能让你在十分钟内看到“变换前”和“变换后”的分布差异,而后者只会让你在几百层网络里迷失。等你想通了一个线性层的变化过程,再去看那些复杂结构时,会自然地问出“这个模块做了什么样的线性表示和什么样的非线性变换”,而一旦能带着这个问题去读论文,基本就入门了。
