快速结论与 Colab 算力硬件规格
Google Colab(全称 Colaboratory)是 Google 专为机器学习、数据科学与教育培训提供的全托管免配置云端 Jupyter Notebook 交互式实验环境。
核心算力硬件配置说明:
| 硬件加速类型 | 显存与核心规格 | 适用任务场景 | 成本方案 |
|---|---|---|---|
| 标准 CPU | 2 vCPU, 13 GB 系统 RAM | 数据清洗、Pandas 分析、基础 Python 脚本运行 | 完全免费 |
| NVIDIA T4 GPU | 16 GB 高速 GDDR6 显存 | PyTorch/TensorFlow 模型训练、开源 7B 大模型推理 | 免费提供(动态资源分配) |
| A100 / L4 GPU | 40GB / 80GB 高带宽显存 | 百亿参数级大模型微调 (LoRA / SFT)、长序列扩散模型生图 | Colab Pro / 算力点数付费 |
开启 GPU 硬件加速与环境配置
在新建的 Notebook 中,默认分配的是纯 CPU 运行时。
切换至 GPU 加速步骤
- 打开 Google Colab 官网。
- 点击顶部菜单栏 “代码执行程序”(Runtime)→ “更改运行时类型”(Change runtime type)。
- 在“硬件加速器”下拉列表中选择 “T4 GPU”。
- 点击保存。在代码单元格中输入
!nvidia-smi并运行,即可打印当前分配的 NVIDIA GPU 显卡型号与 16GB 显存状态。
挂载 Google Drive 云盘持久化读写数据
在云端训练模型时,由于免费实例在关闭网页数小时后会自动释放临时磁盘,将数据集和训练好的模型权重保存至个人 Google Drive 云端硬盘 是标准操作。
在 Notebook 代码单元格中输入以下代码并运行:
from google.colab import drive
import os
# 一键挂载 Google 云端硬盘
drive.mount('/content/drive')
# 设置工作目录为个人云盘中的专用项目文件夹
project_path = '/content/drive/MyDrive/MyProject'
os.makedirs(project_path, exist_ok=True)
os.chdir(project_path)
print(f"当前工作目录已安全切换至: {os.getcwd()}")
运行后点击弹出的授权许可,即可像访问本地硬盘一样无缝读写云盘中的 .csv 数据集与 PyTorch .pt 权重文件。
命令行与 Linux 包管理实战
在 Colab 单元格中,以感叹号 ! 开头的指令会直接发送给底层的 Linux Ubuntu 容器执行:
- 安装 Python 第三方库:
!pip install -q transformers accelerate datasets - 下载网络大文件:
!wget https://example.com/dataset.zip && unzip dataset.zip - 查看系统内存与磁盘:
!df -h与!free -m - 克隆 GitHub 仓库:
!git clone https://github.com/openai/whisper.git
常见错误与避坑指南
- 长时间非活动导致断连: Colab 免费版若检测到浏览器标签页闲置 90 分钟,会自动断开实例释放显存。建议定期在代码中加入
torch.save()定时保存 Checkpoint 检查点。 - 详细说明请参阅我们的 Google Cloud 入门指南。
交互式表单与可视化组件 (Colab Forms)
Colab 原生支持通过简单的注释语法在 Notebook 中创建交互式 UI 表单:
- 创建滑块与输入框: 输入
#@param {type:"slider", min:1, max:100, step:1}即可生成原生图形滑动条。 - 与全生态联动: 结合 Google Drive 云盘 保存数据,结合 Google AI Studio 调用云端 API。
PyTorch CUDA 张量计算与模型推理示例
验证 GPU 加速是否真正生效:
import torch
# 检查 CUDA 是否可用
device = "cuda" if torch.cuda.is_available() else "cpu"
print(f"当前计算后端: {device}, 显卡型号: {torch.cuda.get_device_name(0)}")
# 创建大型随机矩阵并在 GPU 上进行张量乘法运算
x = torch.randn(5000, 5000, device=device)
y = torch.randn(5000, 5000, device=device)
z = torch.matmul(x, y)
print(f"张量乘法计算完成,矩阵尺寸: {z.shape}")
常见问题解答 (FAQ)
Q1:Colab 运行时断开连接导致训练中断怎么办?
免费版 Colab 单次持续运行上限通常为 12 小时,如果浏览器标签页处于非活动状态超过 90 分钟可能会被系统回收。建议在代码中加入 checkpoint 定期自动保存机制。
Q2:如何在 Colab 中使用终端命令行与安装额外库?
在代码单元格开头加上感叹号 ! 即可直接执行 Linux 命令,例如 !pip install transformers 或 !nvidia-smi。
Q3:Colab 可以直接调用 Google Gemini API 吗?
完全支持。在 Colab 左侧钥匙图标中添加 GEMINI_API_KEY 密钥,即可配合 google-generativeai 库进行多模态模型批量推理。
Q4:Colab Pro 相比免费版有哪些升级?
Colab Pro(约 $9.99/月)提供优先分配的高端 A100/V100/L4 GPU、更高的系统内存(最高 53GB RAM)以及长达 24 小时的后台持续计算时间。
Q5:如何将编写好的 Colab Notebook 导出分享?
点击顶部菜单 文件 → 保存副本在 GitHub 中 或 下载 .ipynb,也可生成带只读权限的云端分享链接发送给协作者。