快速开始
环境要求:Python ≥ 3.12 和 uv。GPU 机器可以是 Linux 裸机或 WSL2。
-
克隆并安装
Terminal window git clone https://github.com/EricYuan2007/GPUPlane && cd GPUPlaneuv sync # 安装全部组件(server / agent / cli / sdk) -
启动 server(在 GPU 机器上)
Terminal window uv run gpuctl-server首次启动自动生成 admin token 并写入
~/.gpuctl/server.yaml。 想从局域网访问 Web UI,把server.yaml里的host改为0.0.0.0。 -
启动 agent(同机)
Terminal window # 把 server.yaml 里的 token 复制到 ~/.gpuctl/agent.yamluv run gpuctl-agent -
提交第一个训练任务(先用 cpu_only 示例跑通,再上 GPU)
Terminal window uv run gpuctl job submit -n mnist -g 1 \-d "$PWD/examples/mnist" --watch checkpoints \-- python train.py --epochs 3 -
观测训练
Terminal window uv run gpuctl status # 节点/队列总览uv run gpuctl job list # 任务状态uv run gpuctl logs -f <job-id> # 实时日志uv run gpuctl run show <run-id> # 指标摘要(latest/best/trend) -
打开 Web UI
server 自动托管 Web UI(也可用
GPUCTL_WEB_DIST指定构建产物):http://<gpu-host>:8600 # 输入 server.yaml 中的 token 登录七个页面各自能做什么,见 Web 控制台。
导入历史实验
Section titled “导入历史实验”把已有实验(TensorBoard events + checkpoints)导入为 IMPORTED run:
uv run gpuctl import-run ~/experiments/old-run --project legacy接入 Agent(可选但推荐)
Section titled “接入 Agent(可选但推荐)”让 Claude Code 等 MCP 客户端直接用自然语言驱动实验循环,见 实验循环与 Agent 接入。
离线/受限网络
Section titled “离线/受限网络”GPU 机器无法访问公网时,可以在能上网的机器上预下载全部 wheel(约 50 个小包, torch 不属于平台依赖),离线安装。完整流程见 部署与运维。
- 核心概念:Job / Run / Checkpoint 的关系
- 指标与 Primary Metric:让训练脚本产出可诊断的指标
- 事件与诊断:OOM/NaN 自动判定与手机推送