跳转到内容

快速开始

环境要求:Python ≥ 3.12uv。GPU 机器可以是 Linux 裸机或 WSL2。

  1. 克隆并安装

    Terminal window
    git clone https://github.com/EricYuan2007/GPUPlane && cd GPUPlane
    uv sync # 安装全部组件(server / agent / cli / sdk)
  2. 启动 server(在 GPU 机器上)

    Terminal window
    uv run gpuctl-server

    首次启动自动生成 admin token 并写入 ~/.gpuctl/server.yaml。 想从局域网访问 Web UI,把 server.yaml 里的 host 改为 0.0.0.0

  3. 启动 agent(同机)

    Terminal window
    # 把 server.yaml 里的 token 复制到 ~/.gpuctl/agent.yaml
    uv run gpuctl-agent
  4. 提交第一个训练任务(先用 cpu_only 示例跑通,再上 GPU)

    Terminal window
    uv run gpuctl job submit -n mnist -g 1 \
    -d "$PWD/examples/mnist" --watch checkpoints \
    -- python train.py --epochs 3
  5. 观测训练

    Terminal window
    uv run gpuctl status # 节点/队列总览
    uv run gpuctl job list # 任务状态
    uv run gpuctl logs -f <job-id> # 实时日志
    uv run gpuctl run show <run-id> # 指标摘要(latest/best/trend)
  6. 打开 Web UI

    server 自动托管 Web UI(也可用 GPUCTL_WEB_DIST 指定构建产物):

    http://<gpu-host>:8600 # 输入 server.yaml 中的 token 登录

    七个页面各自能做什么,见 Web 控制台

把已有实验(TensorBoard events + checkpoints)导入为 IMPORTED run:

Terminal window
uv run gpuctl import-run ~/experiments/old-run --project legacy

让 Claude Code 等 MCP 客户端直接用自然语言驱动实验循环,见 实验循环与 Agent 接入

GPU 机器无法访问公网时,可以在能上网的机器上预下载全部 wheel(约 50 个小包, torch 不属于平台依赖),离线安装。完整流程见 部署与运维