跳转到内容

GPUPlane

个人 GPU 训练的控制面:任务排队与调度、实时指标/日志、checkpoint 登记、事件诊断 —— 为 Agent(MCP)与浏览器而生,不再依赖 SSH + tmux + 肉眼盯 loss。

训练代码零侵入

python train.py 永远是独立可跑的。GPUPlane 只做进程托管与观测,SDK 完全可选且永不向训练进程抛异常。

裸进程 + SQLite

无 Kafka/Redis/Postgres,WAL 模式单文件存储,一条命令在线备份。低 infra 就是产品价值本身。

三级指标接入

TensorBoard 目录实时 tail(零改动)、SDK 直报、NVML 系统指标,三级互补,训练脚本按需接入。

评估 → 推荐闭环

EVALUATE 任务回挂 checkpoint,get_best_checkpoint 按 primary metric 给出推荐,告别肉眼挑模型。

Agent-native(MCP)

21 个 MCP 工具 + 3 个 Claude Skill,Agent 用自然语言完成「提交 → 监控 → 对比 → 推荐」全循环。

事件诊断与推送

OOM / LOSS_NAN / 过拟合自动判定,附 next_actions 引导;webhook 可推送到手机。

Claude Code × GPUPlane
claude -p "提交一个 mnist 训练,跑完告诉我结果,再对比最近两次 run 给我最好的 checkpoint"

Agent 实际执行的链路(全部由 GPUPlane 的 MCP 工具承载):

submit_job ──► get_run_summary / diagnose_run ──► compare_runs ──► get_best_checkpoint
排队训练 指标 / 事件 / 异常诊断 多 run 对比 评估结果挑最优

Train normally. Observe structurally. Control remotely. Reason with agents.

GPUPlane 不是 W&B/MLflow 那样的实验追踪平台,也不是 Docker/K8s 编排器。 它是一个控制面:调度训练任务、用训练语义(run / checkpoint / evaluation)观测它们, 并把这一切暴露给 Agent —— 让 AI 助手替你盯训练、诊断异常、挑选最优 checkpoint。