训练代码零侵入
python train.py 永远是独立可跑的。GPUPlane 只做进程托管与观测,SDK 完全可选且永不向训练进程抛异常。
训练代码零侵入
python train.py 永远是独立可跑的。GPUPlane 只做进程托管与观测,SDK 完全可选且永不向训练进程抛异常。
裸进程 + SQLite
无 Kafka/Redis/Postgres,WAL 模式单文件存储,一条命令在线备份。低 infra 就是产品价值本身。
三级指标接入
TensorBoard 目录实时 tail(零改动)、SDK 直报、NVML 系统指标,三级互补,训练脚本按需接入。
评估 → 推荐闭环
EVALUATE 任务回挂 checkpoint,get_best_checkpoint 按 primary metric 给出推荐,告别肉眼挑模型。
Agent-native(MCP)
21 个 MCP 工具 + 3 个 Claude Skill,Agent 用自然语言完成「提交 → 监控 → 对比 → 推荐」全循环。
事件诊断与推送
OOM / LOSS_NAN / 过拟合自动判定,附 next_actions 引导;webhook 可推送到手机。
claude -p "提交一个 mnist 训练,跑完告诉我结果,再对比最近两次 run 给我最好的 checkpoint"Agent 实际执行的链路(全部由 GPUPlane 的 MCP 工具承载):
submit_job ──► get_run_summary / diagnose_run ──► compare_runs ──► get_best_checkpoint 排队训练 指标 / 事件 / 异常诊断 多 run 对比 评估结果挑最优Train normally. Observe structurally. Control remotely. Reason with agents.
GPUPlane 不是 W&B/MLflow 那样的实验追踪平台,也不是 Docker/K8s 编排器。 它是一个控制面:调度训练任务、用训练语义(run / checkpoint / evaluation)观测它们, 并把这一切暴露给 Agent —— 让 AI 助手替你盯训练、诊断异常、挑选最优 checkpoint。