停止与销毁
这是本产品中最重要的一个区分,也是最常引出意外账单的一个。请认真读一遍。
简短版
| 停止 | 销毁 | |
|---|---|---|
| 容器 | 关闭 | 移除 |
| 你的磁盘及其内容 | 保留 | 永久删除 |
| GPU 槽位 | 为你占着 | 释放回市场 |
| GPU 费用 | 停止 | 停止 |
| 存储费用 | 继续 | 停止 |
| 能否恢复? | 能,原地恢复 | 不能 |
停止是一种仍然要花钱的暂停。销毁是不可逆的,之后不再产生任何费用。
为什么停止仍然向你计费
当你停止实例时,你的磁盘还留在那台物理机器上,而那台机器无法把这块空间让给别人。只要实例还以停止状态存在,你就要按存储费率——按 GB 每小时报价——为这份预留付钱。
GPU 本身不再计费;你付的钱只用来保住你的数据和你对那块切片的占用。这里没有需要排队占位的队列——在你销毁实例之前,报价会一直以你的名义标记为 rented。
这意味着一块你忘掉的大磁盘就是一处缓慢、安静的漏损。一个 500 GB 的卷停在那里一个月,即使什么都没跑,也会实实在在地花掉钱。
已停止的实例不是免费的实例
如果活儿已经干完了,就销毁它。停止是给“我下午还回来”用的,不是给“我做完了”用的。
为什么 GPU 槽位很重要
停止会保住你在那台特定机器上的槽位。当你再次启动时,你会回到同样的硬件、同样的磁盘上——不用重新下载、不用重新配置,也不用担心你不在的时候报价被别人从你手里租走。
销毁会立刻释放槽位。报价回到市场,几秒钟内就可能被别人拿走。没有任何办法把它要回来。
你该用哪一个?
以下条件全部成立时,选择 停止:
- 你会在几小时或一两天内回来。
- 磁盘上有你不愿重建的状态——一个数据集、一个 conda 环境、一批检查点。
- 磁盘足够小,存储费用比重建它所花的时间更便宜。
以下任一条件成立时,选择 销毁:
- 活儿已经干完了。
- 有价值的东西都已经推到了别处——对象存储、git 远程仓库、模型仓库。
- 磁盘很大,重新下载比把它停在那里更便宜。
销毁之前
销毁会删除磁盘。没有快照,没有回收站,也没有撤销。请先把你在意的东西从实例上拷出来:
# from your own machine — port, user and host are the ones in the
# connect command on the instance's Connect tab
scp -P <port> -r <user>@<host>:/workspace/checkpoints ./checkpoints
或者把它推到它该去的地方——S3、Hugging Face 仓库、git 远程仓库。
系统会自己做什么
有两个自动动作应用了同样的区分,以免被遗忘的实例把账户榨到一分不剩:
- 当你的余额到达 零 时,运行中的实例会被 停止。你的数据还在;存储费用会继续从本已见底的余额里扣。
- 如果余额继续下跌并到达 −$5,实例会被 销毁。到那一步数据就没了。
请在第二道阈值之前充值。参见 计费原理。