GPU 0 GPU 1 GPU 2 ··· GPU 255 Parallel filesystem200 GB shared dataset I/O contention → node timeouts → cascade crash256 concurrent readers hammering random-access reads Job crashed within minutes — not OOM, but filesystem overload