A model that doesn't fit doesn't run slowly, it doesn't run. Here's every card from our bench, sorted by measured speed.
Weights: openai/whisper-large-v3
| GPU | Speed | VRAM | Basis |
|---|---|---|---|
| NVIDIA L40S | 193.2 x realtime | 48GB | ✓ Measured |
| NVIDIA H100 80GB HBM3 | 181.47 x realtime | 80GB | ✓ Measured |
| NVIDIA H200 | 163.78 x realtime | 141GB | ✓ Measured |
| NVIDIA A100 40GB SXM4 | 102.47 x realtime | 40GB | Est. |
| NVIDIA A10G | 86.07 x realtime | 24GB | ✓ Measured |
| NVIDIA A100 80GB SXM4 | 73.83 x realtime | 80GB | ✓ Measured |
| NVIDIA L4 | 70.11 x realtime | 24GB | ✓ Measured |
| NVIDIA T4 | 44.36 x realtime | 16GB | ✓ Measured |
NVIDIA L40S is the fastest card we've measured running Whisper large-v3, at 193.2 x realtime.
NVIDIA T4 ($2,299 MSRP) is the cheapest card on our bench that runs Whisper large-v3, at 44.36 x realtime.