Two industry-standard measures, plus latency, across every model in the benchmark. Numbers come from the full evaluation set (1749 Shona clips from Waxal Shona).
How does model size relate to WER?
Percentage of words the model got wrong. Lower is better.
| Model | WER | N | Errors |
|---|---|---|---|
| facebook/omniASR-LLM-7BOpen | 40.1% | 1749 | 0 |
| aadel4/omniASR-CTC-1B-v2Open | 42.5% | 1749 | 0 |
| facebook/omniASR-LLM-1BOpen | 43.4% | 1749 | 0 |
| facebook/omniASR-CTC-7BOpen | 43.5% | 1749 | 0 |
| facebook/omniASR-CTC-3BOpen | 44.7% | 1749 | 0 |
| facebook/omniASR-CTC-1BOpen | 45.7% | 1749 | 0 |
| facebook/omniASR-LLM-3BOpen | 46.2% | 1749 | 0 |
| facebook/omniASR-LLM-300MOpen | 46.7% | 1749 | 0 |
| aadel4/omniASR-CTC-300M-v2Open | 50.1% | 1749 | 0 |
| facebook/omniASR-CTC-300MOpen | 57.7% | 1749 | 0 |
| openai/whisper-large-v3Open | 114.6% | 1749 | 0 |
| openai/whisper-smallOpen | 156.7% | 1749 | 0 |
| Average across models | 61.0% |
Percentage of individual characters wrong. Lower is better.
| Model | CER | N | Errors |
|---|---|---|---|
| facebook/omniASR-LLM-7BOpen | 8.9% | 1749 | 0 |
| aadel4/omniASR-CTC-1B-v2Open | 9.2% | 1749 | 0 |
| facebook/omniASR-CTC-7BOpen | 9.6% | 1749 | 0 |
| facebook/omniASR-CTC-3BOpen | 9.8% | 1749 | 0 |
| facebook/omniASR-LLM-1BOpen | 9.9% | 1749 | 0 |
| facebook/omniASR-CTC-1BOpen | 10.0% | 1749 | 0 |
| facebook/omniASR-LLM-3BOpen | 10.7% | 1749 | 0 |
| aadel4/omniASR-CTC-300M-v2Open | 10.8% | 1749 | 0 |
| facebook/omniASR-LLM-300MOpen | 10.9% | 1749 | 0 |
| facebook/omniASR-CTC-300MOpen | 12.4% | 1749 | 0 |
| openai/whisper-large-v3Open | 34.8% | 1749 | 0 |
| openai/whisper-smallOpen | 65.1% | 1749 | 0 |
| Average across models | 16.8% |
Average time it takes per sample.
| Model | Avg latency (per sample) |
|---|---|
| facebook/omniASR-CTC-300MOpen | 0.02s |
| aadel4/omniASR-CTC-300M-v2Open | 0.03s |
| facebook/omniASR-CTC-1BOpen | 0.04s |
| facebook/omniASR-CTC-3BOpen | 0.08s |
| aadel4/omniASR-CTC-1B-v2Open | 0.09s |
| facebook/omniASR-CTC-7BOpen | 0.15s |
| openai/whisper-smallOpen | 0.30s |
| openai/whisper-large-v3Open | 0.41s |
| facebook/omniASR-LLM-300MOpen | 1.01s |
| facebook/omniASR-LLM-1BOpen | 1.03s |
| facebook/omniASR-LLM-3BOpen | 1.08s |
| facebook/omniASR-LLM-7BOpen | 1.13s |
WER (Word Error Rate): out of every 100 spoken words, how many did the model get wrong?
CER (Character Error Rate): same idea but at the character level.
Lower is always better. 0% would mean a perfect transcription.