Whisper Base es

This model is a fine-tuned version of openai/whisper-base on the Common Voice 17.0 dataset. It achieves the following results on the evaluation set:

  • Loss: 0.2225
  • Wer Raw: 12.4062
  • Cer Raw: 4.8335
  • Wer: 12.4062
  • Cer: 4.8335

Model description

More information needed

Intended uses & limitations

More information needed

Training and evaluation data

More information needed

Training procedure

Training hyperparameters

The following hyperparameters were used during training:

  • learning_rate: 1e-05
  • train_batch_size: 64
  • eval_batch_size: 64
  • seed: 42
  • optimizer: Use adamw_torch with betas=(0.9,0.999) and epsilon=1e-08 and optimizer_args=No additional optimizer arguments
  • lr_scheduler_type: linear
  • lr_scheduler_warmup_steps: 0.04
  • training_steps: 46000

Training results

Training Loss Epoch Step Validation Loss Wer Raw Cer Raw Wer Cer
0.2105 0.0217 1000 0.4291 21.0947 7.3489 21.0123 7.3330
0.2114 0.0435 2000 0.3882 20.2421 7.6348 20.1920 7.6252
0.1814 0.0652 3000 0.3561 17.8716 6.2992 17.8494 6.2949
0.1671 0.0870 4000 0.3379 17.5020 6.2904 17.4811 6.2869
0.1378 0.1087 5000 0.3265 17.1660 6.2993 17.1565 6.2975
0.1211 0.1304 6000 0.3199 17.3816 6.5366 17.3708 6.5346
0.1371 0.1522 7000 0.3200 16.8078 6.1243 16.8034 6.1235
0.1474 0.1739 8000 0.2990 15.9723 6.0495 15.9704 6.0491
0.1405 0.1957 9000 0.2938 15.5342 5.6053 15.5342 5.6053
0.2387 0.2174 10000 0.3001 15.7516 5.7251 15.7504 5.7248
0.1441 0.2391 11000 0.2876 14.7728 5.3077 14.7722 5.3076
0.1232 0.2609 12000 0.2803 14.7005 5.2640 14.7005 5.2640
0.2715 0.2826 13000 0.2770 14.7481 5.3805 14.7468 5.3803
0.2600 0.3043 14000 0.2833 15.4372 5.8523 15.4366 5.8522
0.1616 0.3261 15000 0.2715 14.2402 5.0899 14.2396 5.0898
0.2634 0.3478 16000 0.2715 14.1122 5.0557 14.1109 5.0555
0.2724 0.3696 17000 0.2643 14.2193 5.2369 14.2187 5.2368
0.1641 0.3913 18000 0.2551 13.6678 5.0883 13.6678 5.0883
0.1795 0.4130 19000 0.2547 14.0418 5.3390 14.0418 5.3390
0.2134 0.4348 20000 0.2497 13.8301 5.3565 13.8301 5.3565
0.2445 0.4565 21000 0.2481 13.7248 5.1595 13.7248 5.1595
0.3013 0.4783 22000 0.2461 13.4941 4.9600 13.4941 4.9600
0.2151 0.5 23000 0.2433 13.1035 4.8197 13.1035 4.8197
0.1280 1.0040 24000 0.2368 13.4332 5.1921 13.4332 5.1921
0.0863 1.0257 25000 0.2337 12.6167 4.7145 12.6167 4.7145
0.0799 1.0474 26000 0.2339 12.8316 4.8257 12.8316 4.8257
0.1029 1.0692 27000 0.2329 12.6167 4.5999 12.6167 4.5999
0.0867 1.0909 28000 0.2330 12.7244 4.7077 12.7244 4.7077
0.0840 1.1127 29000 0.2310 12.5786 4.6454 12.5786 4.6454
0.1024 1.1344 30000 0.2316 12.3517 4.6403 12.3517 4.6403
0.0929 1.1561 31000 0.2297 12.5044 4.7394 12.5044 4.7394
0.1030 1.1779 32000 0.2283 12.3574 4.6086 12.3574 4.6086
0.1092 1.1996 33000 0.2310 12.3542 4.6186 12.3542 4.6186
0.0939 1.2213 34000 0.2308 12.6959 4.8683 12.6959 4.8683
0.0722 1.2431 35000 0.2283 12.4309 4.7734 12.4309 4.7734
0.0916 1.2648 36000 0.2283 12.3269 4.6052 12.3269 4.6052
0.1084 1.2866 37000 0.2291 12.6610 4.8985 12.6610 4.8985
0.1796 1.3083 38000 0.2300 12.3288 4.5390 12.3288 4.5390
0.1343 1.3300 39000 0.2262 12.3853 4.6860 12.3853 4.6860
0.1363 1.3518 40000 0.2268 12.0664 4.4976 12.0664 4.4976
0.1393 1.3735 41000 0.2237 12.2699 4.7344 12.2699 4.7344
0.1617 1.3953 42000 0.2231 12.4189 4.7940 12.4189 4.7940
0.2268 1.417 43000 0.2240 12.0207 4.4868 12.0207 4.4868
0.3400 1.4387 44000 0.2238 12.2071 4.5810 12.2071 4.5810
0.1902 1.4605 45000 0.2238 12.0809 4.5142 12.0809 4.5142
0.2122 1.4822 46000 0.2225 12.4062 4.8335 12.4062 4.8335

Framework versions

  • Transformers 5.14.1
  • Pytorch 2.6.0+cu124
  • Datasets 5.0.1
  • Tokenizers 0.22.2

Citation

Please cite the model using the following BibTeX entry:

@misc{deepdml/whisper-base-es-mix-norm,
      title={Fine-tuned Whisper base ASR model for speech recognition in Spanish},
      author={Jimenez, David},
      howpublished={\url{https://huggingface.co/deepdml/whisper-base-es-mix-norm}},
      year={2026}
    }
Downloads last month
240
Safetensors
Model size
72.6M params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for deepdml/whisper-base-es-mix-norm

Finetuned
(751)
this model

Datasets used to train deepdml/whisper-base-es-mix-norm

Evaluation results