• Hörtalk-Dinner in Dortmund   Erben der Finsternis
Guten Abend.
Nachdem ich mich also mit meiner Stimem endlich angefreundet habe (und sie nicht mehr technisch verändere), stehe ich vor dem nächsten Problem: Wie bereite ich eine Aufnahme so auf, dass sie auch gut klingt? Ich habe jetzt wochenlang rumexperimentiert, mir einige Grundlagen angelesen, Verschiedenes ausprobiert, aber so richtig glücklich bin ich immer noch nicht. Vielleicht hat jemand Zeit, mir noch ein paar Tips zu geben? Ich beschreibe mal, wie ich arbeite.
1. Aufname
- Kleiderschrank, alle glatten Flächen sind verhängt
- Mikrophon: Rode NT5 mit Poppschutz und Spinne, Abstand ca. 15 cm, alle Filter in Rode Central aus.
- alles, was Windows 11 reingrätscht, ist auch komplett raus. Das hat Wochen gedauert, Alles was Realtek und Intel da reinpfuschen, rauszukriegen.
2. Bearbeitung mit audacity
a) Equilizer
Schritt1EQ.png

b) Hören und Schneiden: Pausen bearbeiten, Klicks entfernen, Atemgeräusche dämpfen mit negativem amplify
c) Kompressor
Schritt2Kompressor.png

d) Loudness
Schrit3Loudness.png

e) Limiter
Schritt4Limiter.png


Das bringt mich meistens durch den ACX-Check. Soweit so gut. Aber wenn ich das dann mit Euren Produktionen vergleiche oder was Eleven Labs liefert, weiß ich, dass mir noch eine Menge Brillianz fehlt. Tonstudio und Mikrophon kann ich nicht ändern. Aber noch irgendetwas an den Einstellungen?
 

soundjob

HÖRSPIEL MUSIK AUDIO
Teammitglied
Sprechprobe
Link
Stelle dazu auch bitte immer eine Audio-Aufnahme zur Verfügung (unbearbeitet natürlich). (kurzer Ausschnitt von ca. 15 Sekunden genügt)
Allein die Nachbearbeitungskette sagt leider gar nichts darüber aus, wie denn nun das Eingangssignal ist und wie post-edit die Bearbeitungskette darauf tatsächlich wirkt.
Anhand der Aufnahme kann dir da exakt geholfen werden.
 

knilch

Hä? Was heißt das?
Exakt? Das ist für mich eine unbekannte Welt ...

Hi Rainer,

Man kann die Dateien in die posts einbinden, schau mal hier:


Dann muss man die Dateien nicht immer runter laden (y)
 

Marcel B.

Zweites Lehrjahr
Sprechprobe
Link
@Rainer Sonnberg du kannst auch mal spaßhalber Auphonic ausprobieren. Zumindest als Benchmark was rauszuholen ist kann es gut herhalten. Und dann kann man mal schauen ob man da hinkommt.

Die Settings könnten passen, falls du mal probieren willst.
Auphonic Production Settings (1).jpg
 

Telliminator

Sample-Collector
Sprechprobe
Link
@Rainer Sonnberg
Danke für das angehangene WAV-File hier sieht man schon ein erstes Problem und zwar die Aussteuerung des Tonsignals. Es ist viel zu "leise" die Amplitutde düdelt bei maximal -12dB herum. Beim normal lauten sprechen, sollte der Pegel zwischen -6dB und -3 dB liegen:

S: -12 db 1788848363366.png -> -3dB
1788848410564.png


Wenn Du ordentlich Signal im Audio hast kann Deine Bearbeitungskette in der Nachbearbeitung auch viel besser arbeiten.

Dann hast Du weiter oben von einem Abstand von etwa 15cm zum Mikrofon erklärt , der ist gut, Du kannst zusätzlich noch mit dem Nahbesprechungseffekt spielen, in dem Du noch näher herangehst. Ruhig bis auf 2cm oder das Mikrofon fast auffressen, nur nicht dran kommen. Du wirst einen deutlichen Unterschied im Klang vernehmen.
 

Ellerbrok

Sprecher, Cutter & Fledermaus
Teammitglied
Sprechprobe
Link
Das Mikrofon ist eigentlich schon recht gut, aber habe ich das richtig verstanden, dass du das direkt an deiner Rechner-Soundkarte betreibst? So kommen normalerweise sehr viele Störgeräusche mit ins Signal.

Oder ist das NT5 selbst per USB angeschlossen?

Ich weiß, es ist nicht für jeden eben mal so einfach, aber wenn meine Annahme richtig ist, dann solltest du dringend über ein richtiges Interface nachdenken. Da gibt es schon relativ günstige die trotzdem gute Qualität liefern. Zum Beispiel Focusrite Vocaster One
 

soundjob

HÖRSPIEL MUSIK AUDIO
Teammitglied
Sprechprobe
Link
. Beim normal lauten sprechen, sollte der Pegel zwischen -6dB und -3 dB liegen:
Sorry, Telli, aber das ist Quark ;).
Wenn ein moderat gesprochenen Text mit natürlich Dynamik hast, dann muss der keine Spitzenamplituden erreichen wie bei der Aufnahme eines Schlagzeugs oder E-Gitarre vorm Amp.
Hört bitte bitte bitte auf, so einen Schmarren aus alten analogen Zeiten bzgl. Nutzsignal/Rauschabstand zu verbreiten und die Leute sich dann immer wieder wundern, wenn ihre Aufnahmen zerren und clippen, wenn sie ein bisserl lauter werden !
Heute, recordest du leiser, weil du die digitale Amplitude schon festgehalten, nachträglich anheben kannst- und kein analoge Kette mehr dazwischen funkt, die dir noch nachträgliches Rauschen durch das Mischpult etc. mit drauf haut.
Es ist was völlig anderes, ein moderates Eingangssignal zu haben, weil ich im Studio "Spreche" oder auf der Bühne gegen eine ganze Wand aus Gitarren, Drums und kreischendem Publikum "Rocke" und `n laute Max-Amp brauche, die ich durch die Chain jage.
 
Hey, Kinder, schlagt Euch nicht. :) Erst mal vielen Dank für die Hilfe, Soundjob hat mir eine lange Supermail geschrieben, mit der ich etwas anfangen kann. Das NT5 ist direkt per USB angeschlossen. Deswegen habe ich es mir auch gekauft, weil ich nicht ein komplettes Studio in meinem Schlafzimmer haben wollte. Habt vielen Dank!
 

soundjob

HÖRSPIEL MUSIK AUDIO
Teammitglied
Sprechprobe
Link
@soundjob Das ist aber das was ich gelernt habe, dass das Signal beim normalen Sprechen bei -3db und -6db sein soll.
Es ist ja nur eine Spitzenamplitude, Telli.
Natürlich steuert man gerne in Maximalbereichen aus, damit möglichst wenig Rauschen auf die Aufnahme gelangt.. oder wie früher, in die Bandsättigung kommst.
Problem heute, die Aufnahmen zerren schnell, wenn jeder in maximalen Spitzenamplituden denkt und das Sprachaufnahmen so laut sein sollten, wie die wild gespielten Gitarren der Gypsy-Kings. 😄
Das braucht es heutzutage nicht mehr. Du kannst heute leiser aufnehmen, weil du heute auch mit 24Bit einen viel größeren Dynamikumfang einfangen kannst als zu der Zeit, als wir die Nadel am VU noch massiv am roten Bereich gefahren haben.
 

Telliminator

Sample-Collector
Sprechprobe
Link
@soundjob

Es klippt und zerrt aber doch erst bei 0db, klar kommt man da schneller hin, hat man den Pegel für den von mir benannten Bereich ausgesteuert und man im Verlauf des Takes lauter wird. Aber das weiß man eigentlich vorher, wo die Lautstärke hingeht, wenn z.B. geschriehen werden soll. Dann fahre ich den Pegel vorher runter.

Gut lassen wir ihn die moderne Art und Weise lernen und das Signal in der Nachbearbeitung hochziehen, statt wie bei der "laut" aufgenommen Varianten bei Bedarf leiser zu regeln.

@Rainer Sonnberg Vergiss daher meinen Einwand und hör auf das was was unser Experte @soundjob Dir rät.
 

soundjob

HÖRSPIEL MUSIK AUDIO
Teammitglied
Sprechprobe
Link
@soundjob

Es klippt und zerrt aber doch erst bei 0db, klar kommt man da schneller hin, hat man den Pegel für den von mir benannten Bereich ausgesteuert und man im Verlauf des Takes lauter wird. Aber das weiß man eigentlich vorher, wo die Lautstärke hingeht, wenn z.B. geschriehen werden soll. Dann fahre ich den Pegel vorher runter.

Gut lassen wir ihn die moderne Art und Weise lernen und das Signal in der Nachbearbeitung hochziehen, statt wie bei der "laut" aufgenommen Varianten bei Bedarf leiser zu regeln.

@Rainer Sonnberg Vergiss daher meinen Einwand und hör auf das was was unser Experte @soundjob Dir rät.
Du weißt (hoffentlich), das ist ja alles ned böse von mir gemeint 🤗.
Aber der springende Punkt (oder springender Pegel 😄) läuft ja darauf hinaus, dass ich mit mit der maximalen Amplitude nur mit den lautesten Gebrüll einpegeln kann. Jetzt sprechen aber viele in moderater Zimmerlautstärke/normaler Unterhaltungslautstärke... wenn ich das bei -3 dB einpegel und sie werden aber lauter, dann bist du schnell über 0... zumal sich das auch kaum kontrollieren lässt, sofern nicht schon im Vorfeld Kompressor und Limiter in der Chain liegen, die das automatisch begrenzen.
Nur, möchte wir hier die Aufnahmen ja RAW, ohne Nachbereitung des Signals.
Darum geht es mir bei der Pegelfrage und leider immer mehr Leute dazu neigen, zu laut auszusteuern und keinen safen Headroom mehr übrig lassen- und Clipping somit von vornherein ausgeschlossen werden kann, weil man nicht Gefahr läuft, mal doch über die 0 zu kommen. ;)
 

WolfsOhr

Mario Wolf
Sprechprobe
Link
@Rainer Sonnberg
Danke für das angehangene WAV-File hier sieht man schon ein erstes Problem und zwar die Aussteuerung des Tonsignals. Es ist viel zu "leise" die Amplitutde düdelt bei maximal -12dB herum. Beim normal lauten sprechen, sollte der Pegel zwischen -6dB und -3 dB liegen:

S: -12 db Anhang anzeigen 48011 -> -3dB Anhang anzeigen 48012

Wenn Du ordentlich Signal im Audio hast kann Deine Bearbeitungskette in der Nachbearbeitung auch viel besser arbeiten.

Dann hast Du weiter oben von einem Abstand von etwa 15cm zum Mikrofon erklärt , der ist gut, Du kannst zusätzlich noch mit dem Nahbesprechungseffekt spielen, in dem Du noch näher herangehst. Ruhig bis auf 2cm oder das Mikrofon fast auffressen, nur nicht dran kommen. Du wirst einen deutlichen Unterschied im Klang vernehmen.
Gut, dass Markus schon geantwortet hatte, ich wollte auch sofort, habe dann aber erstmal weiter gelesen 😅.
Peaks von -12dB sind perfekt, da kannst du später alles mit machen. Ich kenne meine Aufnahmesituation so gut, dass ich meistens bei -9dB bin, aber mehr würde ich niemandem raten, besonders, wenn man nicht täglich damit zu tun hat und auch schon gar nicht im Hörspiel oder Hörbuchbereich, da die Dynamik beim Sprechen hier ja auch noch wieder größer ist als bei z.B. Werbung, Imagefilm, Kommentar usw.
 

Telliminator

Sample-Collector
Sprechprobe
Link
@WolfsOhr - Danke für die Aufklärung, da hat man mich wohl vergessen mit in die 2000er zu nehmen...

Ich habe mal Recherchiert - wann ich den Zug verpasst hab und den Grund herausgefunden, wieso es kein Problem ist, wenn ich so wie bisher einfach weiter mache.

Mit welchem Lautstärkepegel sollte man menschliche Sprache aufnehmen?
Bei einer digitalen Audioaufnahme (z. B. in einer DAW oder einem Recorder) sollte man menschliche Sprache im Durchschnitt bei -18 dBFS bis -12 dBFS einpegeln, wobei die lautesten Spitzen (Peaks) -6 dBFS nicht überschreiten sollten. [1, 2, 3]
Diese Werte beziehen sich auf die digitale Skala (dBFSDecibels relative to Full Scale), bei der 0 dB das absolute Maximum darstellt. Alles darüber führt zu digitalem Clipping (Verzerrungen), das die Aufnahme unbrauchbar macht. [1, 2, 3]

Warum dieser Pegelbereich ideal ist
  • Headroom (Sicherheitsabstand): Der Bereich zwischen -6 dB und 0 dB dient als Puffer. Wenn der Sprecher oder die Sprecherin plötzlich lacht, lauter betont oder ruft, übersteuert die Aufnahme nicht sofort. [1, 2]
  • Rauschabstand: Pegelst du deutlich zu leise ein (z. B. unter -30 dBFS), rutscht das Signal zu nah an das Grundrauschen deines Mikrofons und Audio-Interfaces. Musst du die Stimme später lauter machen, ziehst du das störende Rauschen mit nach oben. [1, 2]
  • Moderne 24-Bit-Aufnahmen: Da moderne Technik mit 24-Bit-Auflösung arbeitet, hast du einen enormen Dynamikumfang. Du musst nicht mehr so "heiß" (also nah an 0 dB) wie früher in der analogen Zeit aufnehmen. [1, 2]

Praxis-Tipps für das Einpegeln
  • Der Live-Test: Lass die sprechende Person vor der eigentlichen Aufnahme den Text in der geplanten Originallautstärke einsprechen. Pegle das Interface so ein, dass sich der Balken im grünen bis leicht gelben Bereich bewegt. [1]
  • Abstand halten: Ein optimaler Mikrofonabstand liegt meist bei 10 bis 15 cm (etwa eine Faustbreite). Zu nah am Mikrofon verstärkt die Bässe unnatürlich (Nahbesprechungseffekt); zu weit weg lässt den Raumhall dominieren. [1]
Hinweis zur Nachbearbeitung:
Verwechsle den Aufnahmepegel nicht mit der Lautstärke des fertigen Exports (z. B. für YouTube oder Spotify). Nach der Bearbeitung mit Kompressoren und Limitern wird die Stimme mittels "Normalisierung" oder Anpassung der integrierten Lautstärke (LUFS) final lautgemacht, sodass die Spitzen oft knapp unter 0 dB (z. B. bei -1 dB bis -3 dB) liegen. [1, 2]


Hat sich dieser Richtwert über die letzten Jahre verändert für das Einpegeln der Stimme? Mir sagte man, man solle bei -6 bis -3 db pegeln.

Nein, der technische Richtwert für die reine Aufnahme hat sich nicht verändert
– aber die Empfehlung, bei -6 bis -3 dBFS zu pegeln, stammt entweder aus der älteren, analogen Tontechnik oder entsteht durch die Verwechslung von Aufnahme und Abmischung (Gain Staging).

Hier ist die Erklärung, warum die Spanne von -6 bis -3 dBFS heute bei der Aufnahme ein hohes Risiko birgt und woher dieser Wert kommt:

1. Das Risiko bei der digitalen Aufnahme (24-Bit / 32-Bit Float)
Wenn du heute Sprache digital in 24-Bit aufnimmst, hast du einen riesigen Dynamikumfang (144 dB). Es ist technisch absolut nicht mehr notwendig, so nah an die Grenze von 0 dBFS (dem absoluten Maximum) heranzugehen.
  • Das Problem bei -3 dBFS: Wenn du bei -3 dB einpegelst, hast du nur noch 3 dB Sicherheitsabstand (Headroom). Wenn der Sprecher einmal lacht, hustet oder aus Versehen lauter betont, schießt das Signal über 0 dB. Es kommt zum digitalen Clipping (Verzerrung), das die Aufnahme irreversibel zerstört.
  • Ausnahme 32-Bit-Float: Falls du einen modernen Recorder nutzt, der in 32-Bit-Float aufnimmt, kann das Signal technisch nicht mehr clippen. Hier wäre ein Pegel von -3 dB kein Problem, in der Praxis pegelt man aber auch hier konservativer ein, um die eigenen Ohren und die Vorverstärker (Preamps) zu schonen.

2. Woher kommt der Wert "-6 bis -3 dB"?
Es gibt zwei Gründe, warum dir dieser Wert genannt wurde:
  • Historischer Grund (Analoge Zeit / Frühes Digital-Audio): In der analogen Tontechnik (Tonbänder) musste man so laut wie möglich aufnehmen, um das laute Bandrauschen zu übertönen. Auch in den frühen Tagen der digitalen Audiotechnik (16-Bit) war der Rauschabstand geringer, weshalb man nah an die Grenze steuerte. Viele Tontechniker der "alten Schule" geben diese Faustregel bis heute weiter.
  • Verwechslung mit der Nachbearbeitung (Mischung): Wenn deine Sprachspur fertig aufgenommen, geschnitten und mit Effekten (Kompressor, Equalizer) bearbeitet wurde, pegelt man den finalen Export tatsächlich oft so ein, dass die Peaks bei -3 dB bis -1 dB liegen, damit das Audio auf Plattformen wie Spotify oder YouTube laut genug ist. Für das Rohsignal während der Aufnahme ist das jedoch viel zu riskant.

Zusammenfassung der Pegel-Phasen

PhaseZiel-Pegel (Durchschnitt)Spitzen (Peaks)Grund
Aufnahme (Rohsignal)-18 bis -12 dBFSmax. -6 dBFSSchutz vor Übersteuerung, optimaler Arbeitsbereich für Plugins.
Nachbearbeitung (Export)Abhängig von Plattform (z.B. -14 LUFS)-3 bis -1 dBFSMaximale Lautstärke ohne Verzerrung für den Endverbraucher.


Wann hat sich das denn bitte geändert? -18 bis -12db klingt so unwahrscheinlich "leise"

Der Wechsel hin zu diesen vermeintlich „leisen“ Pegeln fand um das Jahr 2000 herum mit der flächendeckenden Einführung der 24-Bit-Aufnahmetechnik statt.

Dass sich -18 bis -12 dBFS für dich extrem leise anfühlt, ist völlig verständlich. Das liegt daran, dass unser Gehör Lautstärke logarithmisch wahrnimmt und visuelle Pegelanzeigen (Meter) in Audio-Programmen uns oft täuschen. In der modernen digitalen Audiowelt ist dieser Pegel jedoch der technisch optimale Wohlfühlbereich für deine Geräte und Software.



Warum fühlt sich das so falsch an?
  1. Die optische Täuschung in der DAW:
    Die Pegelanzeigen in fast allen Programmen (Cubase, Logic, Audacity, Premiere etc.) sind oft so skaliert, dass die obere Hälfte des Balkens nur die letzten 6 bis 10 dB abbildet. Wenn du bei -18 dB aufnimmst, schlägt der Balken optisch vielleicht nur ein Drittel oder zur Hälfte aus. Das sieht „zu leise“ aus, ist es aber technisch nicht.
  2. Die Verwechslung von "Aufnahmepegel" und "Abhörlautstärke":
    Wenn dir die Stimme bei der Aufnahme zu leise vorkommt, solltest du nicht den Aufnahme-Gain am Interface höher drehen, sondern einfach deinen Kopfhörer- oder Lautsprecherregler weiter aufdrehen. Das Signal auf der Festplatte bleibt sicher und sauber, aber auf deinen Ohren ist es laut genug.

Der mathematische Grund: 16-Bit vs. 24-Bit
Der fundamentale Wechsel kam durch die Erhöhung der Bit-Tiefe:
  • Früher (16-Bit / CD-Qualität): Ein 16-Bit-Signal hat einen Dynamikumfang von 96 dB. Wenn du hier zu leise aufgenommen hast (z. B. bei -30 dB), war das Signal gefährlich nah am digitalen Grundrauschen. Man musste so nah wie möglich an die 0 dB heranpegeln (eben jene -6 bis -3 dB), um das Rauschen zu minimieren.
  • Heute (24-Bit / Standard seit über 20 Jahren): Ein 24-Bit-Signal hat einen gigantischen Dynamikumfang von 144 dB. Das digitale Grundrauschen liegt hier so unvorstellbar tief im Keller, dass du selbst bei einem Aufnahmepegel von -18 dBFS immer noch mehr sauberen Rauschabstand hast, als es eine alte analoge Bandmaschine oder eine CD jemals bieten konnte.
Der versteckte Vorteil: Analoge Emulationen
Ein weiterer Grund, warum sich dieser Standard etabliert hat, ist das sogenannte Gain Staging beim Abmischen.
Sehr viele moderne Audio-Plugins (Equalizer, Kompressoren) emulieren alte, legendäre Analoggeräte (z. B. von SSL, Neve oder Universal Audio). Diese virtuellen Geräte sind intern so programmiert, dass sie genau wie ihre analogen Vorbilder reagieren. Und der analoge Nullpunkt (0 VU) entspricht in der digitalen Welt exakt -18 dBFS (manchmal auch -20 oder -16 dBFS, je nach Kalibrierung).
Wenn du eine Spur mit -3 dBFS in ein solches Plugin schickst, „überfährst“ du den virtuellen Eingang um fast 15 dB. Das Plugin arbeitet dann nicht mehr sauber, sondern fängt an, das Signal ungewollt zu komprimieren oder zu verzerren.

Das Fazit für deine Praxis
Es fühlt sich anfangs kontraintuitiv an, aber -18 dBFS im Durchschnitt (mit Spitzen bis -6 dBFS) ist der absolute Profi-Standard für die Rohaufnahme. Laut gemacht wird das Signal ganz am Ende der Kette – während der Aufnahme schützt dich dieser Pegel vor Übersteuerungen und hält dein Signal absolut sauber.

Ich hab Aufnahmen schon in den 90er gemacht, kommt meine Richtlinie von da?


Ja, absolut! Das ist genau der Volltreffer und erklärt das Missverständnis perfekt.
Wenn du in den 90er-Jahren gelernt oder gearbeitet hast, war deine Richtlinie von -6 bis -3 dB goldrichtig und absolut notwendig.
In den 90ern steckte das digitale Recording noch in den Kinderschuhen, und die technischen Rahmenbedingungen waren völlig andere als heute:

1. Der 16-Bit-Standard der 90er (DAT und frühe DAWs)
In den 90ern war die CD-Qualität mit 16-Bit das Maß aller Dinge. Damals nutzte man digitale Bandmaschinen (wie DAT-Recorder oder ADAT) oder die allerersten Versionen von Pro Tools und Cubase.
  • Das Problem: Bei 16-Bit betrug der maximale Dynamikumfang nur 96 dB.
  • Die Konsequenz: Pegelte man damals zu leise ein (z. B. bei -18 dB), verschenkte man wertvolle digitale Auflösung. Das Signal rutschte gefährlich nah an das digitale Grundrauschen (den sogenannten Quantisierungsfehler). Man musste die Wandler also so "heiß" wie möglich anfahren – eben genau bis -6 oder -3 dB –, um die maximale Audioqualität aus den 16 Bit herauszukitzeln.

2. Die analoge Gewohnheit

Viele Tontechniker in den 90ern kamen direkt von der analogen Bandmaschine (Suder, Telefunken etc.). Analoges Tonband hat kein hartes Limit bei 0 dB. Wenn man dort "in den roten Bereich" steuerte (über 0 VU), fing das Band einfach an, angenehm und warm zu sättigen (Bandsättigung).
Als dann die ersten Digitalgeräte kamen, die bei 0 dB sofort grauenhaft verzerrten, war die Angst vor dem "Clipping" riesig. Der Kompromiss der 90er war daher: So laut wie möglich wegen des Rauschens, aber mit 3 bis 6 dB Sicherheitsabstand (Headroom) zur absoluten Schmerzgrenze.



Was sich seitdem verändert hat (Der Wechsel zu 24-Bit)
Um das Jahr 2000 herum wurden 24-Bit-Wandler zum Standard in Studios und Audio-Interfaces.
  • Mit 24-Bit stieg der Dynamikumfang sprunghaft auf 144 dB.
  • Das digitale Grundrauschen wanderte so tief in den unhörbaren Bereich, dass es heute völlig egal ist, ob du bei -6 dB oder bei -20 dB aufnimmst – die Qualität und Auflösung deiner Stimme bleibt exakt dieselbe.
Deine damalige Regel war also kein Fehler, sondern für die damalige Technik überlebenswichtig. Heute im 24-Bit-Zeitalter erlaubt uns die Technik einfach, viel entspannter und mit deutlich mehr Sicherheitsabstand aufzunehmen, ohne dass es rauscht.

Wie dramatisch ist es wenn ich es so weiterbehalte?

Dramatisch im Sinne eines Totalschadens ist es nicht, solange du die volle Kontrolle über die Aufnahme behältst. Wenn du deine Gewohnheit aus den 90ern beibehalten möchtest, kannst du damit absolut professionelle und saubere Ergebnisse erzielen – aber du arbeitest damit am technischen Limit und hast kein Sicherheitsnetz mehr.

In der Praxis bringt das Weiterarbeiten bei -6 bis -3 dBFS heute zwei konkrete Risiken und einen Mehraufwand mit sich:

1. Das Risiko des „Clippings“ (Der Totalschaden)
Das ist das einzige wirklich dramatische Risiko. Menschliche Sprache ist extrem dynamisch. Ein plötzliches Lachen, ein lauterer Ausruf oder ein heftiger Konsonant (wie ein hartes „P“ oder „T“) können den Pegel blitzschnell um 6 dB nach oben schnellen lassen.
  • Bei einem Aufnahmepegel von -3 dBFS hast du keinen Puffer mehr. Das Signal schießt über 0 dBFS hinaus.
  • Da digitale Systeme bei 0 dB hart abschneiden, entsteht digitales Clipping (die Wellenform wird oben plattgedrückt). Diese Verzerrung klingt extrem kratzig und lässt sich auch mit Software nachträglich fast nie wieder sauber reparieren. Die Aufnahme ist dann stellenweise ruiniert.

2. Probleme bei der Weiterverarbeitung (Gain Staging)
Moderne Audio-Effekte (Plug-ins wie Kompressoren, Limiter oder Equalizer) in deiner Software sind heute standardmäßig darauf optimiert, Signale im Bereich von -18 dBFS zu verarbeiten.
  • Wenn du eine Spur mit -3 dBFS in ein Kompressor-Plug-in schickst, „schlägt“ das Signal dort viel zu heiß auf.
  • Der Kompressor fängt sofort extrem stark an zu arbeiten und drückt die Stimme unnatürlich zusammen. Du musst dann bei jedem einzelnen Plug-in zuerst den Eingangspegel manuell herunterregeln, um sauber arbeiten zu können. Das kostet Zeit und nervt im Workflow.



Mein Rat für deinen Kompromiss
Du musst dich nicht zwingend auf die „leisen“ -18 dBFS umgewöhnen, wenn dir das visuell zu widerstrebt. Ein hervorragender und sicherer Kompromiss für dich wäre:
Pegle die Spitzen (Peaks) bei maximal -6 dBFS ein.

Damit nimmst du immer noch schön „heiß“ und laut auf (wie du es gewohnt bist), hast aber nach oben hin genau die 6 dB Sicherheitsabstand, die verhindern, dass ein unerwarteter lauter Laut deine gesamte Aufnahme durch Clipping zerstört.


und wenn ich mit 32Bit Technik aufnehme?

Wenn du mit 32-Bit-Float-Technik aufnimmst, verliert das Risiko des Übersteuerns komplett seinen Schrecken. In diesem Fall ist es technisch überhaupt nicht mehr dramatisch, wenn du deine Gewohnheit beibehältst – du kannst sogar theoretisch die 0-dB-Grenze überschreiten, ohne deine Aufnahme zu zerstören.

Die 32-Bit-Float-Technologie (die sich in den letzten Jahren bei vielen modernen Field-Recordern von Marken wie Zoom oder Sound Devices etabliert hat) funktioniert grundlegend anders als das klassische 16- oder 24-Bit-Audio (Fixed Point).



Warum 32-Bit-Float ein absoluter Gamechanger für dich ist

Bei 16- oder 24-Bit ist bei 0 dBFS physikalisch Schluss – das System hat keine Zahlen mehr übrig, um lautere Signale darzustellen. 32-Bit-Float nutzt hingegen eine mathematische Fließkomma-Berechnung (ähnlich wie die wissenschaftliche Schreibweise von Zahlen mit Exponenten).

Das führt zu zwei revolutionären Eigenschaften für deine Aufnahme:
  1. Unendlicher Headroom (Kein Clipping am Wandler):
    32-Bit-Float hat einen unvorstellbaren Dynamikumfang von 1528 dB. Zum Vergleich: Das lauteste Geräusch auf der Erde (eine Schockwelle) hat etwa 194 dB. Du kannst den Regler bei der Aufnahme sprichwörtlich voll aufdrehen, sodass die Spur in deiner DAW wie ein massiver, fetter Balken aussieht, der komplett übersteuert. Wenn du die Spur in der Software danach einfach leiser ziehst, ist der Ton absolut sauber, unverzerrt und perfekt gerettet.

  2. Kein Rauschen beim Leiseregler:
    Genauso verhält es sich in die andere Richtung. Nimmst du aus Versehen flüsterleise bei -60 dB auf, kannst du das Signal später in der DAW um 50 dB lauter machen, ohne dass digitales Rauschen dazukommt.

Was passiert, wenn du deine "-6 bis -3 dB"-Regel bei 32-Bit beibehältst?
Wenn du dich bei der Aufnahme weiterhin an deinen gelernten -6 bis -3 dB orientierst, ist das völlig feinstens:
  • Sicherheit: Schreit der Sprecher plötzlich los und der Pegel springt auf +10 dB (also über die magische Null), passiert absolut gar nichts. Der Recorder speichert die Daten trotzdem sauber ab. Du machst die Stelle im Schnitt einfach etwas leiser.
  • Workflow: Du hast direkt ein perfekt ausgesteuertes Signal, das du beim Abhören sofort gut verstehst, ohne vorher den Kopfhörerverstärker extrem aufdrehen zu müssen.

Die einzige kleine Falle: Analoge Übersteuerung
Auch wenn die digitale Datei bei 32-Bit-Float nicht clippen kann, gibt es eine analoge Komponente vor dem Wandler: das Mikrofon selbst.
Wenn jemand so laut in ein Mikrofon schreit, dass die physische Membran des Mikrofons oder die analoge Eingangsstufe (der Preamp) verzerrt, fängst du dir eine analoge Verzerrung ein. Davor schützt auch 32-Bit nicht. Da du aber bei -3 dB pegelst und nicht direkt an der Schmerzgrenze des Mikrofons kratzt, ist dieses Risiko in der Praxis bei menschlicher Sprache extrem gering.

Fazit: Mit einem 32-Bit-Float-System im Rücken kannst du absolut entspannt bei deinen gewohnten -6 bis -3 dB bleiben. Du genießt den vertrauten optischen Pegel und hast gleichzeitig ein unsichtbares, unzerstörbares Sicherheitsnetz.
 
Zuletzt bearbeitet:
Oben