Digitális audio az alapoktól
Mintavétel, Nyquist, bitmélység, kvantálás, dithering, jitter és órajel
A digitális audióról rengeteg vizuális félreértés kering: lépcsős hullámformák, „hiányzó pontok”, „a 96 kHz simább, ezért jobban követi a szinuszt”. A Shannon-Nyquist mintavételi tétel és a rekonstrukciós szűrés megértése után ezek nagy része eltűnik.
1. Mintavétel
A folyamatos idejű jelből meghatározott időpontokban mintákat veszünk. Ha a jel sávkorlátozott B Hz-re, elméletileg tökéletesen rekonstruálható, ha a mintavételi frekvencia nagyobb 2B-nél.
Jelölések: fs a mintavételi frekvencia, B pedig a mintavételezendő, sávkorlátozott jel legmagasabb frekvenciája. A gyakorlatban az analóg anti-alias szűrő átmeneti sávja miatt biztonsági tartalék is szükséges.
Ez nem azt jelenti, hogy a maximális frekvenciájú szinuszhoz „csak két pontból lépcsőt rajzolunk”. Az ideális rekonstrukció sinc-interpolációval történik; a DAC és analóg rekonstrukciós szűrő folyamatos jelet állít elő.
2. Miért 44,1 kHz?
44,1 kHz mintavételnél a Nyquist-frekvencia 22,05 kHz. Ez lehetővé teszi a névleges emberi hallási sáv reprezentálását megfelelő anti-alias és rekonstrukciós szűrőkkel.
3. Aliasing
Ha a bemeneti jel a Nyquist-frekvencia felett tartalmaz energiát és nincs megfelelő anti-alias szűrés, a spektrális komponensek visszahajlanak az alapsávba. Ez nem egyszerű „magasvesztés”, hanem új, hibás frekvenciakomponens keletkezése.
4. Bitmélység és kvantálás
Az amplitúdót véges számú kódolható szintre kvantáljuk. Ideális N bites egyenletes kvantáló elméleti szinuszos jel-kvantálási zaj viszonya közel:
Jelölések: SNR az ideális kvantálási jel-zaj viszony, N a felbontás bitekben. Az összefüggés ideális N bites kvantálóra és teljes kivezérlésű szinuszjelre érvényes; minden további bit elméletileg körülbelül 6,02 dB javulást ad.
16 bitnél ez kb. 98 dB egy teljes kivezérlésű ideális szinuszra; 24 bit elméletileg jóval nagyobb tartományt ad, de valós ADC/DAC analóg zaja miatt a tényleges ENOB kisebb.
A gyakran idézett ideális kvantálási SNR:
Magyarázat: ugyanaz az ideális kvantálási becslés látható itt ismét: N a bitmélység, az eredmény pedig decibelben értendő. Valós konverterben a zaj, a torzítás, az órajitter és az analóg fokozatok miatt a tényleges érték kisebb lehet.
Az 1,76 dB tag teljes kivezérlésű szinuszra és egyenletes, a jeltől független kvantálási hibamodellre érvényes. A levezetésben a kvantálási lépcső Q esetén σ²e = Q²/12, míg a teljes kivezérlésű szinusz RMS értéke 2N-1Q/√2.
5. Dither
Nagyon kis jelszinteknél a kvantálási hiba korrelálhat a jellel és torzításszerűvé válhat. Megfelelő dither hozzáadásával a hiba véletlenszerűsödik: a determinisztikus kvantálási torzítás helyett alacsony szintű zajt kapunk. Ez különösen bitmélység-csökkentéskor fontos.
Gyakorlati audióban a legfontosabb alapdither a TPDF (Triangular Probability Density Function). Nem-szubtraktív TPDF esetén a dither és a kvantálási hiba összesített zajteljesítménye nagyobb az ideális, dither nélküli kvantálási zajnál; a klasszikus modellben kb. 4,77 dB többlet adódhat. Cserébe a kvantálási torzítás és a zajmoduláció megszűnik, a hiba statisztikailag sokkal „zajszerűbbé” válik.
6. Noise shaping
A dither spektrális energiája visszacsatolt kvantáló struktúrával olyan frekvenciatartományba tolható, ahol a hallás kevésbé érzékeny. Ez nem „eltünteti” a zajt; a spektrális eloszlását változtatja.
7. Oversampling
Modern DAC/ADC rendszerek belsőleg jóval magasabb mintavételi frekvencián dolgozhatnak. Ez megkönnyíti az analóg szűrők tervezését és lehetővé teszi a digitális interpolációs/decimációs szűrést.
8. Jitter
Jitter az időzítési bizonytalanság. Ha a mintavételi vagy rekonstrukciós időpontok ideálishoz képest változnak, zaj és modulációs oldalsávok keletkezhetnek. Modern megfelelően tervezett audioeszközökben a jitter tipikusan jóval a hallhatósági határ alatt tartható; a „jitter” önmagában nem minőségi pontszám.
A jitter időhibája közvetlenül a jel pillanatnyi meredekségével szorozódik:
Jelölések: ΔU a jitterből származó pillanatnyi amplitúdóhiba, du/dt az analóg jel idő szerinti meredeksége, Δt pedig a mintavételi időpont hibája. Ugyanakkora időhiba meredekebb, nagyfrekvenciás jelrészen nagyobb feszültséghibát okoz.
Ezért azonos időjitter magasabb hangfrekvencián és nagyobb jelmeredekségnél okoz nagyobb pillanatnyi amplitúdóhibát. A hallhatóságot azonban a jitter spektruma, korrelációja, a DAC topológiája és az analóg zajszint együtt határozza meg.
9. 44,1 vs 48 vs 96 vs 192 kHz
Nagyobb mintavétel technikai munkafolyamatban adhat lazább analóg szűrőkövetelményt, alacsonyabb késleltetésű bizonyos DSP-struktúrákat vagy ultrahang-tartományú feldolgozási headroomot. Nem következik azonban automatikusan, hogy végfelhasználói lejátszásban hallhatóan jobb lesz.
10. 24 bit miért hasznos stúdióban?
Nem azért, hogy 144 dB hangnyomás-dinamikát hallgassunk, hanem mert felvételnél és feldolgozásnál nagyobb digitális headroomot és alacsony kvantálási zajt ad. Így nem kell a bemeneti szinteket a digitális maximum közelébe kényszeríteni.
A DAC nem „lépcsős hullámot” küld a hangfalra. A minták egy diszkrét idejű reprezentáció részei; megfelelő rekonstrukció után a sávkorlátozott kimenet folytonos analóg jel.
11. Integer és floating-point feldolgozás
16/24 bites PCM tárolás tipikusan fixpontos egész kódokat használ. DAW-ok és digitális mixerek belső DSP-je gyakran 32 vagy 64 bites lebegőpontos. Lebegőpontos formátum hatalmas belső headroomot adhat, ezért egy belső bus átmenetileg 0 dBFS fölé is kerülhet clipping nélkül - amíg vissza nem alakítjuk fixpontos vagy DAC-kimenetre.
IEEE-754 32 bites lebegőpontos formátumban a kitevő miatt a reprezentálható numerikus tartomány nagyságrendileg 1500 dB fölötti, miközben a mantissza effektív pontossága kb. 24 bit. Ez hatalmas belső headroomot ad a mixbusznak, de nem jelenti azt, hogy a teljes feldolgozási lánc klippelhetetlen: fixpontos I/O, DAC, fájlformátum, illetve egyes pluginek és nemlineáris algoritmusok saját belső határokkal rendelkeznek.
12. Intersample peak
Digitális minták mindegyike lehet 0 dBFS alatt, miközben a rekonstruált folytonos hullám csúcsa két minta között 0 dBFS fölé kerülhet. Ezt intersample peaknek nevezik. Túl agresszíven limitált masteringnél egy DAC vagy sample-rate converter analóg/digitális headroomja emiatt túlterhelődhet. True-peak mérés oversamplinggel próbálja becsülni ezeket a csúcsokat.
A minták közötti rekonstruált hullám csúcsa meghaladhatja a legnagyobb tárolt mintaértéket - ez az intersample peak. A modern loudness/True-Peak mérés alapreferenciája az ITU-R BS.1770; a szabványos True-Peak becslés túlmintavételezett rekonstrukciót használ (tipikusan legalább 4×), míg egyes műszerek ennél magasabb belső oversamplinget is alkalmaznak.
13. Latency és buffer
Digitális audio rendszerben az ADC, buffer, DSP, USB/ethernet átvitel és DAC késleltetést ad. Kisebb buffer csökkenti a latency-t, de növeli a processzor időzítési kockázatát. DJ scratch/monitoring esetén néhány ms is érezhetőbb lehet, míg egyszerű lejátszásnál nagyobb puffer stabilabb.
14. Sample-rate conversion minősége
SRC során új mintavételi rácsra számítjuk át a jelet. Jó algoritmus megfelelő stopband csillapítást, kis passband ripple-t és kontrollált aliasingot biztosít. A rossz SRC mérhető artefaktumokat hozhat létre, de modern minőségi szoftveres konverterek rendkívül pontosak lehetnek.
15. Word clock és több digitális eszköz
Két digitális eszköz összekapcsolásakor közös időalap szükséges, különben minták csúsznak el, kattogás vagy dropout keletkezhet. Egy rendszerben egy master clock és megfelelően szinkronizált slave eszközök szükségesek. Ez nem jelenti azt, hogy drága külső „audiofil clock” automatikusan jobb hangot ad; a rendszerarchitektúra és jitter rejection számít.
16. Dither mikor kell?
Dither főként akkor szükséges, amikor a kvantálási felbontást ténylegesen csökkentjük, például 24 bites masterből 16 bites végfájlt készítünk. Ha csak a fájl konténere változik bitmélység-változás nélkül, nincs ok új ditherre. Többszöri indokolatlan dither kis mértékben növeli a zajt.
17. Digitális csend és analóg zaj
A digitális nullakód tökéletes numerikus csend lehet, de a DAC analóg kimenete soha nem teljesen zajmentes. Termikus zaj, op-amp zaj, tápzaj és konverterzaj marad. A rendszer valódi dinamikatartományát ezért az analóg implementáció is korlátozza.
Források és szakmai háttér
- Claude Shannon: Communication in the Presence of Noise.
- Ken Pohlmann: Principles of Digital Audio.
- Julius O. Smith: digitális jelfeldolgozási és audio jegyzetek.
- ITU-R BS.1770 - Algorithms to measure audio programme loudness and true-peak audio level.
Rövid szakmai tájékoztatás
A SWORD LAB műszaki tartalmait tájékoztató és ismeretterjesztési céllal készítem. A tartalom nem helyettesíti a konkrét alkalmazásra vonatkozó tervezést, gyártói dokumentációt, hatályos előírásokat, szabványokat, orvosi vizsgálatot vagy szakértői vizsgálatot. A teljes tájékoztatás elolvasása →
