مفاهیم پایه در صدای دیجیتال
مقدمه
در صورتی که علاقه به کار در حوزه صدا دارید، لازم است تا در ابتدا با تعدادی از مفاهیم پایهای در خصوص صدای دیجیتال آشنا شوید، در این گزارش به بررسی این مفاهیم خواهیم پرداخت.
صدا نوسان فشار هوا است. صدای دیجیتالی شده یک گراف از تغییرات فشار هوا در طول زمان است. برای اینکه بتوان این موضوع را بهتر درک کرد، با استفاده از sound Recorder در سیستم عامل ویندوز صدایی کوتاه ضبط کرده و به تغییر نوسان نوار سبز رنگ توجه کنید. وقتی که این نوار تا انتها پر میشود نشان دهنده زیاد بودن فشار هوا است که گوشها قادر به شناسایی بلندی صدا خواهند بود و زمانی که این نوار در وسط و رو به پایین باشد، تغییری در فشار هوا ایجاد نشده است.
تبدیل صدای آنالوگ به دیجیتال
یکی از توابع اصلی موجود در کارت صدا۱ (واسطهای صدا) تبدیل کردن فرمت آنالوگ به دیجیتال است. موج صدا دارای اطلاعاتی بینهایتی از جمله گامها۲، حجم صدا۳ و مدت زمان پخش۴ است. کامپیوترها توانایی پردازش این اطلاعات بینهایتی را ندارند، بنابراین سیگنال صدا باید قبل از اینکه از آن استفاده شود به فرمی که برای کامپیوتر قابل درک است تبدیل شود.
در شکل (۱) به خوبی میتوان این وضعیت را مشاهده نمود. شکل موج قرمز رنگ نشاندهنده موج صدایی است که توسط خواننده یا یک ابزار آکوستیکی تولید میشود. تغییرات تدریجی موج قرمز نمیتواند بوسیله کامپیوتر پردازش شود، بنابراین باید از تقریبی که توسط مستطیلهای خاکستری برای موج صدای قرمز در نظر گرفته میشود استفاده کرد.
این شکل نشاندهنده مفهوم واقعی از موج صدا است و نشاندهنده داده واقعی ضبطشده صدا نیست. در هنگام تبدیل کردن سیگنال از آنالوگ به دیجیتال۵ واسط صدا یا کارت صدا، بالا یا پایین بودن کیفیت صدا را با استفاده از نرخ نمونهبرداری و کنترل فرمت نمونهبرداری تشخیص میدهد. با بزرگتر شدن مقدار داده صدا، کارت صدا بهتر میتواند سیگنال اصلی که از میکروفن دریافت میشود را تقریب بزند. در ادامه این گزارش مفاهیم نرخ نمونهبرداری و فرمت نمونهبرداری که اجزای اصلی در تشخیص کیفیت صدا هستند را توضیح خواهیم داد. بهعنوان مثال، یک واسط صدا که در داخل مادربردهای امروزی تعبیه میشود ممکن است از انواع فرمتهای نمونهبرداری و نرخهای نمونهبرداری (مانند ۱۹۲/۲۴) پشتیبانی کند اما دلیل بر خوب بودن نمیشود. در سطح حرفهای، با اتصال FireWire به یک واسط صدا با فرمت نمونهبرداری ۱۶ بیتی و نرخ نمونهبرداری ۴۴/۱ کیلوهرتزی که استاندارد است میتوانیم صدای بهتری داشته باشیم.
نمونهبرداری
زمانی که صدایی به وسیله میکروفن ضبط میشود، میکروفن نوسان فشار هوا را به نوسانات ولتاژ برق تبدیل میکند که کارت صدا هر از چندگاه (در بازهای مشخص) آن را اندازه گرفته و به عدد تبدیل میکند؛ این عمل با نام نمونهبرداری۶ شناخته میشود. زمانی که صدایی (خواننده یا یک ابزار آکوستیکی) پخش میشود، پردازش به صورت معکوس عمل خواهد کرد، به این صورت که نوسان ولتاژ به جای میکروفن به پخشکنندهها (بلندگو)۷ میرود و توسط مخروط۸ بلندگوها به فشار هوا تبدیل شده که قابل شنیده شدن است.
نمونهبرداری یکی از واحدهای مهم داده در صدا است. برای درک بهتر این مفهوم از مثال تصویر که محسوستر است استفاده میکنیم، در سیستمهای کامپیوتری دادههای تصویر (مانند فیلم) به شکل سریالی از تصاویر ذخیره میشوند که با نام فریم خوانده میشود و آنها را یکی پس از دیگری نمایش میدهند و با نرخی از پیش تعیینشده به نام نرخ فریم میتوان آن را تغییر داد. در سیستمهای کامپیوتری داده صدا هم به صورت سریالی از صدا با نام sample ذخیره میشود و آنها را یکی پس از دیگری با نرخی از پیش تعیینشده به نام نرخ نمونهبرداری میتوان پخش كرد.
نرخ نمونهبرداری
به سرعتی که صدا را از ولتاژها نمونهبرداری میکند نرخ نمونهبرداری۹ گفته میشود و با واحد کیلوهرتز kHz بیان میشود. یک کیلوهرتز شامل هزار نمونه در ثانیه است. نرخ نمونهبرداری به تعداد نمونههای پخششده در هر ثانیه گفته میشود. نرخ نمونهبرداری که برروی CDهای صوتی استفاده میشود ۴۴/۱ یا ۴۴۱۰۰ است که هر دو دارای یک معنی هستند. نرخهای نمونهبرداری معمولاً ۴۴/۱، ۴۸ و ۹۶ هستند. نرخهای نمونهبرداری دیگری مانند ۲۲ و ۸۸/۲ و ۱۹۲ هم وجود دارند که زیاد عمومی نیستند.
از آنجایی که بازهی شنوایی انسان بین ۲۰ تا ۲۰۰۰۰ هرتز است بنابراین زمانی که در حال ضبط موسیقی یا موارد آکوستیکی هستیم، بهترین نرخ نمونهبرداری موج صوت ۴۴/۱CD، ۴۸، ۸۸/۲ یا ۹۶kHz خواهد بود. به طور تقریبی میتوان گفت که نرخی دو برابر از نتیجهی قضیه نایکوئیست۱۰ مورد احتیاج است. توجه به این نکته لازم است که نمونهبرداری با نرخی بیش از ۵۰ یا ۶۰ کیلوهرتز نمیتواند حامل اطلاعات مفیدی برای شنونده انسانی باشد. به همین دلیل تولیدکنندگان حرفهای تجهیزات صوتی از نرخی در محدوده ۵۰ کیلوهرتز استفاده میکنند.
فرمت نمونهبرداری
فرمت نمونهبرداری یا عمق بیت یا بیت در هر نمونه۱۱ به تعداد بیتهای استفاده شده جهت توضیح هر نمونه۱۲ گفته میشود. با بزرگتر شدن تعداد بیتها، داده بیشتری در هر نمونه ذخیره خواهد شد. فرمت نمونهبرداری معمولاً ۱۶ بیت و ۲۴ بیت است. نمونههای ۸ بیتی کیفیت بسیار پایین دارند و معمولاً در مودم۱۳ها استفاده میشدند، نمونههای ۳۲ بیتی هم موجود هستند اما در بیشتر واسطهای صوتی پشتیبانی نمیشوند.
در صدای ۱۶ بیتی، ۶۵،۵۳۶ (216) سطح داده وجود دارد و با بزرگتر شدن اندازهی بیت، تعداد سطحها (انرژی) با مضرب دو بزرگتر میشوند. زمانی که به ۲۴ بیت میرسیم، دارای ۱۶،۷۷۷،۲۱۶ (224) سطح داده هستیم.
توجه به این نکته مهم است که در صدا (صوت)۱۴ هیچ چیزی به طور مستقیم دربارهی فرکانس صدا، گام۱۵ و درکی از بلندی صدا۱۶ ذخیره نمیشود. البته میتوان با اجرا کردن الگوریتمهای مشخصی بر روی این نمونهها این مقادیر را تا حدودی تعیین کرد اما این موارد قابل خواندن از روی فایل نیست.
CD-DA استاندارد صدای CD است که دارای نرخ دادهای ۱۶ بیتی با فرکانس ۴۴/۱ کیلوهرتز است، به این معنی که داده صدا در هر ثانیه شامل ۴۴۱۰۰ نمونه با عمق بیت ۱۶ است، به عبارت دیگر دارای ۴۴۱۰۰ قطعه است و هرکدام دارای ۶۵،۵۳۶ سطح داده هستند. CD-DA همچنین به صورت استریو۱۷ است و از کانالهای چپ و راست استفاده میکند، بنابراین مقدار داده صدا در هر ثانیه دو برابر مونو۱۸ و جایی که از صدای تک کاناله استفاده میشود است.
نرخ بیت
نرخ بیت به تعداد بیتها یا مقدار دادهای برمیگردد که در یک بازه زمانی مشخصی پردازش میشود و در حوزه صدا با واحد کیلوبیت در هر ثانیه (یا kb/s kbps) اندازهگیری میشود. بهعنوان مثال، به موسیقی که گوش میدهید دارای ۲۵۶ کیلوبیت در ثانیه باشد، به این مفهوم است که در هر ثانیه از موسیقی ۲۵۶ کیلوبیت داده ذخیرهشده است. برای اینکه بتوانیم یک فایل را انتقال دهیم به نرخ بیت که بیانکننده مقدار داده مورد نیاز در هر ثانیه است نیاز داریم.
نحوه محاسبه نرخ بیت هم برابر است با ضرب نرخ نمونهبرداری در فرمت نمونهبرداری در تعداد کانالها. به عنوان مثال، نرخ بیت CD های صوتی (705.6 kb/s) در حالت تک کاناله است که حاصل ضرب نرخ نمونهبرداری (44.1 kHz) در فرمت نمونهبرداری (۱۶ بیت) است. به عنوان مثال فرمت فایل mp3 هم به طور معمول با نرخ بیت 128kb/sفشرده میشود. (کد میشود.)
با بالا رفتن میزان نرخ بیت یک فایل صدا، فضای بیشتری از کامپیوتر اشغال میشود، به همین دلیل انواع فرمتهای فشردهسازی ارائه شده است تا بتوان تعداد فایلهای بیشتری در فضایی که در اختیار داریم ذخیره کنیم. این الگوریتمهای فشردهسازی به دو دسته lossy (با از دست رفتن مقداری از دادهها) و lossless (با حفظ تمامی دادهها) تقسیم میشود.
نرخ بیت دادهی صوت PCM از طریق فرمول زیر محاسبه میشود:
Bit rate = sample rate × bit depth × channels
به عنوان مثال، نرخ بیت ضبطشده CD-DA (44.1kHz، 16 bits، 2 channels) به شکل زیر محاسبه میشود:
44,100 × 16 × 2 = 1,411,200 bit/s = 1,411.2kbit/s
اندازه طول دادهی صدا PCM از طریق فرمول زیر محاسبه میشود (شامل هدر فایل و متادیتای فایل).
بنابراین، ۸۰ دقیقه معادل ۴۸۰۰ ثانیه از داده CD-DA نیاز به ذخیره ۸۴۶،۷۲۰،۰۰۰ داده دارد.
واسطهای صوتی جدید ممکن است با ۹۶۰۰۰ قطعه در ثانیه که هر کدام نزدیک به ۱۷ میلیون سطح داده برای هر قطعه هستند ضبط شود. درنهایت اگر فکر میکنید این اعداد گفته شده باعث به وجود آمدن فایلی با اندازهای بزرگ میشود درست است و به همین دلیل فرمتهای مختلف فشردهسازی رواج پیدا کرده و محبوبیت زیادی دارند. برای درک بهتر مفاهیم گفته شده و فضای مورد نیاز بر روی دیسک سخت به جدول (۱) و (۲) توجه فرمایید.
|
3 Minute Song |
1 Minute Stereo |
Bit Rate |
Sample Rate |
Bit depth |
|---|---|---|---|---|
|
30.3 MB |
33 MB |
1.35 Mbit/sec |
44,100 |
16 |
|
33 MB |
11.0 MB |
1.46 Mbit/sec |
48,000 |
16 |
|
99 MB |
33.0 MB |
4.39 Mbit/sec |
96,000 |
24 |
|
2.82 MB |
0.94 MB |
0.13 Mbit/sec |
128 k/bit rate |
mp3 |
جدول (۱): اندازه فایلها برای Stereo Digital Audio[4]
|
Songs per 200 GB Hard Disk |
Songs per 20 GB Hard Disk |
File Size per Song |
File Size per Mono Track |
# of Mono Tracks |
Bit Depth/Sample Rate |
|---|---|---|---|---|---|
|
1640 |
164 |
121 MB |
15.1 MB |
8 |
16/44.1 |
|
1500 |
150 |
132 MB |
16.5 MB |
8 |
16/48 |
|
500 |
50 |
396 MB |
49.5 MB |
8 |
24/96 |
|
820 |
82 |
242 MB |
15.1 MB |
16 |
16/44.1 |
|
740 |
74 |
264 MB |
16.5 MB |
16 |
16/48 |
|
240 |
24 |
792 MB |
49.5 MB |
16 |
24/96 |
جدول (۲): فضای هارد مورد نیاز برای سه دقیقه موسیقی Multi-track [4]
نتایجی که میتوان از جدول بالا به دست آورد:
۱- ضبط صدای با مشخصات ۲۴/۹۶ بازدهی در وضوحی حدود ۲۵۰ برابری ۱۶/۴۴.۱ ارائه خواهد داد.
۲- ضبط صدا با مشخصات ۲۴/۹۶ فضایی در حدود سه برابر ۱۶/۴۴.۱ اشغال خواهد کرد.
در نهایت آیا نیاز است تا ضبط صدا را با عمق داده و نرخ نمونهبرداری بالا انجام دهیم؟
بهتر است که ابتدا تفاوت میان این صداها را بیشتر برایتان روشن کنیم. به طور قطع میتوان گفت که کسی نمیتواند مقدار بهتر بودن کیفیت صدای ضبطشده با ۲۴/۹۶ را مشخص کند، به این دلیل که یک فایل ۲۴/۹۶ در مقایسه با ۱۶/۴۴.۱ حدود ۲۵۰ برابر وضوح بیشتری ارائه میدهد اما کیفیت ۲۵۰ برابر بهتر نشده حتی کیفیت به دو برابر بهتر هم نمیرسد. در حقیقت افراد عادی که در حوزه موسیقی و صدا فعالیت ندارند این تفاوت را احساس نمیکنند. اگر شما بتوانید تفاوت صدا بین فرمت فایل wave و MP3 را تشخیص دهید مطمئناً تفاوت بین نرخ نمونهبرداریهای مختلف را هم درک خواهید کرد!! به عنوان مثال، تفاوت میان kHz 22.0 و 44.1 kHz در میان علاقهمندان به موسیقی بسیار واضح و مشخص است و یک گوش تمرین دادهشده و قوی تفاوت میان 32 kHz و 44.1 kHz.را هم خواهد فهمید، اما مقایسه 44.1 kHz با 96 kHz یک مورد رقمی یا تفکری ذهنی است تا درک واقعی از تفاوت میان آنها.
کانال صدا۲۱
گوش انسان صدا را به شکل استریو میشنود و مغز انسان با استفاده از تفاوتهای ریزی که در ورودی صدای چپ با راست وجود دارد میتوان محل انتشار صدا در محیط را تشخیص داد. برای اینکه در صدای دیجیتال نیز بتوانیم این امکان را داشته باشیم در هنگام ضبط و پخش به شکل استریو به دو کانال صدا احتیاج داریم.
نکته: تمام ضبطهای صدای استریو به دو کانال احتیاج دارند اما لزوماً تمام ضبطهایی كه با دو کانال انجام میشوند استریو نیست. به عنوان مثال، زمانی که از میکروفون تک کپسوله برای ضبط بر روی دو کانال استفاده میکنید، نتیجه نهایی استریو واقعی نیست بلکه مونوی دو کاناله۲۱ است. در حقیقت صدای ضبطشده تک کانالهای است که بر روی دو کانال کپی شده است.
اندازه بلاک داده۲۲
پخش کردن و ضبط کردن صوت در نرمافزارها به وسیله تعدادی بلاک که از داده صدا تشکیل شده انجام میشود. اندازه بلاک صدا یک واحد اتمیک است. منظور از واحد اتمیک واحدی است که در وسط آن وقفهای۲۳ نمیتواند رخ دهد که در اینجا به بلاک داده صدا اطلاق میشود. برای فرمتهای پالس مدولاسیون کد (PCM)، محاسبه اندازه بلاک به وسیله فرمول زیر انجام میشود.
Block Alignment = Bytes per Sample x Number of Channels
برای مثال، اندازه بلاک داده برای فرمت ۱۶ بیتPCM به صوت مونو برابر دو است. (دو بایت در هر نمونه × یک کانال). برای فرمت صوت استریو ۱۶ بیت PCM، اندازه بلاک داده برابر چهار خواهد بود.
داده نوشته شده و خواندهشده از یک دستگاه باید همیشه از اول بلاک شروع شود. به عنوان مثال، این درست نیست تا پخش داده PCM را از وسط یک نمونه شروع کنیم.
۱ Sound Card
۲ Pitch
۳ volumes
۴ duration
۵ ADC
۶ Sampling
۷ Speaker
۸ Cone
۹ Sample Rate
۱۰ Nyquist
۱۱ Bit per sample
۱۲ Sample
۱۳ Modem
۱۴ Audio
۱۵ Pitch
۱۶ Perceived Loudness
۱۷ Stereo
۱۸ Mono
۱۹ Resolution
۲۰ Audio Channel
۲۱ Two-Channel Mono
۲۲ Block alignment
۲۳ interrupt
نگارنده:
علی یعسوبی