Файл MP3 (MPEG-1/2 Audio Layer III)MP3 (MPEG-1/2 Audio Layer III) — Формат сжатия звука с потерями: гибридный банк фильтров, психоакустическая модель, неравномерное квантование и коды Хаффмана в кадрах по 1152 отсчёта. с битрейтом (bit rate)битрейт (bit rate) — Число бит на секунду звучания. У несжатого PCM равен произведению частоты дискретизации, разрядности и числа каналов: для CD 1 411 200 бит/с. 128 кбит/с в 11–12 раз меньше несжатой стереозаписи 16 бит и при этом рассчитан звучать близко к оригиналу. Кодек (codec)кодек (codec) — Алгоритм или программа, которая кодирует сигнал в сжатый поток и декодирует его обратно. Формат файла при этом задаёт упаковку данных и метаданных. отбрасывает ту часть сигнала, которую слух в этот момент, по оценке модели слуха, не заметит. Чтобы понять, что именно можно отбросить, нужна психоакустика (psychoacoustics)психоакустика (psychoacoustics) — Раздел науки о связи физических свойств звука с тем, что слышит человек: громкостью, высотой, направлением и слышимостью одних звуков на фоне других.: она изучает, как физические свойства звука связаны с тем, что слышит человек.
Физическая величина и ощущение
Звуковую волну (sound wave)звуковая волна (sound wave) — Распространяющиеся в упругой среде колебания давления: частицы среды колеблются около своих мест и передают сжатия и разрежения соседним. можно измерить приборами: микрофон (microphone)микрофон (microphone) — Устройство, преобразующее звуковые колебания в электрический сигнал. В идеальной модели напряжение на выходе пропорционально звуковому давлению. и анализатор покажут давление, частоты (frequency)частота (frequency) — Число полных колебаний за секунду. Обозначается f и измеряется в герцах; 1 Гц означает одно колебание в секунду. и время прихода к каждому уху. Ощущения измеряют иначе. Слушателю дают звуки и просят ответить, слышен ли звук, какой из двух громче или выше, откуда он пришёл. Ответы одного человека меняются от попытки к попытке, поэтому результаты усредняют по повторам и группе людей.
Из-за этого пороги в психоакустике статистические. Например, ISO 226:2023 определяет порог слышимости (threshold of hearing)порог слышимости (threshold of hearing) — Минимальный уровень звука, который слушатель способен обнаружить в заданных условиях. Зависит от частоты и слушателя; опорные 20 мкПа не задают его для всех частот. как уровень, при котором человек правильно обнаруживает звук в 50 % повторных попыток в заданных условиях (ISO 226:2023, раздел 3.7). Основные пары «величина — ощущение», которые разбирает статья, собраны в таблице 1.
Число процентов имеет смысл вместе с заданием. Если в каждом опыте звучат два отрезка и нужно выбрать, в каком был тон, случайное угадывание уже даёт 50 % правильных ответов. Для такой процедуры порог задают выше случайного результата. Если слушатель сам меняет уровень до едва слышимого звука, получается другая процедура. Поэтому при сравнении порогов важно знать, что слушатель делал и как обрабатывали его ответы (Fastl, Zwicker, §1.3–1.4, с. 8–14).
| Физическая величина | Ощущение | Раздел |
|---|---|---|
| Уровень звукового давления, дБ SPL | Громкость | Громкость |
| Частота, Гц | Высота тона | Высота тона |
| Состав гармоник, их уровни и изменение во времени | Тембр | Высота сложного звука |
| Спектр и время звучания соседних звуков | Слышимость слабого звука | Маскировка |
| Разность времени и уровня у двух ушей | Направление на источник | Направление звука |
| Уровень, спектр и отражения у слушателя | Расстояние до источника | Расстояние до источника |
Порог слышимости и слуховая область
Опорное давление шкалы дБ SPL, 20 мкПа, близко к порогу слышимости, но порог зависит от частоты. Рисунок 1 показывает его по данным ISO 226:2023 для чистых тонов (pure tone)чистый тон (pure tone) — Синусоидальное звуковое колебание одной частоты. Служит простой моделью для изучения частоты, фазы и громкости., свободного поля и слушателей 18–25 лет с нормальным слухом. На 1 кГц порог равен 2,4 дБ SPL. Около 3–4 кГц он опускается ниже нуля: −6,0 дБ SPL на 3 150 Гц. Тону 100 Гц нужно 26,5 дБ SPL, а тону 20 Гц — 78,1 дБ SPL (ISO 226:2023, таблица 1).
Верхнюю границу задаёт болевой порог (threshold of pain)болевой порог (threshold of pain) — Уровень звука, при котором слушание становится болезненным. Условно около 130 дБ SPL; задаёт верхнюю границу слуховой области.. Его указывают условно: около 130 дБ SPL (HyperPhysics, Dynamic Range of Hearing) или 140 дБ SPL и выше (Painter, Spanias, раздел II). Область между двумя границами называют слуховой. От 0 до 130 дБ SPL давление растёт примерно в 3 миллиона раз: .
Громкость
Громкость (loudness)громкость (loudness) — Ощущение того, насколько сильным кажется звук. Зависит от звукового давления, частотного состава и условий восприятия. зависит не только от давления, но и от частоты. Как сравнивать громкость тонов разной частоты с помощью фонов (phon)фон (phon) — Единица уровня громкости. 40 фон означает равную громкость с опорным чистым тоном 1 кГц при 40 дБ SPL в свободном поле перед слушателем. и кривых равной громкости (equal-loudness contour)кривая равной громкости (equal-loudness contour) — Линия на графике частоты и уровня звукового давления, соединяющая чистые тоны, воспринимаемые одинаково громкими в заданных условиях., подробно разобрано в отдельной статье.
Фоны не показывают, во сколько раз громче кажется звук: 80 фон не означают «вдвое громче, чем 40». Для такой оценки используют соны (sone)сон (sone) — Единица громкости как ощущения: 1 сон — громкость тона 1 кГц при 40 дБ SPL. Выше примерно 40 фон прибавка 10 фон приблизительно удваивает громкость; около порога слышимости зависимость другая.. Звук 40 фон принимают за 1 сон. Выше примерно 40 фон действует приближённое правило: прибавка 10 фон удваивает громкость. Поэтому 50 фон соответствуют примерно 2 сонам, 60 фон — 4 сонам, 80 фон — 16 сонам (Fastl, Zwicker, §8.2, с. 205–207).
Для тона 1 кГц рост уровня с 40 до 50 дБ SPL означает десятикратный рост интенсивности и примерно двукратный рост громкости. Удвоение давления даёт только +6 дБ. Но около порога слышимости зависимость круче: в приведённых в книге опытах при исходном уровне 20 дБ SPL для удвоения громкости требовалось около +5 дБ, при 10 дБ SPL — около +2 дБ. Продолжать правило «+10 дБ» до самых тихих звуков нельзя (там же, рис. 8.3).
Громкость короткого звука
Громкость зависит и от времени звучания. В опыте с тоном 2 кГц при 57 дБ SPL длинный тон давал около 4 сонов. При длительности больше примерно 100 мс громкость почти не менялась; сокращение до 10 мс уменьшало её примерно вдвое. Включение и выключение тона были плавными, чтобы уменьшить изменение спектра (spectrum)спектр (spectrum) — Представление сигнала через его частотные составляющие: их частоты, амплитуды и фазы. Ограничение спектра задаёт, какие частоты допускаются в сигнале. из-за короткого импульса (Fastl, Zwicker, §8.5, с. 216–218, рис. 8.12).
Слуху нужно время для формирования ощущения громкости. Поэтому одинаковые пиковый уровень (peak level)пиковый уровень (peak level) — Уровень наибольшего модуля отсчёта в выбранном фрагменте. В dBFS показывает запас до номинальной полной шкалы; межотсчётные пики здесь не учитываются. или RMS (RMS level)среднеквадратичный уровень (RMS level) — Корень из среднего квадрата значений сигнала на выбранном интервале. Имеет те же единицы, что и сигнал; у синусоиды за целое число периодов равен амплитуде, делённой на √2. во время звучания ещё не означают одинаковую громкость короткого удара и протяжного звука. Граница около 100 мс относится к описанным опытам; она не задаёт универсального времени усреднения для любой музыки.
Различимый шаг уровня
Наименьшее изменение уровня, которое замечает слух, называют едва заметной разностью (just noticeable difference, JND)едва заметная разность (just noticeable difference, JND) — Наименьшее изменение уровня, частоты или другой величины звука, которое слушатель замечает при сравнении. Определяется статистически, по доле правильных ответов.. Её определяют по ответам в повторных сравнениях: например, поочерёдно дают два тона одной частоты и разного уровня и спрашивают, какой громче. Уровень, длительность звуков, пауза и способ сравнения влияют на результат (Fastl, Zwicker, §7.1.2, с. 180–181).
В одном наборе опытов с тоном 1 кГц различимый шаг двух последовательных уровней уменьшался примерно с 0,7 до 0,3 дБ при росте уровня с 30 до 70 дБ SPL. Обнаружить плавную модуляцию (modulation)модуляция (modulation) — Изменение параметра одного сигнала под действием другого. Например, управляющий сигнал LFO может периодически менять амплитуду звука или частоту генератора. уровня того же тона было труднее: требовалось примерно в 2,5 раза большее изменение. В другом опыте сокращение тона с 200 до 2 мс увеличивало различимый шаг почти в пять раз (там же, рис. 7.4 и 7.6). Ориентир «около 1 дБ» полезен как порядок величины, но не как предел слуха во всех условиях.
Высота тона
Высота тона (pitch)высота тона (pitch) — Ощущение, по которому звук воспринимают как низкий или высокий. Для чистого тона растёт с частотой; физическая частота и ощущение высоты — разные величины. синусоидального звука растёт с его частотой. Во внутреннем ухе колебания возбуждают основную мембрану улитки, и разные частоты сильнее всего раскачивают разные её участки. Нервные окончания вдоль мембраны поэтому «настроены» на разные частоты (Painter, Spanias, раздел II-B).
При последовательном сравнении чистых тонов длительностью больше 200 мс и достаточно выше порога слышимости различимая разность частот ниже 500 Гц может составлять около 1 Гц. Отсюда пример 440 и 441 Гц: разность всего около 0,23 %, а услышать её возможно. Короткие тоны и звуки около порога различать труднее. Обнаружение плавного изменения частоты внутри одного тона тоже даёт другой порог (Fastl, Zwicker, §7.2.2, с. 185–186).
Высота всё же не совпадает с частотой полностью. В опытах Терхардта при росте уровня с 60 до 90 дБ высота тона 6 кГц казалась выше больше чем на 0,3 полутона, а тона 200 Гц — ниже примерно на 0,2 полутона, хотя частоты не менялись (HyperPhysics, Effect of Loudness Changes on Perceived Pitch). У звуков музыкальных инструментов такой сдвиг меньше.
Ноты, октавы и интервалы
Музыкальный интервал (musical interval)музыкальный интервал (musical interval) — Расстояние между высотами двух нот. Интервал называют мелодическим при последовательном звучании нот и гармоническим при одновременном. описывает расстояние между высотами двух нот. Если ноты звучат одна за другой, интервал называют мелодическим, если одновременно — гармоническим (Hutchinson, §5.1). Слово «гармонический» здесь относится к сочетанию нот; оно не означает, что одна нота обязательно является гармоникой другой.
Октава (octave)октава (octave) — Музыкальный интервал между нотами одного названия в соседних регистрах. Соответствует отношению частот 2:1. связывает ноты одного названия в соседних регистрах: например, ля первой и ля второй октавы. В буквенной системе это A4 и A5; цифра регистра меняется при переходе от B к C, поэтому до первой октавы обозначают C4 (Hutchinson, §1.3). При настройке ля первой октавы на 440 Гц ля следующей октавы имеет частоту 880 Гц: октава соответствует отношению частот 2:1.
В равномерной темперации октава делится на 12 полутонов с одинаковым отношением частот. От 220 до 440 Гц и от 440 до 880 Гц — одинаковый интервал, хотя разности в герцах равны 220 и 440. Поэтому расстояние по высоте удобно сравнивать по отношению частот и логарифмической шкале (logarithmic scale)логарифмическая шкала (logarithmic scale) — Шкала, на которой равные расстояния соответствуют одинаковым отношениям положительных величин. Например, 100, 1000 и 10 000 Гц расположены на равных расстояниях., а не только по числу герц (HyperPhysics, Cents).
Высота сложного звука
Многие звуки музыкальных инструментов имеют гармонический спектр: составляющие с частотами, кратными основной. Слух обычно связывает их с одной выраженной высотой, близкой к основной частоте. Ударные и некоторые другие инструменты дают негармонические спектры, для которых такое описание не подходит (Fastl, Zwicker, §5.3, с. 119–122). Ля на скрипке и чистый тон 440 Гц могут иметь близкую высоту, но различаются тембром (timbre)тембр (timbre) — Свойство слухового ощущения, по которому различают два звука одинаковой высоты и громкости. Зависит от состава спектра и его изменения во времени.. Американский стандарт ANSI определяет тембр как свойство ощущения, по которому слушатель различает два звука одинаковой высоты и громкости. Тембр зависит от состава спектра и его изменения во времени, в том числе от того, как звук нарастает и затухает (Алдошина, «Основы психоакустики», ч. 1 и 14.1).
Основная частота при этом не обязана присутствовать в спектре. Если из гармонического звука с составляющими 100, 200, 300, 400 Гц… убрать 100 Гц, высота может сохраниться около 100 Гц. Это явление называют пропущенной основной частотой (missing fundamental)пропущенная основная частота (missing fundamental) — Восприятие высоты гармонического звука около его основной частоты, когда составляющей с этой частотой в спектре нет. Зависит от слышимых гармоник.; воспринимаемую высоту также называют виртуальной (virtual pitch). Телефонная полоса может убрать основную частоту мужского голоса, но оставшиеся гармоники всё ещё дают ощущение низкого голоса (Fastl, Zwicker, §5.3–5.4, с. 120–124).
В учебном примере 300, 400 и 500 Гц — гармоники 3, 4 и 5 частоты 100 Гц. Наибольший общий делитель помогает найти эту общую основу. Однако он не является общей формулой высоты: важны номера и уровни слышимых гармоник, а для негармонического спектра высота может смещаться или становиться неоднозначной. В опыте из книги компоненты 1 500, 1 800, 2 100, 2 400 и 2 700 Гц давали высоту, совпадающую с чистым тоном около 290 Гц. Сдвиг всех компонентов вниз на 100 Гц сохранял расстояние между ними 300 Гц, но совпадающая по высоте частота менялась примерно до 270 Гц (там же, с. 122, рис. 5.11).
Ощущение может иметь и разную выраженность высоты (pitch strength)выраженность высоты (pitch strength) — Степень отчётливости ощущения высоты у звука. Отличается от самой высоты: звук может быть высоким, но иметь слабо выраженную высоту.. У синусоиды высота отчётлива; у шума с ограниченной полосой она может быть слабой, хотя его ещё можно сопоставить по высоте с тоном. Это отдельная характеристика: «высокий звук» и «звук с ясно различимой высотой» означают разное (Fastl, Zwicker, §5.7, с. 135–136).
Восприятие высоты объясняют теория места и временная теория: по первой слух определяет, какие участки основной мембраны раскачиваются сильнее, по второй — с каким периодом (period)период (period) — Время одного полного повторения периодического колебания. Обозначается T, измеряется в секундах и связано с частотой как T = 1/f. идут нервные импульсы, синхронизированные с колебаниями мембраны. Первые 6–7 гармоник возбуждают разные участки мембраны и разделяются по месту. Более высокие гармоники попадают на один участок, их сумма колеблется с периодом основной частоты, и высоту дают интервалы между импульсами. Современные модели объединяют обе теории. Синхронизация импульсов с колебаниями работает примерно до 5 кГц. Выше даже музыканты с абсолютным слухом с трудом называют ноты, а клавиатура рояля заканчивается ниже 5 кГц (Алдошина, ч. 1).
Звук состоит из составляющих 300, 400 и 500 Гц одинакового уровня. Какую высоту услышит слушатель?
Можно услышать виртуальную высоту около 100 Гц, хотя такой составляющей в спектре нет. Это гармоники 3, 4 и 5 общей основной частоты 100 Гц. Пример предполагает, что составляющие слышны; он не задаёт универсального правила для любого спектра.
Критические полосы
Основную мембрану удобно представить как набор сильно перекрывающихся полосовых фильтров. Ширину такого слухового фильтра описывает критическая полоса (critical band)критическая полоса (critical band) — Полоса частот, в пределах которой слух объединяет составляющие при оценке громкости и маскировки. Около 100 Гц до 500 Гц, выше — примерно 20 % средней частоты.. Её измеряют, например, так: узкополосный шум постоянного уровня расширяют, и его громкость не меняется, пока полоса шума не шире критической. Дальше энергия попадает в соседние «каналы» слуха, и громкость начинает расти (Painter, Spanias, раздел II-B).
До 500 Гц критическая полоса примерно постоянна, около 100 Гц. Выше она расширяется и составляет порядка 20 % средней частоты. Если идти по частоте шагами в одну критическую полосу, слышимый диапазон делится примерно на 24 полосы. Шаг в одну полосу называют барком (Bark)барк (Bark) — Единица шкалы критических полос: расстояние в 1 барк соответствует ширине одной критической полосы. Слышимый диапазон делят примерно на 24 полосы. (Julius O. Smith, Jonathan S. Abel, The Bark Frequency Scale). Несколько полос из идеализированного набора приведены в таблице 2.
| Полоса | Границы, Гц | Средняя частота, Гц | Ширина, Гц |
|---|---|---|---|
| 1 | 0–100 | 50 | 100 |
| 5 | 400–510 | 450 | 110 |
| 9 | 920–1 080 | 1 000 | 160 |
| 13 | 1 720–2 000 | 1 850 | 280 |
| 17 | 3 150–3 700 | 3 400 | 550 |
| 21 | 6 400–7 700 | 7 000 | 1 300 |
| 24 | 12 000–15 500 | 13 500 | 3 500 |
На низких частотах полоса шириной 100 Гц охватывает большое отношение частот: от 100 до 200 Гц — целую октаву. На высоких частотах полоса 12 000–15 500 Гц шире в 35 раз по герцам, но охватывает меньше октавы. Поэтому слух различает близкие по частоте составляющие лучше внизу диапазона, если считать в герцах, и примерно одинаково по всему диапазону, если считать в барках.
Набор полос — идеализация. Полосы не стоят на фиксированных частотах: они выбраны из непрерывного изменения частотной избирательности слуха (Smith, Abel). Другие измерения формы слуховых фильтров дают шкалу эквивалентных прямоугольных полос (ERB), у которой фильтры ниже 500 Гц уже, чем в таблице (Painter, Spanias, раздел II-B).
Громкость сложного звука
Критические полосы помогают объяснить, как складывается громкость нескольких звуков. Составляющие, близкие по частоте, возбуждают одну область слуховых фильтров; увеличение мощности в этой области даёт сравнительно небольшой прирост громкости. При достаточном разнесении по частоте возбуждение охватывает больше областей, и громкость суммы может приблизиться к сумме громкостей отдельных звуков (Fastl, Zwicker, §8.7, с. 220–223).
Для приближённого расчёта возьмём два независимых узкополосных шума около 1 кГц, каждый громкостью 4 сона и уровнем около 60 дБ SPL. Их мощности складываются: уровень суммы растёт на дБ. Если считать уровень громкости (loudness level)уровень громкости (loudness level) — Величина в фонах: численно равна уровню в дБ SPL опорного чистого тона 1 кГц в свободном поле перед слушателем, воспринимаемого столь же громким. суммы около 63 фон, правило из раздела о громкости даёт сона. Это гораздо меньше 4 + 4 = 8 сонов, к которым сумма могла бы приблизиться при достаточном разнесении звуков по частоте. Расчёт иллюстрирует два предельных случая; реальная громкость зависит от спектров и взаимной маскировки (auditory masking)слуховая маскировка (auditory masking) — Снижение слышимости одного звука из-за присутствия другого. Из-за маскировки восприятие сложного звука нельзя определить только по кривым равной громкости чистых тонов..
При умеренных уровнях широкополосный звук поэтому может казаться громче узкополосного с тем же общим уровнем звукового давления. В модели Цвикера сначала находят распределение возбуждения по шкале барков, затем переводят его в громкость отдельных участков и суммируют их вклад. Такое распределение называют удельной громкостью (specific loudness)удельная громкость (specific loudness) — Распределение вклада в громкость по шкале критических полос, измеряемое в сонах на барк. Суммирование этого вклада по шкале даёт общую громкость в модели Цвикера.; оно учитывает порог слышимости, нелинейный рост ощущения и перекрытие слуховых фильтров (Fastl, Zwicker, §8.7, с. 220–227). Табличные границы 24 полос удобны для расчёта, но переход через такую границу сам по себе не заставляет громкости внезапно сложиться.
Два узкополосных шума по 60 фон звучат вместе. В каком случае сумма громче: шумы около 1 000 и 1 050 Гц или около 1 000 и 1 500 Гц?
При прочих равных ожидается более громкая сумма во втором случае: разнесение на 500 Гц больше ширины критической полосы в этой области, поэтому звуки возбуждают более разделённые области слуховых фильтров. При разнесении на 50 Гц их вклад сильнее объединяется. Нельзя получить точные 8 сонов только из того, что звуки попали в разные строки таблицы: нужны спектры, уровни и учёт взаимной маскировки.
Частотная маскировка
Громкий звук может сделать неслышимым более тихий: это слуховая маскировкаслуховая маскировка (auditory masking) — Снижение слышимости одного звука из-за присутствия другого. Из-за маскировки восприятие сложного звука нельзя определить только по кривым равной громкости чистых тонов.. Маскируемый звук при этом существует физически, микрофон его записывает. Но в присутствии маскера его порог обнаружения поднимается. Новый порог называют порогом маскировки (masking threshold)порог маскировки (masking threshold) — Уровень, ниже которого тестовый звук не слышен при наличии маскирующего звука. Выше порога слышимости в тишине рядом с маскером по частоте и времени..
Сильнее всего маскер действует на звуки в своей критической полосе. Например, шум шириной в одну критическую полосу около 410 Гц с уровнем 80 дБ SPL маскирует тон той же частоты вплоть до 76 дБ SPL. Чистый тон маскирует хуже: тон 1 кГц с уровнем 80 дБ SPL скрывает узкополосный шум вокруг 1 кГц только до 56 дБ SPL. Шум оказывается более сильным маскером, чем тон того же уровня (Painter, Spanias, раздел II-C, рис. 8).
Действие маскера распространяется и на соседние полосы. В моделях для кодеков порог убывает примерно на 25 дБ на каждый барк вниз по частоте и только на 10 дБ на барк вверх. Маскировка сильнее «тянется» к высоким частотам. Рисунок 2 показывает такую модель для тона 1 кГц с уровнем 80 дБ SPL.
Асимметрию объясняет устройство улитки. Колебания входят в неё со стороны овального окна, где расположены участки высоких частот, и бегущей волной движутся к вершине, где расположены участки низких частот. Волна низкого звука проходит по пути всю мембрану и раскачивает в том числе участки высоких частот. Волна высокого звука затухает раньше и до низкочастотных участков почти не доходит. С ростом уровня маскера маскировка вверх по частоте расширяется сильнее, чем вниз, и асимметрия растёт. Поэтому громкие низкие звуки маскируют широкую область частот выше себя, а высокие — только узкую область рядом (Алдошина, «Основы психоакустики», ч. 6).
Как читать рисунок: шум, который лежит ниже обеих кривых, по модели не слышен. На 2 кГц, на октаву выше маскера, модель даёт порог около 16 дБ SPL при пороге в тишине −1,3 дБ SPL. Значит, узкополосный шум около 2 кГц с уровнем 10 дБ SPL в тишине был бы слышен, а рядом с громким тоном 1 кГц — нет. На 500 Гц, на октаву ниже, модельный порог около −8 дБ SPL, ниже порога в тишине 4,4 дБ SPL: маскер здесь уже не влияет. Закрашенная область, где маскировка заметна, тянется примерно от 570 Гц до 2,7 кГц.
Где маскировка тоном 1 кГц, 80 дБ SPL действует дальше: на октаву ниже (500 Гц) или на октаву выше (2 кГц)?
На октаву выше. По модели рисунка 2 на 2 кГц порог маскировки около 16 дБ SPL, что выше порога в тишине −1,3 дБ SPL. На 500 Гц модельный порог около −8 дБ SPL, ниже порога в тишине 4,4 дБ SPL, поэтому маскер слышимость не меняет. Маскировка распространяется вверх по частоте сильнее, чем вниз.
Частичная маскировка
Маскировка может уменьшить громкость звука, даже если он остаётся слышен. Это частичная маскировка (partial masking)частичная маскировка (partial masking) — Уменьшение воспринимаемой громкости звука в присутствии маскера, когда звук всё ещё слышен.. На рис. 8.10 книги Fastl и Zwicker показано, как розовый шум (pink noise)розовый шум (pink noise) — Шум, PSD которого приблизительно обратно пропорциональна частоте в рабочей полосе: спад около 3 дБ на октаву и примерно одинаковая мощность октав. уменьшает громкость тона 1 кГц: около поднятого порога громкость тона мала, а с увеличением его уровня приближается к громкости без шума. В описанных опытах различие становилось небольшим примерно через 20–30 дБ над порогом маскировки (§8.4, с. 214–215).
Поэтому тихая партия в миксе может ещё различаться по нотам, но казаться слабее, чем при отдельном прослушивании. Порог маскировки показывает границу обнаружения; громкость выше этой границы требует дополнительной оценки.
Временная маскировка
Маскировка действует не только во время звучания маскера. Есть временная маскировка (temporal masking)временная маскировка (temporal masking) — Маскировка тестового звука, звучащего до начала маскера (предмаскировка) или после его окончания (постмаскировка).: тихий звук может быть не слышен незадолго до начала громкого звука и некоторое время после его окончания. Первое называют предмаскировкой, второе — постмаскировкой.
Заметная предмаскировка длится всего около 1–2 мс: в одном исследовании уже за 2 мс до начала маскера порог был на 25 дБ ниже, чем при одновременном звучании. Постмаскировка продолжается от 50 до 300 мс, в зависимости от уровня и длительности маскера (Painter, Spanias, раздел II-D). Форму этих участков показывает схема на рисунке 3.
Предмаскировка изучена хуже постмаскировки. В книге Fastl и Zwicker описано её действие примерно за 20 мс до маскера; авторы отмечают необходимость тренированных испытуемых и худшую воспроизводимость результатов (§4.4.2, с. 82). На рисунке 1–2 мс относятся к сильному подъёму порога; более слабый измеримый эффект может начинаться раньше. Сравнивать длительности нужно с учётом звуков, критерия обнаружения и опыта слушателя (Painter, Spanias, раздел II-D).
Постмаскировка тоже не имеет одного времени спада. При одинаковом уровне маскера короткий шумовой импульс и длинный шум дают разные кривые восстановления порога; описанные данные не сводятся к одному экспоненциальному затуханию (Fastl, Zwicker, §4.4.3, с. 83–84). Рисунок 3 показывает направление изменений, а не модель для расчёта любого сигнала.
Пульсация и шероховатость звука
Медленное периодическое изменение амплитуды (amplitude)амплитуда (amplitude) — Наибольший модуль отклонения колеблющейся величины от равновесного значения. Для синусоиды обозначается A; единицы совпадают с единицами сигнала. слышится как пульсация: громкость то растёт, то уменьшается. Сила флуктуаций (fluctuation strength)сила флуктуаций (fluctuation strength) — Выраженность ощущения медленных изменений звука, например пульсации громкости при амплитудной модуляции. Зависит от скорости, глубины и самого сигнала. описывает, насколько выражено это ощущение. В опытах с амплитудно-модулированными тоном и шумом, а также с частотной модуляцией тона оно достигало максимума при скорости около 4 Гц. Ускорение изменений не делает пульсацию всё более выраженной (Fastl, Zwicker, §10.1, с. 247–249).
При более быстрой модуляции появляется шероховатость (roughness)шероховатость (roughness) — Ощущение дрожащего, грубого характера звука при быстрых изменениях его амплитуды или частоты. Зависит от скорости изменений, глубины и спектра.: отдельные подъёмы и спады хуже различаются, а звук приобретает дрожащий, грубый характер. Для тона 1 кГц с полной синусоидальной амплитудной модуляцией она начинала нарастать около 15 Гц и достигала максимума около 70 Гц. Переход от пульсации к шероховатости плавный; максимум зависит от частоты исходного тона и глубины модуляции (modulation depth)глубина модуляции (modulation depth) — Величина изменения управляемого параметра. Её единицы и шкала зависят от параметра: например, глубина может задавать отклонение частоты в герцах или долю ослабления звука. (Fastl, Zwicker, гл. 11, с. 257–259).
На ещё больших скоростях могут отдельно различаться спектральные составляющие модулированного звука. Поэтому одна и та же операция изменения амплитуды с ростом скорости проходит от медленного качания громкости к изменению тембра. Тремоло (tremolo)тремоло (tremolo) — Эффект периодического изменения амплитуды аудиосигнала. Скорость пульсации задаёт частота управляющего генератора, а диапазон усиления зависит от глубины и способа её преобразования. и LFO (low-frequency oscillator, LFO)низкочастотный генератор (low-frequency oscillator, LFO) — Генератор медленно повторяющегося управляющего сигнала, которым изменяют параметры звука, например усиление, частоту или панораму. Общей строгой верхней границы частоты у LFO нет. описывают, как создаётся такое управление; психоакустика объясняет, как оно воспринимается.
Если увеличить скорость амплитудной модуляции тона 1 кГц с 4 до 70 Гц при той же полной глубине, станет ли он просто чаще пульсировать?
Изменится характер ощущения: при 4 Гц подъёмы и спады громкости хорошо различаются, а около 70 Гц для этого сигнала выражена шероховатость. Числа относятся к описанному тону и способу модуляции; для других сигналов максимум может отличаться.
Направление звука
Если источник сбоку, звук приходит к ближнему уху раньше, чем к дальнему. Это межушная разность времени (interaural time difference, ITD)межушная разность времени (interaural time difference, ITD) — Разность моментов прихода звука к левому и правому уху. У человека не превышает долей миллисекунды и важна для направления на низких частотах.. Расстояние между ушами около 21,5 см, и при скорости звука (speed of sound)скорость звука (speed of sound) — Скорость распространения звуковой волны в среде. Измеряется в м/с; в воздухе при 20 °C составляет примерно 343 м/с. 343 м/с наибольшая задержка близка к 0,63 мс (Wikipedia, Sound localization, Duplex theory). Модели головы дают оценки до 0,76 мс (Hartmann, Macaulay, раздел Spherical Head Model).
Для тонов эта подсказка работает примерно до 1 500 Гц (Hartmann, Macaulay, раздел Human ITD Sensitivity). Выше мешает короткий период колебаний: у тона 5 кГц он равен 0,2 мс. Задержка на 0,6 мс равна трём периодам, и колебания у двух ушей совпадают по фазе (phase)фаза (phase) — Положение внутри периода колебания, выраженное углом: полный период соответствует 360°, или 2π радиан. Начальная фаза — её значение в момент t = 0. так же, как при нулевой задержке. По фазе тона высокой частоты направление однозначно не определить.
На высоких частотах помогает другая подсказка — межушная разность уровней (interaural level difference, ILD)межушная разность уровней (interaural level difference, ILD) — Разность уровней звука у двух ушей из-за звуковой тени головы. Растёт с частотой и важна для направления на высоких частотах.. Голова отбрасывает звуковую тень, поэтому у дальнего уха звук слабее. Длина волны (wavelength)длина волны (wavelength) — Расстояние между ближайшими точками волны в одинаковой фазе, например соседними сжатиями. Обозначается λ, измеряется в метрах; λ = c/f. тона 5 кГц около 7 см, это меньше головы. Длинные волны низких частот огибают голову, и разность уровней у них мала. Для источника точно сбоку разность растёт с частотой и на 5 кГц достигает примерно 20 дБ (Алдошина, «Основы психоакустики», ч. 4). Выше примерно 1 500 Гц слух опирается в основном на разность уровней, ниже 1 000 Гц — на разность времени, между ними работают обе (Wikipedia, Sound localization, Duplex theory).
Двух подсказок недостаточно, чтобы отличить источник спереди от источника сзади: при симметричном расположении разности времени и уровней одинаковы. В общем случае одинаковые разности дают все направления на поверхности конуса, ось которого проходит через оба уха. Его называют конусом неопределённости (cone of confusion)конус неопределённости (cone of confusion) — Направления, для которых межушные разности времени и уровня одинаковы. По этим двум подсказкам источники на таком конусе не различить.; пара «спереди — сзади» — частный случай (Алдошина, ч. 4). При повороте головы разности меняются, и по-разному для разных направлений на конусе (Wikipedia, Sound localization). Кроме того, ушные раковины, голова и торс по-разному меняют спектр звука, пришедшего с разных направлений (Wikipedia, Sound localization).
Частотную характеристику пути звука от источника до барабанной перепонки называют передаточной функцией головы (head-related transfer function, HRTF)передаточная функция головы (head-related transfer function, HRTF) — Частотная характеристика пути звука от источника до барабанной перепонки с учётом головы, ушной раковины и торса. Своя для каждого направления прихода звука.. Её измеряют микрофонами в слуховых каналах, и для каждого направления она своя. Ушная раковина сильнее всего меняет спектр на высоких частотах, примерно от 6 до 16 кГц (Алдошина, ч. 4). Поэтому широкополосные звуки локализуются лучше узкополосных (там же).
Точность направления зависит от того, откуда приходит звук. Блауэрт называет наименьшее изменение направления, которое замечает слух, размытостью локализации. Спереди она наименьшая: её нижний предел около 1°, в большинстве опытов — несколько градусов, для белого шума (white noise)белый шум (white noise) — Шум с постоянной спектральной плотностью мощности в рассматриваемой полосе. Полосы одинаковой ширины в герцах содержат одинаковую ожидаемую мощность. около ±3,6°. Для источника сбоку размытость в 3–10 раз больше, сзади примерно вдвое больше, чем спереди. По вертикали спереди она около 4° для белого шума, 9° для речи знакомого диктора и 17° для незнакомого голоса (Блауэрт, «Пространственный слух», § 2.1).
В наушниках звук обходит ушные раковины, и спектр у барабанной перепонки не соответствует никакому направлению снаружи. Звук тогда часто кажется расположенным внутри головы. Если перед наушниками поставить фильтр, который воспроизводит у ушей спектр звука от колонки, образ выходит за пределы головы (Блауэрт, § 2.3.2). На этом основана бинауральная обработка для наушников с передаточными функциями головы.
Почему по разности времени прихода трудно определить направление на тон 5 кГц, но легко на тон 300 Гц?
Период тона 300 Гц около 3,3 мс, это больше наибольшей задержки между ушами, около 0,6–0,8 мс. Каждой задержке соответствует свой сдвиг фазы. Период тона 5 кГц — 0,2 мс: задержка в несколько периодов даёт ту же фазу, что и нулевая или меньшая задержка, поэтому направление по фазе неоднозначно.
Эффект предшествования
В комнате к слушателю сначала приходит прямой звук (direct sound)прямой звук (direct sound) — Звук, приходящий от источника к слушателю без отражений от поверхностей., а затем отражения от стен с других направлений. Тем не менее источник слышен там, где он находится. Так проявляется эффект предшествования (precedence effect)эффект предшествования (precedence effect) — Направление на источник определяется по первому пришедшему звуку, а запоздавшие копии до порога эха не слышны как отдельные звуки.: если похожие звуки приходят с разных направлений с небольшой задержкой, направление определяет пришедший первым. Его описали Уоллах с соавторами в 1949 году и Хаас в 1951 году (Wikipedia, Precedence effect). В немецкой литературе его называют законом первой волны (Блауэрт, «Пространственный слух», § 3.1.2).
Удобнее всего наблюдать эффект на двух колонках стереосистемы с одинаковым сигналом. Без задержки слушатель на оси между колонками слышит один мнимый источник посередине. Если задерживать сигнал одной колонки, образ смещается к другой, которая звучит раньше: направление ещё складывается из сигналов обеих колонок. При задержке от 0,63 до 1 мс образ доходит до опережающей колонки и при дальнейшем росте задержки не смещается (Блауэрт, § 3.1.2). Запаздывающая колонка при этом не пропадает: её звук не слышен отдельно, но добавляет объём (Алдошина, «Основы психоакустики», ч. 5). Участки шкалы задержек собраны в таблице 3.
При ещё большей задержке запаздывающий звук начинает слышаться отдельно. Наименьшую такую задержку называют порогом эха (echo threshold)порог эха (echo threshold) — Наименьшая задержка, при которой запоздавшая копия звука слышна отдельно, как эхо. Для щелчков — единицы миллисекунд, для речи и музыки — десятки.. Он зависит от сигнала: в опытах Уоллаха звуки сливались при задержке 1–5 мс для щелчков и до 40 мс для речи или фортепиано (Wikipedia, Precedence effect). Чем больше сигнал похож на импульс, тем порог меньше; он зависит также от уровня прямого звука и направления отражения (Блауэрт, § 3.1.2). В опытах Хааса с речью при задержке 10–30 мс запаздывающий звук мог быть громче первого на величину до 10 дБ, а направление всё равно определял первый (Wikipedia, Precedence effect).
| Задержка | Что слышно |
|---|---|
| 0 | Один мнимый источник посередине |
| От 0 до 0,6–1 мс | Один источник, который смещается к опережающей колонке |
| От 1 мс до порога эха | Один источник в направлении опережающей колонки; запаздывающая добавляет объём |
| Выше порога эха: единицы миллисекунд для щелчков, десятки для речи и музыки | Запаздывающий звук слышен отдельно, как эхо |
На эффекте предшествования построен приём сведения, который Izhaki называет Haas trick. Моно-дорожку подают в оба канала, а в одном из них задерживают на 1–35 мс. Звук становится шире, хотя по-прежнему локализуется в незадержанном канале. При сложении каналов в моно (mono)моно (mono) — Аудиоформат с одним каналом. Кадр несжатых монофонических данных содержит один отсчёт. задержанная копия складывается с исходной и окрашивает тембр гребенчатой фильтрацией (comb filtering)гребенчатая фильтрация (comb filtering) — Ряд чередующихся подъёмов и провалов частотной характеристики, возникающий, например, при сложении сигнала с его задержанной копией., часто с потерей высоких частот; при задержке 30 мс окраска заметна меньше, чем при 5 мс (Izhaki, «Mixing Audio», гл. 11).
Расстояние до источника
Расстояние слух оценивает неточно: при смещении широкополосного источника в пределах от 50 до 150 см ошибки составляют 15–30 % (Алдошина, ч. 4). В свободном поле уровень звука падает на 6 дБ при каждом удвоении расстояния до источника (Алдошина, ч. 4). Но в опытах в заглушённой камере кажущееся расстояние зависело только от уровня у слушателя, а ощущение вдвое большего расстояния возникало лишь при снижении уровня более чем на 20 дБ. Слуховой образ отстаёт от удаляющегося источника, и далеко отодвинуть его по одному уровню нельзя (Блауэрт, § 2.3.2). Помогает знакомство со звуком: если слушатель знает, как звучит источник, расстояние до него он оценивает точнее (Алдошина, ч. 4).
Другие признаки расстояния связаны со спектром и отражениями. На расстояниях больше примерно 15 м воздух сильнее поглощает высокие частоты, и звук становится темнее. В помещении с удалением источника уменьшается энергия прямого звука относительно отражённого; важны также задержка первых отражений относительно прямого звука и их уровень (Алдошина, ч. 4). В сведении глубину (depth)глубина (depth) — Впечатление расстояния до слухового образа; в миксе позволяет различать более близкие и более далёкие источники. задают в основном реверберацией (reverberation)реверберация (reverberation) — Звук множества отражений, сохраняющийся после прекращения звучания источника., причём глубина относительна: говорят, что инструмент ближе или дальше другого, а не на сколько метров (Izhaki, гл. 6).
Бинауральная демаскировка
Два уха помогают и расслышать звук на фоне шума. Среди разговоров нескольких человек слушатель может следить за одним голосом, а если закрыть одно ухо, разбирать речь становится труднее. Это называют эффектом вечеринки (Блауэрт, § 3.2.2).
В опытах с наушниками в оба уха подают одинаковые шум и тон, и тон маскируется так же, как при прослушивании одним ухом. Если перевернуть полярность тона в одном наушнике, оставив шум одинаковым, порог маскировки падает на 12–15 дБ. Такое снижение называют бинауральной демаскировкой (binaural unmasking)бинауральная демаскировка (binaural unmasking) — Снижение порога маскировки, когда сигнал и шум по-разному соотносятся по фазе или времени у двух ушей. Наибольшее на частотах 200–300 Гц., а его величину — бинауральной разностью уровней маскировки (binaural masking level difference). Она наибольшая для тонов 200–300 Гц, с ростом частоты быстро уменьшается и выше 3 кГц держится около 3 дБ (Блауэрт, § 3.2.2). Демаскировка возникает, когда при раздельном прослушивании сигнал и шум слышны в разных местах, и слух разделяет их по положению (Блауэрт, § 3.2.2).
Похожее наблюдение есть в практике сведения: при прослушивании в моно маскировка выражена сильнее, чем в стерео (stereo)стерео (stereo) — Аудиоформат с двумя каналами, обычно левым и правым. Кадр несжатых стереоданных содержит два отсчёта одного момента времени.. Поэтому некоторые звукорежиссёры устраняют маскировку эквалайзером (equalizer)эквалайзер (equalizer) — Обработчик, изменяющий относительные уровни частотных областей сигнала., слушая микс в моно (Izhaki, гл. 4).
Перцептивное кодирование
Форматы MP3 (MPEG-1/2 Layer 3) и AAC используют перцептивное кодирование (perceptual audio coding)перцептивное кодирование (perceptual audio coding) — Сжатие звука с потерями, при котором модель слуха оценивает порог маскировки, а шум квантования стараются удержать ниже него. Применяется в MP3 и AAC.. Кодер раскладывает сигнал набором фильтров на частотные составляющие. Психоакустическая модель по этому разложению оценивает порог маскировки, меняющийся во времени и по частоте. Затем составляющие квантуются так грубо, как позволяет порог: шум квантования (quantization)квантование (quantization) — Замена значения отсчёта одним из конечного набора представимых уровней. Разность между выбранным уровнем и исходным значением называется ошибкой квантования. стараются удержать ниже него (Brandenburg, раздел 1.1).
Там, где громкий звук поднимает порог, можно оставить больше шума и потратить меньше бит. Допустимым уровнем искажений обычно считают больший из двух порогов: маскировки и в тишине (Painter, Spanias, раздел II-C). Составляющую целиком ниже этого уровня можно не передавать. Отсюда экономия: для MP3 удачным считается около 1,33 бита на отсчёт (sample)отсчёт (sample) — Значение сигнала в один момент дискретизации, одно число. В звукозаписи его также называют сэмплом., то есть 128 кбит/с для стерео при 48 кГц. У AAC — около 1 бита на отсчёт, или 96 кбит/с (Brandenburg, раздел 5.6). Несжатая запись 16 бит при тех же параметрах занимает 48 000 × 16 × 2 = 1 536 000 бит/с. Это в 12 раз больше, чем 128 кбит/с.
Предмаскировка ограничивает длину блока кодера. Кодер обрабатывает сигнал блоками, и шум квантования распределяется по всему блоку. Если в середине блока резкая атака, например удар кастаньет, часть шума звучит до неё. Пока этот шум укладывается во время предмаскировки, он не слышен. Если выходит за него, появляется предэхо (pre-echo)предэхо (pre-echo) — Артефакт перцептивного кодирования: шум квантования распределяется по блоку и звучит раньше резкой атаки. Слышен, если выходит за время предмаскировки. — шумный «предвестник» удара. Чтобы его избежать, кодеры переключаются на короткие блоки и добавляют биты в таких местах (Brandenburg, раздел 5.1.2).
Психоакустика при сведении
Кривые равной громкости с ростом уровня становятся ровнее: на громком прослушивании низкие и высокие частоты кажутся сильнее относительно средних. Izhaki выводит отсюда правило «громче — значит лучше»: низ слушатели связывают с мощью, верх — с ясностью, и громкий вариант звучит привлекательнее. Кроме того, на большой громкости сильнее слышны отражения комнаты, и звук кажется объёмнее (Izhaki, «Mixing Audio», гл. 2).
Поэтому микс проверяют на разных уровнях. На тихом прослушивании низа и верха меньше, и бочка, которая звучит только на низких частотах, может пропасть. Если у неё есть составляющие на верхней середине, на тихом уровне она слышна лучше (Izhaki, гл. 2).
По той же причине варианты обработки сравнивают при одинаковой громкости. Подъём полосы на эквалайзере повышает и общий уровень, а компрессор (dynamic range compressor)компрессор (dynamic range compressor) — Устройство или программа, которая ослабляет сигнал, когда его уровень выше порога, и тем сужает динамический диапазон. его снижает. Без выравнивания громкости обработанный вариант легко принять за лучший после эквалайзера и за худший после компрессора. Для честного сравнения у эквалайзеров бывает регулятор выходного уровня, а у компрессоров — компенсация усиления (makeup gain)компенсация усиления (makeup gain) — Постоянное усиление после компрессора, которое возвращает общий уровень, сниженный сжатием. (Izhaki, гл. 14 и 16).
В миксе более громкий инструмент маскирует более тихие в своей области частот. Протяжные звуки, например плотный синтезаторный пэд, маскируют другие партии постоянно, а ударные — только в моменты ударов, поэтому уровень и эквализация протяжных партий требуют больше внимания (Izhaki, гл. 2). Из-за асимметрии частотной маскировки высокочастотные составляющие тихой партии легко теряются под громкими низкими звуками другой (Алдошина, «Основы психоакустики», ч. 6).
Пределы моделей
Психоакустические данные описывают среднего слушателя в определённых условиях: чистые тоны или узкополосный шум, наушники или свободное поле, тренированные испытуемые. Слух отдельного человека, реальная музыка и комната отличаются от этих условий. Модель кодека — инженерный компромисс, проверяемый прослушиванием: крупные контролируемые тесты прослушивания остаются основным способом сравнить кодеры (Brandenburg, раздел 5.5.1).
Источники
- Fastl H., Zwicker E. Psychoacoustics: Facts and Models. в списке литературы → — §1.3–1.4, с. 8–14: процедуры измерения; §4.4.2–4.4.3, с. 82–84: временная маскировка; §5.3–5.4, с. 119–124, и §5.7, с. 135–136: виртуальная и выраженная высота; §7.1.2, с. 180–181, и §7.2.2, с. 185–186: различимые изменения; §8.2, с. 205–207, §8.4–8.5, с. 214–218, и §8.7, с. 220–227: громкость, её длительность и частичная маскировка; гл. 10–11, с. 247–249 и 257–259: сила флуктуаций и шероховатость.
- Hutchinson R. Music Theory for the 21st-Century Classroom. в списке литературы → — §1.3. Octave Registers: названия нот и обозначения регистров; §5.1. Introduction to Intervals: мелодические и гармонические интервалы.
- Painter T., Spanias A. Perceptual Coding of Digital Audio. в списке литературы → — раздел II: порог слышимости, критические полосы и таблица 1, шкала барков (3), функция распространения маскировки (7), пороги (8) и (9), примеры рис. 8, временная маскировка.
- ISO 226:2023. Acoustics — Normal equal-loudness-level contours — открытый фрагмент: определение порога слышимости (3.7) и значения таблицы 1 для рис. 1 и 2.
- Smith J. O. III, Abel J. S. Bark and ERB Bilinear Transforms. The Bark Frequency Scale. в списке литературы → — 24 критические полосы и их границы.
- Brandenburg K. MP3 and AAC Explained. в списке литературы → — устройство перцептивного кодера, предэхо, битрейты MP3 и AAC, оценка качества.
- Nave C. R. HyperPhysics. Sensitivity of Human Ear, Pitch, Cents. в списке литературы → — динамический диапазон слуха, зависимость высоты от уровня, октава и полутон.
- Hartmann W. M., Macaulay E. J. Anatomical limits on interaural time differences: an ecological perspective. в списке литературы → — наибольшая межушная разность времени и предел чувствительности около 1 500 Гц.
- Wikipedia. Sound localization, раздел Duplex theory — разность времени и уровней, звуковая тень головы, частотные области подсказок, изменение разностей при повороте головы.
- Алдошина И. А. Основы психоакустики. в списке литературы → — ч. 1: высота сложного звука, пропущенная основная частота, теории места и временная; ч. 4 и 5: локализация, разность уровней у ушей, роль движения головы и ушной раковины, расстояние до источника, эффект предшествования; ч. 6: частотная маскировка и её асимметрия; ч. 9: едва заметная разность уровня; ч. 12: громкость сложных звуков и критические полосы; ч. 14.1: определение тембра.
- Блауэрт Й. Пространственный слух. в списке литературы → — § 2.1: размытость локализации по горизонтали и вертикали; § 2.3.2: расстояние до слухового образа и локализация внутри головы; § 3.1.2: закон первой волны и порог эха; § 3.2.2: бинауральная разность уровней маскировки.
- Izhaki R. Mixing Audio: Concepts, Practices and Tools. в списке литературы → — гл. 2, с. 11–14: «громче — значит лучше», проверка на разных уровнях, маскировка протяжными звуками; гл. 4, с. 39: эквализация в моно; гл. 6, с. 67–68: глубина микса; гл. 11, с. 167–168: Haas trick и сложение в моно; гл. 14, с. 236–237, и гл. 16, с. 284: сравнение при одинаковой громкости.
- Wikipedia. Precedence effect — опыты Уоллаха и Хааса, пределы слияния для щелчков и речи, уровень запаздывающего звука.
Связи
Связи списком
Ссылается на
- АЦП и ЦАП
- Белый и розовый шум: спектр и генерация
- Звук в пространстве: панорама, задержка, реверберация и мид-сайд
- Звуковая волна и аналоговый аудиосигнал
- Кривые равной громкости: как частота и уровень звука влияют на восприятие
- Математика для аудио
- Осцилляторы синтезатора: формы, расстройка и саб-осциллятор
- Принцип работы компрессора
- Теория музыки: ноты, ритм и гармония
Ссылаются сюда
- Белый и розовый шум: спектр и генерация
- Звук в пространстве: панорама, задержка, реверберация и мид-сайд
- Как устроен звук: первый обзор
- Математика для аудио
- Нормы громкости: вещание и стриминговые площадки
- Осцилляторы синтезатора: формы, расстройка и саб-осциллятор
- Теория музыки: ноты, ритм и гармония
- Форматы сжатия звука: AIFF, FLAC и MP3