Частотность букв русского алфавита¶
Частотность букв русского алфавита — количественная характеристика встречаемости букв в текстах на русском языке, используемая в криптографии, лингвистике, полиграфии и при проектировании клавиатурных раскладок.
¶Общие сведения
Частотность букв определяется как отношение числа вхождений конкретной буквы к общему числу букв в выборке текстов. Значения зависят от типа текста: в художественной литературе, научных статьях, технической документации и разговорной речи распределение букв заметно различается. Наиболее авторитетные данные получены на основе корпусов текстов объёмом в сотни тысяч и миллионы словоупотреблений.
¶Распределение частот
Для русского языка характерна высокая концентрация частот: десять наиболее употребительных букв покрывают около половины всего текста. Самая частотная буква — О, её доля составляет примерно 10–11 % в зависимости от выборки. Далее следуют Е (около 8–9 %), А (около 7–8 %) и И (около 6–7 %).
| Буква | Частота (примерно, %) |
|---|---|
| О | 10,5 |
| Е | 8,8 |
| А | 7,7 |
| И | 6,8 |
| Н | 6,6 |
| Т | 5,8 |
| С | 5,4 |
| Р | 4,8 |
| В | 4,5 |
| Л | 4,3 |
Наименее частотные буквы — Ф (около 0,2 %), Ъ (около 0,03 %), Э (около 0,3 %) и Ц (около 0,4 %). Буква Ё встречается значительно реже, чем Е, — её доля составляет около 0,2–0,3 % в текстах с последовательным употреблением ё, а в большинстве изданий она заменяется на «е».
¶Особенности русского распределения
В отличие от английского языка, где самой частотной буквой является «E», в русском лидирует «О». Это объясняется особенностями фонетики и морфологии: широким распространением полногласия (оро, оло, ере) и частотностью окончаний «-ов», «-ой», «-ом». Буквы, обозначающие твёрдые и мягкие согласные, распределены неравномерно: твёрдые варианты встречаются чаще.
Существенное влияние на частотность оказывает падежная система. Окончания родительного падежа множественного числа «-ов» и «-ей» повышают долю букв «В» и «Е». Частотность гласных в русском языке в сумме составляет около 38–40 % текста, что выше, чем во многих европейских языках.
¶Применение
¶Криптография и дешифрование
Частотный анализ — один из старейших методов взлома шифров подстановки. Сопоставление частот букв зашифрованного текста с известным распределением русского языка позволяет определить соответствия между шифрованными символами и буквами открытого текста. Метод впервые описан арабским учёным Аль-Кинди в IX веке, для русского языка применяется с XIX века.
¶Полиграфия и типографика
Данные о частотности используются при проектировании шрифтов для определения пропорций знаков и оптимизации кегля. Наборщики учитывают, что на буквы «О» и «Е» приходится наибольшая нагрузка, поэтому их начертания разрабатываются с особым вниманием к удобочитаемости.
¶Клавиатурные раскладки
Распределение частот положено в основу раскладки ЙЦУКЕН, созданной в начале XX века для уменьшения нагрузки на руки. Наиболее частотные буквы размещены в центральных рядах клавиатуры, под указательными и средними пальцами. Альтернативные эргономичные раскладки (например, Диктор) оптимизируют расположение букв с учётом более точных современных данных.
¶Лингвистика и корпусные исследования
Частотные словари русского языка (например, «Частотный словарь русского языка» под редакцией Л. Н. Засориной, 1977) содержат данные о распределении букв и словоформ. Эти материалы используются при изучении закономерностей языка, в автоматической обработке текстов и в лексикографии.
¶Методы измерения
Исторически частотность определялась ручным подсчётом в выборках текстов. С развитием компьютерных технологий и созданием Национального корпуса русского языка (объём более 600 миллионов словоупотреблений) точность оценок существенно возросла. Современные исследования используют методы математической статистики, учитывающие не только долю букв, но и их распределение по позициям в слове, сочетаемость с другими буквами и зависимость от жанра текста.
¶Интересные факты
- Буква «Ы» встречается только после твёрдых согласных и в начале немногих слов, что делает её частотность относительно стабильной (около 1,8 %).
- В русском языке нет букв, которые встречались бы исключительно в заимствованных словах, однако «Ф» и «Э» в исконно русских словах почти не встречаются.
- Частотность букв в стихотворной речи отличается от прозы: поэты чаще используют гласные для достижения ритмической структуры.
¶Источники
- Засорина Л. Н. (ред.). Частотный словарь русского языка. — М.: Русский язык, 1977.
- Национальный корпус русского языка. — ruscorpora.ru.
- Арапов М. В. Частотность букв // Лингвистический энциклопедический словарь. — М.: Советская энциклопедия, 1990.