С чего начинается дешифровка
Перед вами текст. Знаки незнакомые, язык неизвестен, переводчика нет.
Кажется, что дальше идти некуда: надо угадывать. На самом деле первый шаг — не догадка, а счёт, и он даёт больше, чем можно ожидать.
Сосчитайте, сколько в тексте различных знаков.
Это одно число уже говорит, с чем вы имеете дело.
Опыт 1: построить шкалу самому
Готовое правило вам никто не даст — постройте его сами по системам, тип которых известен.
| Письменность | Различных знаков | Что означает один знак |
|---|---|---|
| Латиница | 26 | звук |
| Русский алфавит | 33 | звук |
| Линейное письмо Б | 87 | слог |
| Рукописи майя | 355 | слог (и целые слова) |
| Китайское письмо | тысячи | слово или морфему |
Выпишите эти пары и посмотрите на них.
Закономерность видна сразу, и она не случайна: чем меньше знаков, тем меньше значит каждый. Тридцати знаков хватит, чтобы записать звуки, но слогов в языке сотни, а слов — десятки тысяч. Если знаков сотня — каждый несёт больше звука. Если тысячи — каждый несёт целое слово.
Отсюда правило, которым и пользуются дешифровщики:
- порядка трёх десятков — почти наверняка алфавит;
- порядка сотни — слоговое письмо;
- сотни и тысячи — знаки означают слова или морфемы.
Границы размыты, и промежуточные случаи бывают. Но чтобы понять, куда копать, этого достаточно.
Как это сработало у Кнорозова
К середине XX века письменность майя считалась нечитаемой. Эрик Томпсон, глава американской школы, был убеждён: знаки не записывают речь, а значит прочесть их нельзя.
Юрий Кнорозов, работая в Ленинграде, сосчитал знаки в трёх сохранившихся рукописях. Получилось 355 различных. С учётом того, что часть из них — составные и разные начертания одного знака, осталось 287, а надёжно читается не более 255.
Посмотрите на это число рядом с таблицей выше.
Триста пятьдесят пять — слишком много для алфавита и слишком мало для письма, где каждый знак означает отдельное слово: слов в языке несравнимо больше. Значит, знаки должны означать слоги.
А если слоги — то письмо записывает звучащую речь, и его можно читать.
Дальше нужен был ключ, и он нашёлся у епископа Диего де Ланды, который в XVI веке записал соответствия знаков майя буквам испанского. Ланда думал, что записывает алфавит, а записал слоги — и потому его список долго считали бесполезным.
Статья вышла в «Советской этнографии» в октябре 1952 года. Автору было двадцать девять лет. Подробнее о нём — Кнорозов.
Опыт 2: определить тип неизвестного письма
Теперь то же самое своими руками.
Что готовит преподаватель. Три текста, зашифрованных по-разному. Ученикам они выдаются без объяснений — только значки.
import random, re
text = open('text.txt', encoding='utf-8').read().lower()
# А. Каждой БУКВЕ — свой значок
letters = sorted(set(re.findall(r'[а-яё]', text)))
key_a = {c: f'⟨{i}⟩' for i, c in enumerate(letters)}
out_a = ''.join(key_a.get(c, ' ') for c in text)
# Б. Каждому СЛОГУ — свой значок (грубо: согласная + гласная)
syls = re.findall(r'[бвгджзйклмнпрстфхцчшщ]?[аеёиоуыэюя]|[а-яё]', text)
key_b = {s: f'⟨{i}⟩' for i, s in enumerate(sorted(set(syls)))}
out_b = ''.join(key_b[s] for s in syls)
# В. Каждому СЛОВУ — свой значок
words = re.findall(r'[а-яё]+', text)
key_c = {w: f'⟨{i}⟩' for i, w in enumerate(sorted(set(words)))}
out_c = ' '.join(key_c[w] for w in words)
for name, s in (('А', out_a), ('Б', out_b), ('В', out_c)):
print(name, 'различных знаков:', len(set(re.findall(r'⟨\d+⟩', s))))
Что делают ученики. Считают в каждом тексте число различных знаков и по своей же шкале говорят, какого типа письмо перед ними.
Ответ проверяется однозначно, и это редкий случай, когда результат опыта не приходится трактовать.
Опыт 3: прочитать алфавитный
Тип определён — теперь взломайте текст А.
Частоты. Посчитайте, как часто встречается каждый знак. В русском тексте самые частые буквы — о, е, а, и, н, т. Сопоставьте по убыванию.
Точного совпадения не будет: на коротком тексте частоты пляшут. Но верхушка списка обычно указывает верно.
Однобуквенные слова. Если пробелы сохранены, это подарок: в русском их немного — в, и, с, к, у, о, а, я, б, ж. Найдя такие, вы резко сужаете перебор.
Позиция. Какие знаки стоят в начале слов, какие в конце? Русские слова часто кончаются на гласную или на -й, -ь, -т, -м. Твёрдый и мягкий знаки не бывают первыми — уже проверка.
Удвоения. Сочетания одинаковых знаков подряд редки и характерны.
Проверка догадки. Подставили значение — прочтите текст. Если полезли невозможные сочетания (например, четыре согласных подряд), догадка неверна. Это и есть проверяемость: неправильный ключ виден.
Почему слоговое взломать труднее
Попробуйте те же приёмы на тексте Б — и упрётесь.
Знаков втрое больше, значит на каждый приходится втрое меньше примеров, и частоты становятся ненадёжными. Границы слов помогают слабее. А главное — вы не знаете языка, и подставлять наугад не во что.
Именно здесь Кнорозову понадобился список Ланды. И здесь же кроется причина, по которой одни письменности прочитаны, а другие нет.
Остриё науки
Что осталось непрочитанным. Линейное письмо А, ронго-ронго острова Пасхи, письменность долины Инда, протоэламское письмо. Не из-за нехватки стараний.
Отчего так. Для дешифровки нужно совпадение нескольких условий, и обычно не хватает какого-то одного:
- известен ли язык. Кнорозову повезло принципиально: язык майя жив, на нём говорят и сегодня. Вентрису повезло иначе — язык линейного письма Б оказался ранней формой греческого. А язык линейного письма А не знает никто, и потому оно не прочитано, хотя знаки те же самые;
- есть ли ключ. Розеттский камень для египетских иероглифов, список Ланды для майя. Без билингвы или её подобия почти невозможно;
- хватает ли текста. Надписей долины Инда много, но они коротки — по несколько знаков. Статистику на таком материале не построишь.
Открытый вопрос посерьёзнее. Про некоторые системы неизвестно даже, письменность ли это вообще. Ронго-ронго и знаки Инда могут оказаться не записью речи, а чем-то иным: метками собственности, счётом, мнемоническими значками. И тогда «дешифровать» их нечего — не потому, что задача трудна, а потому что задачи нет.
Отличить одно от другого можно как раз статистикой: настоящая запись речи ведёт себя иначе, чем набор меток. Но на коротких надписях и это не работает.
Урок Кнорозова, ради которого стоит всё это делать. Авторитет объявил задачу неразрешимой, и авторитет ошибся. Задачу решили методом: счётом, статистикой и позиционным разбором — а не удачной находкой в раскопе.
Как это выражено в нашем проекте: «никто не знает» и «никто не проверял» — разные вещи, и путать их дорого.
Что записать
| Текст А | Текст Б | Текст В | |
|---|---|---|---|
| Различных знаков | |||
| Ваш вывод о типе | |||
| Верно ли угадали | |||
| Самый частый знак | |||
| Удалось ли прочитать |
Читать дальше
→ Кнорозов: человек, прочитавший письмо майя из ленинградского кабинета → Теория информации Шеннона: сколько информации несёт знак и почему избыточность языка позволяет его взломать → Закон Ципфа: ещё одна закономерность в тексте — и проверка, закономерность ли это