Точное количество фамилий на планете назвать невозможно — ни одна международная организация не ведёт единый реестр. Демографы и ономастики оперируют оценками: по разным методикам в мире существует от 20 до 40 миллионов уникальных фамильных форм. Разброс обусловлен тем, что в некоторых культурах фамилии присваиваются государством, в других — формируются спонтанно, а в третьих (например, в Иандии) вместо них используются отчества.

Современные цифровые счётчики фамилий агрегируют данные переписей, телефонных справочников, выборных реестров и баз соцсетей. Самые масштабные проекты — Forebears, Geneanet и национальные порталы вроде Geni.com — покрывают 15–20 % населения Земли. Их алгоритмы дедуплицируют варианты написания (Ivanov / Ivanoff / Иvanoв), но не всегда учитывают диалектные формы.

Методология подсчёта фамилий

Базовая единица учёта — стандартизированная лемма. Исследователи приводят все графические варианты к единой форме: удаляют диакритические знаки, унифицируют транслитерацию, склеивают родовые пары (Kowalski / Kowalska). Затем применяется порог частотности: токен считается фамилией, если встречается минимум в 2–3 независимых источниках.

Проблему создают полисемичные токены. Слово «Смит» в англоязычных базах — ремесленник, в немецких — кузнец, в некоторых африканских странах — заимствование без профессионального смысла. Автоматические системы часто ошибочно объединяют их в один кластер, завышая частоту.

⚠️ Внимание: публичные API счётчиков (Forebears, BehindTheName) возвращают аппроксимативные значения. Для научных работ необходима валидация на первичных документах переписи.
  • 📊 Лемматизация: приведение к словарной форме
  • 🔗 Дедупликация: склейка транслитерационных вариантов
  • 📈 Порог частотности: отсев случайных совпадений
  • 🌍 Геопривязка: привязка к административно-территориальным единицам
📊 Какой источник данных о фамилиях вам кажется наиболее достоверным?
Национальные переписи населения
Базы геналогических порталов (Forebears, Geni)
Телефонные справочники и открытые реестры
Социальные сети и открытые профили

Самые распространённые фамилии по регионам

Мировая таблица лидеров стабильна уже десятилетиями. Ли (Lee) — около 100 млн носителей, преимущественно Китай. Ванг — 95 млн, тот же регион. Чжан — 90 млн. В топ-10 входят только китайские, вьетнамские и корейские антропонимы из-за высокой плотности населения и ограниченного набора иероглифических корней.

Европейский сегмент angeführt von Смирнов (Россия, ~2,5 млн), Мюллер (Германия, ~1,2 млн), Мартин (Франция, ~900 тыс.). В англоязычном мире доминирует Смит (~4 млн в США+Великобритания+Канада+Австралия). Латинская Америка: Гарсия (Мексика, Колумбия, США — суммарно ~12 млн), Родригес, Гонсалес.

РегионТоп-1 фамилияОценка носителей (млн)Этимологический тип
Восточная АзияЛи / 100Топоним / клан
Россия и СНГСмирнов2,5Прилагательное (тихий)
Германия / DACHМюллер1,2Профессия (мüller — мельник)
Испанский мирГарсия12Патронимик (сын Гарси)
АнглосфераСмит4Профессия (кузнец)
💡

Китайские фамилии занимают 1-е по 10-е места мирового рейтинга исключительно за счёт демографического веса Китая, а не уникальности имен.

Факторы, влияющие на разнообразие антропонимов

Историческая глубина наследования — главный драйвер. В Китае фамилии зафиксированы с III в. до н.э., пул корней исчерпан. В Японии обязательные фамилии введены только в 1870 г. (эра Мэйдзи), поэтому их >100 тысяч с высокой уникальностью. В Турции закон о фамилиях принят в 1934 г. — многие семьи выбрали красивые слова (Yıldız — звезда, Demir — железо), создав искусственный избыток редких форм.

Миграции перемешивают пулы. США: за 150 лет итальянские Rossi, ирландские Murphy, польские Kowalski адаптировались под английскую орфографию, порождая гибриды вроде McKowalski. В Бразилии португальские Silva, Santos сосуществуют с африканскими и тупи-гуарани корнями.

⚠️ Внимание: в странах с патронимической системой (Исландия, Монголия, части Кавказа) понятие «фамилия» не применимо — счётчики либо игнорируют их, либо ошибочно записывают отчество как surname.
  • 🏛 Закрепление фамилий государством (Япония 1870, Турция 1934, Россия XVIII в.)
  • ⛪ Роль церкви: приходские метрические книги как первый унифицированный реестр
  • 🚢 Миграционные волны: адаптация написания под фонетику новой страны
  • ⚖️ Законодательные реформы: смена алфавита (Турция, Азербайджан, Казахстан)
Почему в Исладии нет фамилий в привычном понимании?

В Исландии действует патронимическая система: сын Йона зовётся Йонссон, дочь — Йонсдóттир. «Фамилия» меняется каждый поколение. Телефонный справочник там сортируется по именам, а не по фамилиям. Исключение — несколько десятков семей с закреплёнными фамилиями (преимущественно датского происхождения), получившими их до запрета 1925 г.

Цифровые базы данных и онлайн-счётчики

Крупнейший открытый агрегатор — Forebears.io. На 2026 г. он индексирует ~31 млн уникальных токенов из 230+ стран. Данные берутся из открытых выборных реестров, телефонных книг, архивов иммиграции. Есть API: GET /api/v1/surname/{name} возвращает частоту, геокарту, этимологию. Ограничение — 1000 запросов/день бесплатно.

Национальные проекты точнее для своих регионов. Росстат публикует таблицу «1000 самых частых фамилий РФ» по переписи 2020/2021. ИНЕ (Испания) обновляет реестр ежегодно — 2023 год: 144 000 уникальных фамилий у резидентов. SSA (США) выпускает данные по картам социального страхования — 1,2 млн уникальных форм у 330 млн населения.

☑️ Как проверить частоту своей фамилии в открытых источниках

Выполнено: 0 / 4

Редкие и уникальные фамилии: статистика

По данным Forebears, ~60 % всех зафиксированных фамилий встречаются в мире один раз (hapax legomena). Это артефакты транслитерации, ошибки переписи, недавние легализации искусственных имен. Настоящие «реlictовые» фамилии — устойчивые в одной семье 5+ поколений — составляют менее 0,3 % от пула.

Примеры изолятов: Зырянов (Россия, ~400 носителей, корень «зыряне» — древнее название коми), Къэлап (Адыгея, <50 носителей, топоним аула), Фёдоров-Фёдоров (двойная фамилия, зафиксирована в 3 семьях). В США насчитывается ~150 000 фамилий с частотой 1 (по данным SSA 2020).

⚠️ Внимание: «уникальная фамилия» в онлайн-базе часто означает «уникальная строка в этой базе», а не биологическую уникальность рода. Проверяйте первичные документы.

Практическое применение данных о фамилиях

Генеалоги используют частотность для приоритизации поиска. Редкая фамилия (<1000 носителей в регионе) — фокус на метрических книгах конкретного уезда. Частая (>10 000) — необходима привязка к месту, времени, confesсии, сословью. Профессиональные сервисы (MyHeritage, Ancestry) строят вероятностные графы родства на сочастоте фамилий в сегментах ДНК.

Маркетологи и антифрод-системы оценивают энтропию фамильного поля. В выборке 1 млн пользователей: если топ-10 фамилий покрывают >30 % — выборка скорее азиатская или латиноамериканская. Если топ-10 <5 % — европейская или афроамериканская. Это маркер для локализации контента и детектирования бот-ферм с генерацией имён.

💡

Для геналогического поиска скачайте CSV с частотностями из Forebears по целевой стране — офлайн-анализ в Excel/Google Sheets быстрее, чем многократные API-запросы.

💡

Частотность фамилии — не просто цифра, а эвристика для выбора исследовательской стратегии: редкие = точечный поиск, частые = кластерный анализ.

Перспективы: от счётчиков к семантическим графам

Следующий этап — семантическая нормализация. Вместо подсчёта строки «Иванов» системы начинают связывать её с онтологией: профессия (приходский служащий), география (северо-восточная Русь), временной слой (XVII–XVIII вв.), генетическая гаплогруппа (R1a-Z280). Проекты вроде ISO 21127 (CIDOC CRM) адаптируют музейные стандарты для ономастических данных.

Блокчейн-решения (FamilyChain, GeneChain) предлагают иммутабельный реестр фамилий с привязкой к ДНК-хешам. Пока пилотные: <10 000 семей. Главная проблема — GDPR и аналогичные законы: фамилия + дата рождения = персональные данные. Агрегаторы вынуждены либо анонимизировать (теряя ценность для геналогии), либо работать в серых зонах.

  • 🔗 Семантический веб: RDF-триплеты вместо плоских таблиц
  • 🧬 Интеграция с генетическими базами (23andMe, FTDNA, MyHeritage DNA)
  • ⛓ Блокчейн-нотариальные записи смены фамилии
  • 🤖 LLM-извлечение фамилий из неструктурированных текстов (архивы, газеты, мемуары)
Что такое CIDOC CRM и зачем оно геналогам?

CIDOC CRM (ISO 21127) — онтология для культурного наследия. Она позволяет описать «Иванов» не как строку, а как сущность E74_Group с атрибутами: appellation (название), has_type (тип: patronymic/professional), timespan (период закрепления), linked_to (связь с местом, профессией, ДНК-маркером). Это делает данные машиночитаемыми и интероперабельными между архивами разных стран.

FAQ: Частые вопросы о счётчиках фамилий
Почему разные сайты показывают разную частоту одной фамилии?

Источники различаются: перепись (полное покрытие, но раз в 10 лет), телефонные книги (только абоненты), соцсети (молодёжь, дубликаты), выборные реестры (только граждане с правом голоса). Методики дедупликации тоже свои у каждого агрегатора.

Можно ли узнать точное число носителей своей фамилии в мире?

Нет. Единого глобального реестра не существует. Можно получить оценку с погрешностью ±30–50 % через кросс-валидацию 3–5 независимых баз (нацстат + Forebears + Geni + открытые реестры + ДНК-проекты).

Как учитываются двойные фамилии (Иванов-Петров) в счётчиках?

Большинство систем разбивают их на два токена по разделителю (дефис, пробел). Некоторые (Forebears) сохраняют составную форму как отдельный лемма, если частота > порога. В официальной статистике (Росстат, INSEE) двойные фамилии считаются единым токеном.

Есть ли API для массовой проверки списка фамилий?

Forebears.io — платный тариф (от $50/мес за 100k запросов). Нацстаты обычно дают только сводные таблицы топ-N, без API. Для научных целей проще договориться о передаче обезличенного дампа с Росстата, ИНЕ, ONS (UK), Census Bureau (USA).

Почему в некоторых странах фамилий очень мало (Корея, Вьетнам)?

Исторически фамилии были привилегией аристократии. При массовом введении (Корея — конец XIX в., Вьетнам — китайское управление) население приняло имена знатных кланов. В Корее ~270 фамилий, три из них (Ким, Ли, Пак) покрывают ~45 % населения.