Перейти к содержанию

Wikidata

Определение

Wikidata – открытый многоязычный knowledge graph под управлением Wikimedia Foundation, запущенный 29 октября 2012 года. Содержит более 120 миллионов сущностей с уникальными QID-идентификаторами, лицензия CC0. Используется поисковиками, AI-системами и крупными библиотеками для построения связных данных.

4 мин 99 Обновлено 12 августа

Wikidata – это машиночитаемый аналог Википедии. Вместо текстовых статей в ней хранятся структурированные сущности: каждая страна, компания, человек, продукт, концепция получает уникальный идентификатор (QID) и набор свойств. Эти данные используют поисковики Google и Bing, AI-системы Claude и ChatGPT, библиотеки и государственные сервисы. Для бизнеса Wikidata – главный публичный источник «авторитетных сущностей», на которые сайт может сослаться через свойство sameAs в JSON-LD.

Как это работает

В основе Wikidata – модель элементов и свойств. Каждый элемент имеет уникальный QID (например, Q42 – Дуглас Адамс, Q649 – Москва, Q5 – человек как класс). Каждое свойство имеет PID (например, P31 – instance of, P569 – date of birth). Утверждения собираются в триплеты, которые можно представить через RDF:

Q42 P31 Q5      # Дуглас Адамс – это человек
Q42 P569 "1952-03-11"  # Дата рождения
Q42 P800 Q3107658  # Известная работа: «Автостопом по галактике»

Все эти данные опубликованы под лицензией CC0 (общественное достояние) – их можно свободно использовать в любых проектах, включая коммерческие, без атрибуции.

Запрашивать Wikidata можно через язык SPARQL – публичный endpoint расположен по адресу query.wikidata.org. Это бесплатный инструмент конкурентного и контент-анализа: за 30 секунд можно получить список всех компаний в нише с их размером, локацией и связями.

История проекта

Wikidata запущена 29 октября 2012 года как первый новый проект Wikimedia Foundation с 2006 года. Изначально финансирование составило €1.3 млн от Allen Institute for AI, Gordon and Betty Moore Foundation и Google. Разработку вела немецкая Wikimedia Deutschland под руководством Лидии Пинчер.

Ключевая дата для бизнеса – декабрь 2014 года, когда Google объявил о закрытии Freebase в пользу Wikidata. С этого момента Wikidata стала главным открытым источником сущностей для Google Knowledge Graph. По состоянию на апрель 2026 года в Wikidata более 120 миллионов сущностей, более 2,4 миллиарда правок, около 42 тысяч активных редакторов.

Зачем она бизнесу

Wikidata решает четыре практические задачи для бренда.

1. Связывание сущностей через sameAs. Если у бренда, основателя или продукта есть страница в Wikidata, на сайте можно указать в JSON-LD: "sameAs": ["https://www.wikidata.org/wiki/Q..."]. Это говорит поисковикам и AI-системам: «Эта сущность тождественна вот этой проверенной». Один из самых сильных сигналов для попадания в Google Knowledge Graph и AI-цитирования в Perplexity, Claude, ChatGPT.

2. Knowledge panel в Google. Knowledge Panel – это блок справа в выдаче с информацией о сущности (компании, человеке, бренде). Wikidata – один из главных источников данных для этого блока. Создание правильно оформленной страницы в Wikidata повышает шансы на собственный Knowledge Panel.

3. Цитируемость в AI-системах. Все крупные LLM (ChatGPT, Claude, Gemini) обучались на данных Wikidata. Если у бренда нет страницы в Wikidata, AI могут «не знать» о нём и не упоминать в ответах. Если страница есть – точность цитирования резко возрастает, потому что AI получает структурированные факты, а не догадки из обрывков веб-страниц.

4. Конкурентный и нишевый анализ через SPARQL. Бесплатный инструмент сбора данных о конкурентах, рынке, географии. За минуты можно получить то, что обычно требует подписки на платные базы данных.

Как попасть в Wikidata

Wikidata следует строгим правилам нотабельности – не любая компания или человек может иметь страницу. Базовые критерии:

  • Сущность должна иметь упоминания в авторитетных независимых источниках (СМИ, академические работы, отраслевые отчёты)
  • Не подходит самостоятельно созданная страница без внешних подтверждений
  • Все утверждения должны иметь reference – ссылку на источник
  • Wikidata – не каталог продуктов, не место для маркетинговых описаний, не база контактов

Для большинства брендов оптимальный путь – не создавать свою страницу с нуля, а дополнить существующую (если она уже создана редакторами Википедии) или подождать, пока появится естественный повод (например, серьёзная пресс-публикация, награда, поглощение).

Пример

В январе 2026 у клиента в нише edtech была страница в Википедии (создана редактором сообщества), но в Wikidata – пустой элемент с одной строкой «компания». Я подключила SPARQL-аналитика, который проверил, какие свойства типичны для качественных страниц компаний-конкурентов в той же нише. Нашли 14 пропущенных свойств: год основания, страна регистрации, индустрия, основатели, headquarters, official website, ISIC-код, ключевые продукты, инвестиционные раунды, награды.

За три недели редактор сообщества (не сам клиент – это важно для соблюдения правил Wikidata) дополнил страницу с reference на пресс-публикации, отчётность СПАРК и новости. Через два месяца у клиента появился Knowledge Panel в Google по бренд-запросу. Цитирования в Perplexity и ChatGPT по нишевым запросам выросли – оба AI стали корректно упоминать год основания и страну компании. Вложение со стороны клиента – около 8 часов работы по сбору пресс-материалов и общению с редактором сообщества.

Вывод: Wikidata – один из самых дешёвых способов системно усилить присутствие бренда в AI-выдаче. Эффект отложенный (2–6 месяцев), но устойчивый: данные из Wikidata попадают в обучающие выборки большинства LLM.

Частые вопросы

Чем Wikidata отличается от Википедии?

Википедия – энциклопедия с текстовыми статьями для людей, у каждого языкового раздела свой контент. Wikidata – машиночитаемая база структурированных данных: каждая сущность имеет уникальный QID и набор свойств. Wikidata одна для всех языков, переводятся только метки и описания. Википедия и Wikidata – связанные проекты Wikimedia Foundation, обе работают на движке MediaWiki.

Как создать страницу в Wikidata для своей компании?

Wikidata следует строгим правилам нотабельности. Самостоятельно созданные страницы без подтверждений в авторитетных независимых источниках обычно удаляются модераторами. Правильный путь: накопить упоминания в СМИ и отраслевых отчётах, попросить опытного редактора сообщества создать или дополнить страницу с reference. Создавать страницу самому без ссылок на внешние источники не стоит – это нарушает Conflict of Interest policy.

Что такое QID в Wikidata?

QID – уникальный идентификатор сущности в Wikidata, состоящий из буквы Q и числа. Например, Q42 – Дуглас Адамс, Q649 – Москва, Q5 – человек как класс. QID не зависит от языка и не меняется со временем – это позволяет ссылаться на сущность одинаково из любого языкового раздела Википедии и из любых внешних систем. Свойства имеют похожие идентификаторы с буквой P (P31, P569 и так далее).

Можно ли использовать данные Wikidata в коммерческих проектах?

Да, без ограничений. Все данные Wikidata опубликованы под лицензией CC0 – это режим общественного достояния, который не требует атрибуции, разрешает любое использование, включая коммерческое, и не накладывает обязательств share-alike. Это самая свободная из существующих свободных лицензий.

Как Wikidata связана с Google Knowledge Graph?

Google использует Wikidata как один из главных открытых источников структурированных данных для Knowledge Graph. После закрытия проекта Freebase в декабре 2014 года Google объявил о переходе на Wikidata в качестве основного источника. Сейчас данные Wikidata активно используются для Knowledge Panels в выдаче, особенно для бизнеса, людей и организаций.

Влияет ли наличие в Wikidata на цитирование в ChatGPT и Perplexity?

Да, существенно. Все крупные LLM обучались на данных Wikidata, поэтому информация о сущностях, имеющих страницу в Wikidata, попадает в параметрические знания модели. Это повышает точность цитирования и снижает риск, что AI «не узнает» бренд. Для AI-систем с веб-поиском (Perplexity, ChatGPT с web browsing) Wikidata также служит верифицированным источником при формировании ответа.

Как сделать SPARQL-запрос к Wikidata?

Открыть query.wikidata.org, ввести запрос в редактор и нажать «Execute». Базовый шаблон: SELECT ?item ?itemLabel WHERE { ?item wdt:P31 wd:Q5 . } LIMIT 10 – этот запрос вернёт 10 любых сущностей-людей. Wikidata Query Service подсказывает синтаксис, генерирует визуализации и сохраняет историю запросов. Для непрограммистов в 2021 году выпущен Query Builder – визуальный конструктор без знания SPARQL.

Связанные термины

GEO GEO (Generative Engine Optimization) – оптимизация контента под цитируемость в AI-поисковиках: ChatGPT, Perplexity, Google AI Overviews, Яндекс Алиса AI. Термин ввели исследователи Принстона, Georgia Tech, Allen Institute и IIT Delhi в работе на arXiv от 16 ноября 2023 года. JSON-LD Формат записи структурированных данных Schema.org в JSON (рекомендация W3C, 2014). Используется как основной способ внедрения разметки на веб-страницы: отдельный блок в секции head или body, не зависит от вёрстки. Linked Data Linked Data (связанные данные) – концепция публикации структурированных данных в вебе так, чтобы их можно было соединять между сайтами через общие идентификаторы (URI). Принципы предложил Тим Бернерс-Ли в 2006 году. Технологическая основа – RDF, SPARQL, Wikidata, schema.org. RDF RDF (Resource Description Framework) – стандарт W3C для описания ресурсов в виде тройки subject-predicate-object. Первая версия опубликована в 1999 году, текущая RDF 1.1 – в феврале 2014. RDF – теоретическая основа Schema.org и формата JSON-LD. Schema.org Schema.org – словарь структурированных данных для разметки веб-страниц, который понимают Google, Bing, Yandex и AI-системы. Запущен в 2011 году совместно Google, Microsoft и Yahoo, в ноябре 2011 к проекту присоединился Яндекс. SPARQL SPARQL (SPARQL Protocol and RDF Query Language) – стандартный язык запросов к данным в формате RDF. SPARQL 1.0 утверждён W3C 15 января 2008 года, расширенная версия SPARQL 1.1 – 21 марта 2013 года. Используется в knowledge graphs, Wikidata и корпоративных базах знаний.

Материалы по теме

Что почитать дальше по этой теме.

Статья Что боты находят на сайте, а вы – нет Боты ходят по изнанке сайта, куда живой человек не забредёт, и фиксируют в логах то, чего не видно ни в Метрике, ни на витрине: падающие с ошибкой 500 страницы каталога, битый файл с 747 обращениями, поток сканеров секретов. Разбираю на реальных логах, что искать и как чинить. 7 мин 198 22 июля 2026 Инструкция Как выгрузить и читать access-логи, если хостинг хранит их три дня Access-лог – единственное место, где виден весь трафик сайта, включая ИИ-ботов, которых не замечают счётчики. Разбираю на практике: где взять логи, как не потерять их из-за ротации, какие команды показывают ботов, ошибки и подозрительную активность. 7 мин 151 21 июля 2026 Флагманский гайд AI-анализ email-обращений: методика на стыке Яндекс.Метрики и Claude Code Классический email-трекинг отвечает на вопрос «откуда пришло обращение». AI-слой отвечает на вопросы, которые раньше требовали ручного аналитика: значим ли email на фоне звонков, форм и мессенджеров, почему один источник даёт качественные обращения, а другой – пустые, какие сегменты визитов предшествуют письму, что написать в ответ с учётом пути пользователя. Здесь – как я собираю это на уже имеющемся стеке: Logs API Метрики, PostgreSQL и Claude Code, без новых платных сервисов. 11 мин 290 26 мая 2026 Флагманский гайд Майкор: ИИ-аудит проекта по 4 точкам контакта Майкор – это перекрёстный ИИ-аудит проекта в 4 точках контакта: сайт, контекстная реклама, AI-поиск и Яндекс.Карты. Я анализирую каждую систему и смотрю связки между ними – где маркетинг рассказывает одно, реклама ведёт на другое, а AI-системы цитируют третий номер телефона. В одном из моих аудитов медицинской клиники в Москве у организации в индексе AI-сервисов оказалось 6 разных номеров и всего 7 упоминаний на 64 проверочных запроса – при том, что в обычной выдаче Яндекса клиника была в топ-1. Майкор закрывает такие разрывы за один аудит вместо четырёх раздельных. 16 мин 495 13 мая 2026 Гайд FAQPage Schema: как разметить блок частых вопросов и попасть в AI-ответы FAQPage schema – один из самых эффективных типов разметки для попадания в AI-ответы. Страницы с FAQPage schema цитируются AI-поисковиками в 2,7 раза чаще. В этом гайде – формат разметки, правила написания ответов для AI, реализация на 1С-Битрикс и типичные ошибки, которые обнуляют эффект. 8 мин 327 25 апреля 2026