Збір даних ботами ШІ — це більше не просто технічна проблема, а стратегічний виклик для Національних бібліотек

Під час Всесвітнього бібліотечного та інформаційного конгресу IFLA WLIC 2026 у Пусані (серпень 2026, Республіка Корея) провідні експерти зібрався на сесії «From Scraping to Strategy: How Libraries Can Respond to Collection Crawling», щоб обговорити нову вибухову загрозу: масовий автоматизований збір даних (crawling) ШІ-ботами з вебсайтів та цифрових колекцій національних бібліотек.
📌 Скрайпінг / збір даних для ШІ (AI Crawling): термін crawling (або scraping) у контексті штучного інтелекту означає автоматизований збір та сканування вебконтенту для навчання моделей ШІ.

🔥 Головна проблема
Автоматизовані системи та боти, які тренують моделі штучного інтелекту, масово викачують унікальні матеріали культурної спадщини. Це створює аномальне навантаження на інфраструктуру бібліотек, перевантажує сервери, підвищує витрати й робить ресурси недоступними для звичайних користувачів.

Ось короткі тези зі статті «Національні бібліотеки протистоять викликам вебскрейпінгу для ШІ», яку IFLA опублікувала у себе на сайті:
Вибухове зростання трафіку через ШІ-ботів: Національні бібліотеки світу фіксують аномальні сплески веб-трафіку (наприклад, у Бібліотеці Конгресу США — у 4 рази за рік). Понад 52% всього трафіку тепер генерують автоматизовані ШІ-боти, які збирають дані для навчання моделей.
Загроза для інфраструктури: Масовий і неконтрольований скрейпінг перевантажує системи, сповільнює роботу сайтів, призводить до збоїв у сервісах метаданих та цифрових порталах, а також значно підвищує витрати на ІТ-інфраструктуру.
Маскування ботів: Сучасні боти навчилися обходити системи захисту. Вони імітують поведінку реальних людей: розподіляють запити в часі, постійно змінюють IP-адреси та створюють патерни низькооб’ємного трафіку, через що традиційна аналітика відвідуваності стає неточною.

📌 Як бібліотеки різних країн реагують на виклик?

Бібліотека Конгресу США (LOC): Надає перевагу запитам від реальних людей, використовує інструменти контролю ШІ та створює спеціальні відкриті набори даних та API, щоб ШІ-сервіси могли брати інформацію напряму, не перевантажуючи сайт.
Німецька національна бібліотека (DNB): Адаптує технічні процеси для захисту своєї бібліографічної інфраструктури, від якої залежать сотні партнерських бібліотек та установ.
Рада національних бібліотек (Сінгапур): Максимально посилює кібербезпеку: впроваджує проактивні системи захисту, такі як міжмережеві екрани для веб-додатків (WAF) та захист від DDoS-атак.Національна бібліотека Катару (QNL): Досліджує нові технічні рішення, як-от сигнали відмови від скрейпінгу (CC Signals) та Протокол контексту моделі (MCP), щоб гнучко керувати правами доступу машин до репозитаріїв.

📌 Загальний висновок: Скрейпінг колекцій перестав бути суто технічною проблемою й переріс у стратегічний виклик. Національні бібліотеки світу змушені шукати баланс — залишатися відкритими для етичних досліджень та інновацій, але водночас захищати свою цифрову спадщину та забезпечувати стабільність систем через міжнародну співпрацю.

Оригінал статті англійською мовою ТУТ.
Переклад українською мовою IFLA_Стаття_Національні бібліотеки протистоять викликам веб-скрейпінгу для ШІ.
Матеріал підготовлено Робочою групою із міжнародної діяльності НБУ імені Ярослава Мудрого.

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься.

Optionally add an image (JPEG only)