«Мертвий інтернет» стає реальнішим: скільки сайтів уже наповнює ШІ
Штучний інтелект дедалі активніше створює тексти, які люди читають в інтернеті. Нове масштабне дослідження показало, що приблизно кожна десята проаналізована вебсторінка має виразні ознаки використання ШІ.
Про це пише Pew Research Center.
Дослідники проаналізували майже пів мільйона англомовних вебсторінок з архіву Common Crawl за останні п’ять років. Цей період охоплює як час до появи ChatGPT, так і роки стрімкого поширення генеративного ШІ.
Для визначення походження текстів використовували OpenPangram. Цей інструмент шукає слова, фрази та мовні конструкції, характерні для матеріалів, які були створені або відредаговані за допомогою ШІ.
Окремо науковці дослідили 10 тисяч сторінок, опублікованих у липні 2026 року. Загалом близько 10% проаналізованих сторінок мали значні ознаки того, що до їхнього створення був причетний штучний інтелект.
Крім того, показник у 10% може навіть занижувати масштаби змін. До загальної вибірки потрапило багато старих сторінок, створених ще до появи сучасних генеративних моделей, тому вони фактично не могли бути написані такими системами.
Якщо дивитися лише на нові матеріали, тенденція стає помітнішою. Різке збільшення кількості текстів з ознаками ШІ почалося у 2022 році, приблизно одночасно із запуском ChatGPT.
Згодом масово поширилися й інші генеративні системи, зокрема Claude та Gemini. Створення текстів за допомогою ШІ стало доступним мільйонам користувачів і компаній, які можуть генерувати статті, описи товарів та інший контент за лічені хвилини.
При цьому ШІ нерівномірно заповнює різні частини інтернету. Найбільше матеріалів із його ознаками дослідники знайшли на комерційних сайтах із доменом .com — приблизно 10%.
На ресурсах із доменом .org цей показник становив близько 4,6%. Найменше таких матеріалів виявили на сайтах із доменами .edu та .gov — приблизно 1%.
Дослідники навіть визначили деякі мовні звички, за якими можна запідозрити використання генеративної моделі. Наприклад, довге тире в таких англомовних текстах траплялося приблизно вдвічі частіше, ніж у матеріалах людей.
Оксфордську кому ШІ використовував на 63% частіше. Серед характерної англійської лексики дослідники також назвали слова «delve» та «interplay».
Проте сучасні детектори не покладаються лише на окремі слова чи розділові знаки. Вони аналізують статистичні закономірності у побудові речень, доборі слів та загальній структурі тексту.
Серед можливих ознак машинного авторства також називають часте повторення слів із початкового запиту, багаторазове пояснення однієї думки різними словами та шаблонну побудову тексту.
Результати дослідження знову привернули увагу до так званої теорії «мертвого інтернету». Вона стала популярною на початку 2020-х і ґрунтується на припущенні, що дедалі більшу частину контенту та активності в мережі створюють не люди, а автоматизовані системи.
Pew Research Center не підтверджує цю теорію. Проте дослідження показує, що одна з її ключових тез — швидке збільшення кількості автоматично створеного контенту — має під собою підстави.
Ситуацію ускладнює те, що згенеровані ШІ матеріали можуть ставати джерелами для інших сайтів. Ті, своєю чергою, публікують нові тексти на їхній основі, і машинний контент дедалі глибше проникає в інформаційне середовище.
Через це виникає проблема з перевіркою інформації. Людина може вирішити перевірити відповідь чат-бота через звичайний пошук, але знайдені нею сторінки також можуть виявитися створеними за допомогою ШІ.
Источник: enovosty.com