Генеративті нейрожелілердің веб-кеңістікке ену ауқымы жалпы қабылданғаннан әлдеқайда тереңірек болып шықты. Менің жаңа деректерді талдауым көрсеткендей: интернеттегі әрбір оныншы веб-парақша синтетикалық авторлық іздерін алып жүр. Дегенмен, ChatGPT іске қосылғаннан кейін жарияланған контентке қарасақ, жағдай әлдеқайда радикалды көрінеді — мұндай парақшалардың үштен бірінен астамы жасанды интеллектпен генерациялау немесе елеулі өңдеу белгілерін көрсетеді.
Әдіснама және негізгі сандар
Зерттеу барысында 2026 жылдың шілдесінде жиналған 10 000 ағылшын тілді парақшалардың кездейсоқ іріктемесі талданды. Анықтау үшін қазіргі заманғы LLM-ге тән лингвистикалық үлгілерді анықтауға оқытылған машиналық оқыту моделі қолданылды. Бір қарағанда, жалпы массивтің 10% — бұл қалыпты сан. Бірақ ұмытпау керек: іріктемеге генеративті ИИ дәуірінен әлдеқайда бұрын жасалған «ескі» вебтің үлкен көлемі енді.
Егер өткеннің мұрасын алып тастап, тек 2022 жылдың қарашасынан кейін жарияланған материалдарға назар аударсақ, сурет күрт өзгереді. Синтетикалық іздер жаңа парақшалардың үштен бірінен астамында анықталады. Бұл ChatGPT, Claude, Gemini және олардың аналогтарының қазіргі контенттің басты «авторларына» айналғанының тікелей дәлелі.
Генерация бойынша кім көш бастап тұр
Домендік аймақтар бойынша синтетиканың таралуы өте біркелкі емес және бұл экономикалық логиканы көрсетеді. .com аймағында ИИ белгілері әрбір оныншы парақшада (шамамен 10%) анықталады, бұл .org көрсеткішінен (4,6%) екі есе жоғары. Ал білім беру (.edu) және үкіметтік (.gov) ресурстар шамамен 1% ғана көрсетеді — он есе аз.
Мұндай диспропорция контенттің табиғатымен түсіндіріледі. Коммерциялық сектор желіні жаппай мәтіндермен толтырады: тауар сипаттамалары, SEO-мақалалар және жаңалық жазбалары. Дәл осы форматтарды автоматтандыру ең оңай. ChatGPT бумының басында аймақтар арасындағы алшақтық азырақ байқалды, бірақ қазір нарық ИИ мүмкіндіктеріне толық бейімделді.
Маңызды ескертулер
Атап өту керек: зерттеу мұндай әрбір мәтін ботпен жазылған деп мәлімдемейді. Әдіснама файлдардың жасалу тарихын тексеруге емес, тілдік маркерлердің статистикалық талдауына негізделген. Бұл нақты есептеу емес, ықтимал авторлықты бағалау. Сонымен қатар, ИИ «жазған немесе өңдеген» санаты айтарлықтай өңдеуді білдіреді, ал автозамена немесе ұсақ түзетулерді қолдануды емес.
Менің пікірім: Бұл деректер — контент нарығы үшін дабыл қоңырауы. Біз ақпараттық шудың инфляциясы табалдырығында тұрмыз, мұнда іздеу жүйелері мен агрегаторлар синтетикаға батып барады. Салаға верификация мен таңбалаудың жаңа стандарттары қажет, әйтпесе вебке білім көзі ретіндегі сенім түпкілікті жойылады. Anthropic-тің контентті таңбалау сияқты бастамалары — дұрыс бағыттағы алғашқы қадам ғана, бірақ индустрияға ұзақ жол жүру керек.