Тексты, созданные разными моделями искусственного интеллекта (ИИ), содержат характерные языковые особенности, позволяющие определить, какая именно система их сгенерировала.
Об этом сообщает портал TechCrunch.
Ученые выявили тысячи слов, выражений и речевых конструкций, которые ИИ использует заметно чаще людей, причем у каждой модели набор таких признаков оказывается своим. Исследователи отмечают, что прежние признаки текстов, созданных ИИ, уже теряют надежность.
Например, частое употребление длинных тире или слова "delve" больше не позволяет уверенно определить происхождение текста, поскольку разработчики устраняют наиболее очевидные шаблоны. Однако взамен появляются новые характерные слова, выражения и речевые обороты.
Graphite считала характерными те фразы, которые встречались в текстах ИИ как минимум вдвое чаще, чем у людей. По этому принципу исследователи обнаружили около 13 тысяч устойчивых языковых признаков.
Для сравнения они взяли 10 тысяч статей, опубликованных до появления ChatGPT, а затем попросили разные модели заново написать их на основе кратких пересказов. Это позволило минимизировать влияние оригинала и выявить различия в стиле отдельных ИИ-систем.
Исследователи сформировали отдельные массивы человеческих текстов и материалов, созданных разными моделями, после чего сравнили частоту характерных слов, выражений и конструкций. Выяснилось, что языковой профиль может заметно меняться даже у разных версий ИИ одной компании.
Так, одним из отличительных слов Claude Opus 5.5 оказалось "dependable" - модель использовала его в 23 раза чаще, чем люди. Особенно часто она подчеркивала значимость событий и явлений: выражение "this matters" встречалось в 116 раз чаще человеческой нормы, а конструкция "why X matters" - в 92 раза.
Новая версия Claude стала реже использовать конструкцию "это не X, а Y", заменяя ее другими формулировками с противопоставлением. В Graphite отмечают, что языковые привычки ИИ со временем меняются, а Claude постепенно приближается к лексике, характерной для человеческих текстов.
Исследователи обнаружили характерный языковой почерк и у модели Astra от OpenAI. Она часто упоминает "еще один аспект" проблемы и смягчает утверждения словами "may provide" и "can provide".
Особенно заметно Astra использует конструкции вроде "не просто X" и "вместо того, чтобы полагаться на X" - такие формулировки встречались более чем в 100 раз чаще, чем в человеческих текстах. Это показывает, что модели могут иметь устойчивые речевые шаблоны, а не только отдельные характерные слова.
Длинное тире долго считалось одним из характерных признаков текстов ИИ, однако новые модели постепенно отказываются от этой особенности. Opus 5.5 использует тире на 99% реже предыдущей версии, Astra - на 88% реже людей из контрольной группы, а Gemini 3.1 Pro почти полностью отказалась от него.
При этом языковой "почерк" ИИ не исчезает: как отмечают исследователи Graphite, одни характерные особенности просто сменяются другими.
Ранее "Курсор" писал, что ученые создали ИИ-систему, способную реконструировать увиденное человеком по данным сканирования его мозга.