«Мона Лиза», нарисованная карандашами ИИ: какая модель лучше всего проявила себя в рисовании

Фото
Поделиться
GPT-5.6 Sol превзошел Claude и Grok по детализации, скорости и стоимости рисования.

Команда платформы TryAI сравнила модели искусственного интеллекта GPT-5.6 Sol, Claude Fable 5, Grok 4.5 и Gemini 3.6 Flash в необычном тесте. Системы не генерировали готовые изображения, а самостоятельно рисовали их на пустом холсте с помощью цифровых цветных карандашей. По итогам эксперимента лучший результат показала модель OpenAI, тогда как Claude оказался самым дорогим, а Grok — самым слабым по качеству.

Исследователи создали специальную среду Canvas Arena, в которой модели получали чистый холст и набор инструментов: могли менять цвет и толщину карандаша, силу нажатия, размазывать штрихи, стирать отдельные участки и просматривать собственный рисунок для внесения изменений. Всего они выполнили 28 работ: воссоздали «Мону Лизу» Леонардо да Винчи и «Звёздную ночь» Винсента ван Гога, а также создали пять иллюстраций по текстовым описаниям.

Как проходил эксперимент

В тестировании участвовали GPT-5.6 Sol, Claude Fable 5, Grok 4.5 и Gemini 3.6 Flash. Все модели работали с одинаковым набором инструментов и находились в одинаковых условиях. Точность воспроизведения картин оценивалась по метрике структурного сходства (Structural Similarity Index Measure, SSIM).

Для открытых творческих задач модели рисовали пожилого рыбака, закат над океаном, красную розу в вазе, кошку на подоконнике и интерьер деревянной хижины с камином. Эти работы не оценивались автоматически, поскольку не имели эталонного изображения.

GPT-5.6 стал лидером

По итогам теста GPT-5.6 Sol получил наилучшую общую оценку авторов эксперимента. Команда TryAI отметила, что именно эта модель создала самые детализированные работы, а её версии «Звёздной ночи» и розы стали их фаворитами.

Модели нарисовали «Звёздную ночь».
Модели нарисовали «Звёздную ночь».

Gemini 3.6 Flash показал самые высокие значения SSIM для обеих картин, однако авторы отметили, что автоматическая метрика не всегда соответствует человеческому восприятию качества. Claude Fable 5 занял второе место по результату, но уступил из-за значительно более высокой стоимости и длительности работы, тогда как Grok 4.5 продемонстрировал самые слабые результаты.

Стоимость и скорость существенно различались

На создание семи рисунков GPT-5.6 Sol использовал около 3,4 миллиона токенов, работал в среднем 6,2 минуты над каждой работой, а ориентировочная стоимость составила 7,74 доллара. Claude Fable 5 потратил более 14,6 миллиона токенов и примерно 160,6 доллара, что почти в 20 раз дороже, чем у GPT-5.6. Grok 4.5 использовал больше всего токенов —, 34 миллиона, — но благодаря кэшированию его стоимость осталась на уровне 9,21 доллара. Gemini 3.6 Flash обработал 27,7 миллиона токенов с приблизительной стоимостью 12,87 доллара.

Больше проверок не означает лучший результат

Исследователи также отслеживали, как модели просматривали свои работы во время рисования. Оказалось, что все они достигали наилучшего сходства с образцом ещё до завершения процесса, а затем часто ухудшали результат, продолжая вносить изменения.

Модели нарисовали «Мону Лизу».
Модели нарисовали «Мону Лизу».

Например, Gemini 3.6 Flash просматривал свое полотно в среднем более 22 раз на рисунок, однако финальная версия оказывалась хуже лучшего промежуточного результата. Аналогичную тенденцию продемонстрировали GPT-5.6 Sol, Claude Fable 5 и Grok 4.5.

Для чего проводился такой тест

Авторы подчеркивают, что эксперимент не был официальным бенчмарком и не претендует на оценку художественных способностей моделей. Его целью было показать, как различные системы планируют действия, используют инструменты, оценивают собственный результат и насколько эффективно работают в открытых творческих задачах.

Недавно соучредитель OpenAI Андрей Карпати провёл эксперимент, в ходе которого модель Claude Opus 5 от Anthropic за два часа и 5500 строк кода создала интерактивную 3D-визуализацию начала романа «Властелин колец». Исследователь отметил, что крупные языковые модели выходят за пределы генерации простого текста и переходят к созданию персонализированных эфемерных игровых миров.

Поделиться
Заметили ошибку?

Пожалуйста, выделите ее мышкой и нажмите Ctrl+Enter или Отправить ошибку

Добавить комментарий
Всего комментариев: 0
Текст содержит недопустимые символы
Осталось символов: 2000
Пожалуйста выберите один или несколько пунктов (до 3 шт.) которые по Вашему мнению определяет этот комментарий.
Пожалуйста выберите один или больше пунктов
Нецензурная лексика, ругань Флуд Нарушение действующего законодательства Украины Оскорбление участников дискуссии Реклама Разжигание розни Признаки троллинга и провокации Другая причина Отмена Отправить жалобу ОК
Оставайтесь в курсе последних событий!
Подписывайтесь на наш канал в Telegram
Следить в Телеграмме