Are AI labs pelicanmaxxing?
Исследователи проверили, занимаются ли крупные ИИ‑лаборатории pelicanmaxxing, используя знаменитый тест с пеликаном на велосипеде. В семь моделей (GPT‑5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen 3.7‑Max, GLM‑5.2, DeepSeek V4 Pro) сгенерировали по три варианта 48 комбинаций животного и транспорта, получив 1008 SVG‑картинок. После рендеринга каждую картинку оценил GPT‑5.6 Luna по шкале 1‑5 за животное, транспорт и целостность действия, а Gemini 3.1 Flash‑Lite зафиксировал распознанные элементы. Было лишь 11 повторов из‑за некорректных SVG.
Анализ не выявил значимых отличий: пеликаны не рисуются лучше остальных животных, велосипеды – лучше остальных транспортов, а конкретная ячейка пеликан‑велосипед не превосходит ожиданий, кроме небольшого, незначительного прироста у GLM‑5.2. При этом все 21 изображения пеликана на велосипеде направлены вправо, что характерно и для других комбинаций. Кроме того, в среднем оценки по животным и транспорту распределялись почти одинаково, а лишь в 21 из 21 случаев пеликан смотрел вправо, что не выглядит подозрительным. Автор не смог точно указать, кто из лабораторий мог использовать такой подход, но данные не подтверждают массовое pelicanmaxxing.