Почему ИИ-картинки всё ещё выглядят фальшиво
Автор Chatday Editorial Team ·
Ты уже три секунды смотришь на фото повара, раскладывающего ужин по тарелке, когда замечаешь руку. Большой палец гнётся не в ту сторону, и там пятый палец, где должен быть четвёртый. Всё остальное прекрасно. Пар, свет, эти маленькие подпалины на тарелке. Но эта рука выдаёт всё, и теперь ты уже не можешь этого не видеть.
Инструменты ИИ-картинок прошли большой путь. Поколение назад они размазывали лица и превращали зубы в клавиши пианино. Теперь они создают портрет, который обманывает почти любого. Почти. Остаётся небольшой набор мест, где иллюзия трескается, и как только ты знаешь, куда смотреть, ты видишь их повсюду.
Так вот что происходит на самом деле: почему инструмент, который прекрасно рисует кожу и волосы, всё ещё спотыкается на руке или на уличной вывеске, и что это говорит о том, как эти инструменты ‘видят’.
Признаки, которые всё ещё работают
Некоторые старые подсказки умерли. Пластиковая, отретушированная кожа и эти одинаковые блики в обоих глазах раньше кричали ‘подделка’. Новые модели уже хорошо справляются с текстурой кожи и бликами в глазах, так что сами по себе они больше ничего не значат.
Что всё ещё проскакивает? Горстка мест, где модели нужно удерживать множество мелочей согласованными сразу.
| Куда смотреть | Что выдаёт | Почему так выходит |
|---|---|---|
| Руки в действии | Лишние или сросшиеся пальцы при захвате, наложении или удержании чего-то | Поза сложная, а детали крошечные, поэтому их прорисовывают последними и хуже всего |
| Текст на фоне | Расплывающиеся буквы на дальней вывеске, корешке книги или этикетке | Модель тратит усилия на объект, а не на мелкий шрифт |
| Отражения и тени | Зеркало, показывающее другое, тени, которые никуда не указывают | Она рисует правдоподобное отражение, а не физически верное |
| Повторяющиеся узоры | Ряды кирпичей, которые изгибаются, плитки, меняющие размер по кадру | Держать математически ровную сетку по всему изображению трудно |
| Украшения и края | Часы, наполовину сплавленные с запястьем, кольцо, сливающееся с кожей | Две поверхности, чисто соприкасающиеся, это как раз та граница, с которой ей тяжело |
Ни одна из них не является безошибочным тестом. Лучшие модели 2026 года способны попасть в любую из них. Хитрость в том, что почти никогда они не попадают во все сразу. У картинки могут быть безупречные руки и читаемый текст, а потом свет идёт с двух сторон, которые не могут существовать вместе.
Почему руки и текст ставят ИИ в тупик
Вот часть, которая удивляет. Модель не рисует руку. Она понятия не имеет, что рука существует.
Питер Бентли, специалист по информатике из University College London, прямо сказал в интервью BBC Science Focus: это ‘генераторы изображений в 2D, у которых нет никакого понятия о трёхмерной геометрии чего-то вроде руки’. Они учатся, впитывая миллионы изображений и улавливая закономерности. У руки обычно есть ладонь, несколько пальцев и несколько ногтей. Но, как говорит Бентли, ‘ни одна из этих моделей на самом деле не понимает, что такое целое’.
Думай об этом не как о художнике, а скорее как об автодополнении для пикселей. Модель предсказывает, что должно идти дальше, исходя из увиденного, ни разу не считая до пяти и не рассуждая, какой палец куда. Попроси две руки с переплетёнными пальцами, и ты можешь получить, по словам Бентли, ‘два запястья и клубок пальцев’. Она угадывает форму, которую видела очень много, но так и не поняла по-настоящему.
Это также объясняет проблему с обучающими данными. На большинстве фото руки это беспорядок. Они наполовину скрыты, сжаты в кулак, машут, держат чашку кофе или повёрнуты так, что видно только два пальца. Лица смотрят прямо в камеру на миллионах чистых снимков, поэтому модели видят лица под любым углом и в любом свете. Руки они видят в основном в разгар движения и наполовину закрытыми, так что расслабленная, раскрытая, обращённая вперёд рука в данных странно редка. Модель становится отличной в том, что видела ясно, и шаткой в том, что видела кусками.
Текст это та же история в другой одежде. Для модели буквы это формы, а не язык. Она знает, что на вывеске должны быть похожие на буквы значки, поэтому рисует похожие на буквы значки. Вблизи, на заголовке, новые модели умеют писать. Отправь это к дальней витрине или к стене мелкого шрифта, и она возвращается к каракулям, которые похожи на слова только издалека.
Что новые модели исправили, а что нет
Было бы нечестно делать вид, что ничего не изменилось. Изменилось многое.
Кожа теперь выглядит настоящей, с порами и зерном вместо того воскового блеска. Глаза совпадают. У лиц есть микровыражения, которые обходят прежнюю скованность зловещей долины. Короткий, заметный текст часто выходит чистым. Простые, покоящиеся руки, те, что просто лежат на коленях, обычно получаются. Если бы ты сегодня увидел топовую картинку без единой подсказки, ты бы не моргнул.
Держится всё, что требует от модели понимать правила, а не копировать внешний вид. Физика это главное. Отражение должно подчиняться геометрии. Тень должна согласовываться со светом. Рука вокруг чашки должна знать, что чашка перед одними пальцами и позади других. Это не проблемы текстуры, это проблемы логики, а искатель закономерностей логикой не занимается. Бентли отмечает, что решение, вероятно, идёт через обучение на настоящих 3D-формах, чтобы модели ‘понимали форму за изображениями’, и ранние работы в этом направлении уже есть, но повседневные инструменты, которыми ты пользуешься, по-прежнему рисуют плоские догадки.
Если тебе любопытно, как далеко продвинулась область именно с проблемой текста, мы разобрали это в ИИ наконец научился писать на картинках. А если ты просто хочешь знать, какой инструмент даёт сегодня самые чистые результаты, мы выстроили их в ряд в лучших генераторах изображений с ИИ.
Как получить ИИ-картинки, которые не выглядят фальшиво
Знание того, почему картинки ломаются, подсказывает, как именно этого избежать. Ты уводишь модель от того, в чём она путается.
Держи руки спокойными или вне кадра. Если руке не нужно делать что-то замысловатое, не заставляй. Попроси руки в покое, в карманах, или просто кадрируй теснее. Портрет от груди и выше обходит всю проблему.
Не проси картинку нести твои слова. Если нужен заголовок, логотип или подпись, добавь их потом в любом графическом редакторе. Пусть модель сделает картинку, а настоящий текст наложи сам сверху. Он выйдет чётким, правильным и твоим.
Опиши свет. Скажи, откуда он. ‘Мягкий свет из окна слева’ даёт модели правило, которому следовать, и тени с отражениями обычно встают на место, а не указывают в случайные стороны.
Генерируй, исправляй, генерируй снова. Первый результат это черновик. Замечай подсказку, подправь промпт или измени одну деталь и запусти ещё раз. Те, кто получает чистые картинки, не везунчики, они просто делают два-три прохода. Здесь помогает работать в одном месте, ведь можно сгенерировать, увидеть расплывшуюся вывеску и запустить снова, не прыгая между приложениями. Тот же приём двигает многие товарные фото, сделанные с ИИ: несколько быстрых проходов, а не один идеальный промпт.
Используй ‘несовершенство’ намеренно. Слегка зернистый, смещённый от центра кадр с настоящим ощущением читается как более достоверный, чем безупречный. Это уже целая эстетика, и мы писали о том, почему фото от ИИ выглядят несовершенными намеренно.
Честно говоря, дело не в том, что ИИ-картинки плохи. Дело в том, что они уверены в себе, а уверенность это не то же самое, что правота. Потрать тридцать секунд на углы кадра, и ты поймёшь. А потом, когда делаешь свои, можешь нацелить инструмент на то, что ему удаётся, и тихо обойти всё остальное.