Одним из главных изменений стала поддержка инструкций длиной до 4500 токенов. Предыдущая версия принимала около 1000, поэтому теперь пользователь может подробно описать композицию, расположение объектов, подписи, формулы и оформление каждого фрагмента на одном холсте.
В демонстрации Alibaba модель за один проход создала сетку из девяти самостоятельных блоков. В неё вошли комикс о безопасности в тоннеле, уроки по геометрии и физике, медицинская схема, материалы по биологии и теории групп, банковская инфографика и сравнение структуры ДНК. Для описания всей композиции потребовалась инструкция объёмом примерно 3700 токенов.
Qwen-Image-3.0 должна не только размещать множество параллельных элементов, но и сохранять вложенную структуру сцены. В другом примере система последовательно изобразила интерфейс Visual Studio Code, открытый внутри него Qwen Chat, затем окно WeChat и размещённый ещё глубже рекламный плакат. Каждая область получила собственное оформление и не смешалась с соседними слоями.
Вторая группа улучшений касается мелких деталей. По заявлению разработчиков, новинка способна воспроизводить разборчивые символы размером около десяти пикселей, включая формулы LaTeX, индексы, греческие буквы, номера теорем и многострочные выкладки. В опубликованных примерах система формирует страницу научной статьи, газетную полосу и информационный плакат с большим количеством подписей.
Alibaba также показывает более точную передачу фактур. На портретах нейросеть прорисовывает отдельные волоски, поры и неровности кожи, а при восстановлении повреждённых картин дорисовывает утраченные участки, стараясь сохранить исходные мазки, градиенты туши и общую композицию. Отдельный режим позволяет добавлять на отсканированные страницы рукописные пометки, подчёркивания, стрелки и короткие комментарии.
Модель поддерживает текст на 12 языках, более 20 шрифтов и свыше 100 художественных направлений. Среди представленных образцов встречаются изображения с китайскими, английскими, японскими, корейскими и испанскими надписями. Кроме того, система умеет воспроизводить интерфейсы сайтов, приложений, игр и трансляций, опираясь на знания о привычной структуре подобных экранов.
Отдельно разработчики заявили о подключении к интернету для получения актуальных сведений. При запросе прогноза погоды для определённого города и даты Qwen-Image-3.0 может сначала найти необходимые данные, а затем оформить их в виде готовой карточки. Такая схема должна снизить вероятность появления вымышленных температур и других быстро меняющихся показателей, хотя точность результата всё равно зависит от найденного источника и правильной интерпретации информации.
Возможности также распространяются на редактирование исходных изображений. В одном из примеров модель превратила фотографию насекомого в научную иллюстрацию, добавив классификацию, подписи к частям тела, увеличенные фрагменты и масштабную линейку. Подобные материалы разработчики предлагают использовать в образовании, научных публикациях, дизайне, электронной коммерции и производстве контента.
При этом оценить реальные возможности Qwen-Image-3.0 пока сложно. Alibaba не опубликовала технический отчёт, результаты независимых испытаний, карточку модели, число параметров и лицензию. В официальной коллекции Qwen на Hugging Face доступны открытые версии предыдущего поколения , включая двадцатимиллиардную Qwen-Image-2512, однако файлов Qwen-Image-3.0 для локального запуска там пока нет.
Поэтому заявления о безошибочном воспроизведении мелких формул, плотных газетных полос и сложных композиций пока основаны на примерах, отобранных самой компанией. Генераторы изображений нередко показывают убедительные результаты на демонстрационных запросах, но допускают пропуски, искажения символов и нарушения структуры при систематическом тестировании.
Попробовать модель можно через Qwen Studio в браузере и официальных мобильных приложениях. Она также появилась в документации платформы Alibaba Cloud Model Studio под идентификатором
qwen-image-3.0-pro. Облачная версия поддерживает генерацию и редактирование, выдаёт до шести вариантов за один запрос и работает с разрешением до 2048 × 2048 пикселей, однако доступ к ней пока предоставляется в режиме закрытого тестирования. Публичной цены для Qwen-Image-3.0 и свободно загружаемых весов на момент публикации нет. Так что новый релиз пока остаётся облачным сервисом, возможности которого пользователи смогут полноценно проверить лишь после расширения доступа, появления документации и независимых сравнений с другими генераторами.