Это действительно серьезный сдвиг в архитектуре мультимодальных сетей. Разработчики SenseNova-U1-8B-MoT-Infographic-V3 отказались от привычных костылей в виде отдельных визуальных энкодеров и VAE. Модель обрабатывает пиксели и текст как единую сущность в рамках архитектуры NEO-unify. Никаких адаптеров для перевода между модальностями — сеть изначально понимает и генерирует визуальный и текстовый контент в одном потоке!
На практике такой подход вылился в отличную работу со сложной версткой и мелкотекстовым рендерингом. Версия V3 заточена под создание и точечное редактирование инфографики. Можно менять локальные надписи, удалять или вставлять объекты, а также переписывать глобальный стиль, не ломая нетронутые области. При этом заявлена поддержка нативного разрешения до 8K и работа с экстремальными пропорциями — движок уверенно собирает ультраширокие и очень вытянутые холсты.
Проект полностью открыт, веса доступны для скачивания, а для видеокарт с небольшим объемом памяти энтузиасты уже собрали квантованные версии в формате GGUF. Единственный нюанс кроется в стилистике базовых примеров — в них часто проскакивает характерная желтоватая гамма, из-за чего результаты визуально перекликаются с дефолтными выдачами ChatGPT. Но архитектурная база и качество работы с текстом делают этот релиз одним из самых сильных инструментов для сложного визуального редактирования.
Поделиться:
Нил Бломкамп выпустил 13-минутный научно-фантастический фильм NIGHTBORNE, полностью сгенерированный в нейросети Seedance 2.0
Google планирует зашить архитектуру Gemini в кремний: риски проекта Frozen v2