Google SHELLS: быстрая 3D-реконструкция лиц и ее технические ограничения

Очередная система обещает радикально ускорить пайплайн создания 3D-персонажей. Проект SHELLS от исследователей Google заявляет генерацию сетки лица на 18 тысяч вершин всего за 0.08 секунды. Цифры выглядят солидно, особенно вместе со снижением потребления видеопамяти на 88% по сравнению с типичными объемными методами. Кажется, перед нами практичный инструмент для массового продакшена. Но так ли все гладко за пределами лабораторных тестов?
Главный нюанс кроется в жестких требованиях к входным данным. Для достижения заявленной скорости системе нужны строго откалиброванные многоракурсные камеры с известными параметрами. Под капотом SHELLS уходит от привычной ресурсоемкой локальной обработки вершин. Извлечение признаков поручили DinoV2, после чего алгоритм строит грубую базовую сетку. Эта черновая форма работает как каркас для финальной детальной выборки. Такое разделение на слои действительно разгружает память и позволяет трансформеру сохранять консистентность топологии.
По сути, это узкоспециализированное решение для студийного захвата мимики, а не универсальный генератор. Разработчики делают акцент на том, что модель обучалась только на синтетике, но при этом справляется с окклюзиями вроде внутренней полости рта на реальных кадрах. Заявлена даже работа с двумя ракурсами. Правда, перенос этого синтетического опыта на реальную площадку вызывает закономерные сомнения. Любая погрешность в калибровке оптики может легко сломать алгоритм, который слишком сильно опирается на идеальную математику проекций.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад