ЗДЕСЬ медиа

Фото: Hugging Face

Дневной рекап

Интерфейсы сдаются без боя

Софт кликает сам, голос остаётся на локальном диске, а спагетти из нод собираются словами

Рутина уступает место коду быстрее, чем мы успеваем обновлять рабочие пайплайны. Сегодня смотрим, как нейросети наконец учатся уверенно нажимать на кнопки в чужих окнах, пока генерация речи окончательно переезжает на домашнее железо.

Нас подкупило и то, как автоматика заходит в тонкие творческие процессы: текстовый автопилот распутывает бесконечные графы генерации, а плотный звук сам раскладывается на чистую партитуру. Четыре сюжета о том, что можно примерить к своему сетапу уже завтра.

Astra садится за чужой софт: флагман OpenAI берет управление интерфейсами на себя

Видео: OpenAI

Программам больше не нужны открытые протоколы, чтобы отдавать приказы: GPT-6 Astra просто заходит в графический интерфейс софта и нажимает на кнопки, даже если официального API у сервиса нет и никогда не было. На задачах чемпионата по финансовому моделированию система справилась в четыре раза быстрее аналитиков-людей. Нас подкупила техническая трезвость релиза — архитектуру натаскали решать задачи за меньшее число попыток и токенов, запросив от десяти долларов за миллион входных и до пятидесяти за миллион сгенерированных. Правда, сэкономить на спичках не выйдет: полностью отключить блок рассуждений разработчикам теперь попросту не дают.

Под капотом Responses API инженеры припрятали асинхронный вызов инструментов: пока фоновые задачи шуршат в приложении, модель не замирает, а продолжает строить цепочку логики. Курс агента можно корректировать прямо на лету по WebSocket-соединению — без сброса накопленного контекста. В настольную версию подтянули расширения для Oracle Analytics и Power BI, а саму модель научили переспрашивать человека при малейшей неясности и строже следовать инструкциям, чем это делали GPT-5.6 Sol или Claude Fable 5.1. Придется, пожалуй, заново перебрать файлы конфигураций вроде AGENTS.md: к системным подсказкам Astra относится с дотошностью въедливого ревьюера.

Рутинное перекладывание цифр между пятью закрытыми окнами теперь официально можно скинуть на машину.

Voicebox оставляет клонирование речи на собственном железе

Короткий аудиосемпл на пару секунд — и на вашей машине разворачивается рабочая копия голоса без отправки данных в облако. Разработчик Джейми Пайн выкатил Voicebox. Это бесплатный инструмент с открытым кодом на связке Tauri и Rust, нацеленный прямо в аудиторию ElevenLabs и WisprFlow.

Под капотом уместились сразу семь движков синтеза речи — от Kokoro и LuxTTS до связки Chatterbox, Qwen и HumeAI TADA. Клонировать тембр можно по крошечному аудиофрагменту или выбрать из пятидесяти с лишним готовых пресетов на двадцати трех языках. Система слушается тонких настроек стиля и понимает паралингвистические теги — вздохи или смех звучат вполне к месту. Нас подкупило, что инструмент сразу упакован под прикладные задачи: внутри есть многодорожечный монтажный стол для подкастов, локальный текстовый ассистент и блок мастеринга звука на библиотеке pedalboard от Spotify.

Для повседневных задач автор повесил диктовку через Whisper на глобальную горячую клавишу — надиктовывать текст можно в любую открытую программу. Пожалуй, самая любопытная деталь — поддержка протокола MCP. Благодаря ей терминальные ИИ-напарники вроде Cursor или Claude Code могут озвучивать свои ответы клонированным голосом прямо во время работы. Личный голос больше не нужно отдавать чужому серверу.

Текстовый автопилот для бесконечных графов ComfyUI

The image shows a chat window from the ComfyUI Assistant. The chat interface is primarily black with white text, and it is set against a dark background. The chat window is divided into two sections: the left section contains a list of commands and the right section displays a chat window with a blue "Send" button. The
Фото: GitHub

Тянуть десятки разноцветных проводов между нодами вручную — занятие медитативное, но ровно до тех пор, пока схема генерации не расползается на сотню блоков. Инструмент ComfyUI Assistant встраивает прямо поверх этого холста компактный плавающий чат. Вместо ручной возни с портами можно просто попросить собрать нужный пайплайн: ассистент сам считывает граф, добавляет недостающие блоки, аккуратно расставляет их без наложений и связывает между собой. Любой шаг применяется пакетом и спокойно откатывается назад через привычный Ctrl+Z.

Нас подкупила редкая забота о ресурсах домашней машины. Помощник цепляется к локальным движкам вроде LM Studio или Ollama — хотя облачные эндпоинты тоже на месте — и автоматически выгружает языковую модель из VRAM, как только запускается генерация самого воркфлоу. Видеокарта скажет спасибо. Рядом крутится база знаний на SQLite со схемами установленных нод и документацией, так что ассистент понимает параметры виджетов без галлюцинаций. Он же оценивает входные и готовые кадры, помогая на лету полировать промпты прямо по картинке.

Кажется, бесконечная паутина нод наконец-то научилась собирать сама себя по короткой реплике в чате.

SheetSage2 разбирает треки на партитуры и чистый MIDI

The image presents a detailed view of a music composition process, specifically focusing on the MERT2-FS decoder. The decoder is a component of the MERT2-FS system, responsible for converting MIDI data into a format suitable for the system. The decoder is housed within a larger structure, which includes a layer mix, a
Фото: Hugging Face

Скормить модели готовый аудиотрек и разобрать его на составные части — привычная рутина аранжировщика. SheetSage2 берет композицию целиком и выдает редактируемые партитуры, фортепианное демо и подробную разметку таймингов. В основе лежит архитектура MERT-v2-FullSong с адаптерами, которые склеиваются автоматически. Система сразу видит структуру трека: отделяет вокальную линию от инструментов, ловит тональность, расставляет биты и находит даунбеты.

Нас подкупило внимание к чужим пайплайнам. Для продакшена модель выгружает файлы ABC-нотации, привычный MIDI, разметку текста и сырой JSON, а для внешних тулзов припасены логиты, эмбеддинги и скрытые состояния слоев. Если нужен лишь скелет под кавер для проектов уровня YuE2, генерацию можно принудительно сузить исключительно до мелодии.

В бенчмарках на распознавание аккордов, сетки долей и формы трека инструмент уверенно обошел первую версию и профильные альтернативы. Пожалуй, подбор партий на слух рискует остаться развлечением для пуристов.

Ещё дневной рекап