Прежде чем лезть в алгоритмы, честно скажу: локальный рендеринг видео на ноутбуке быстро превращает его в пылесос, особенно если ты гоняешь нейросети и Whisper пачками. Если тебе нужен готовый конвейер, который монтирует, генерирует озвучку и постит в соцсети в фоновом режиме 24/7 без нагрузки на твой рабочий компьютер - я разворачиваю такие связки на выделенных n8n Beget серверах под ключ с предустановленным ffmpeg, faster-whisper и изолированными медиа-контейнерами.
С чего все началось: шокирующий пост «F*ck Remotion and F*ck HyperFrames»
Буквально на днях в англоязычном сообществе AI-разработчиков и криейторов завирусилась карусель датского предпринимателя Альберта Олгаарда. На первом слайде его пиксельный маскот буквально выбрасывает логотипы Remotion и HyperFrames в мусорное ведро с подписью: «Забудьте про таймлайны разработчиков, посмотрите на это».
Сначала многие подумали, что это очередной дешевый кликбейт. Но следом Альберт выложил видео «JEV Finally Solved AI Video Editing (Full guide)» и реальный пример ролика, где он просто болтает на камеру, ошибается, оговаривается, а на выходе получается динамичный, стерильный вертикальный Reel уровня топовых кремниевых фаундеров: с выезжающими терминалами MacOS, живым кодом Python, плашками и идеальным звуковым оформлением. При этом автор не сделал руками ни одной склейки.
Почему Remotion и HyperFrames хороши для программистов, но мучительны для блогеров
Я сам, Коля WebSanSay, огромный фанат программного видео и кодовой автоматизации. Я активно использую Remotion в своих проектах для сборки динамических шаблонов и маскота Genesis. Но нужно быть честным:
- Remotion и HyperFrames созданы для разработчиков: чтобы изменить длительность сцены, тебе нужно пересчитать количество кадров (
durationInFrames = fps * seconds). Если ты сказал фразу на 0.4 секунды быстрее, в коде образуется дыра или текст сменится раньше времени; - Они глухие: ни Remotion, ни чистый HTML-движок не слушают твою интонацию. Они не знают, где ты запнулся, где кашлянул, а где повторил фразу второй раз с правильным ударением;
- Традиционные LLM здесь бесполезны: если скормить обычным моделям вроде базового чат-бота задачу «смонтируй мне видео», они генерируют тонны галлюцинаций по таймкодам, тратят минуты на генерацию длинных ответов и стоят дорого.
Вот как формулирует эту разницу сам Альберт в своей карусели:
| Параметр | Remotion / HyperFrames (Классика) | Claude Skill + Jev / Laya (Новая эра) |
|---|---|---|
| Для кого сделано | Для программистов и фронтендеров | Для авторов контента и фаундеров |
| Тайминг сцен | Вручную высчитываешь каждый кадр и секунду | Сам подстраивается под живой голос диктора |
| Реакция на речь | Не слышит голос, работает вслепую | Слышит каждое слово и ловит паузы от 150 мс |
| Фактчекинг | Отсутствует (что захардкодил, то и покажет) | Проверяет сценарий, ищет логотипы и исправляет ляпы |
| Трудозатраты | 2-4 часа кода и правок на один ролик | 2 минуты: закинул 2 файла и нажал Enter |
6 шагов автономного конвейера: как устроен процесс внутри
Давай разберем архитектуру скилла по тем самым 6 шагам, которые раскрыл автор. Это инженерная схема, которую может повторить любой человек с установленным Python и Claude Code / Antigravity.
Шаг 1: Два файла и одна строка заметок (Input)
Никаких сложных сценариев. Автор ставит телефон на штатив и включает петличку или студийный микрофон. На диск падают два файла:
camera.mp4- видео с лицом (talking head);mic.mov(или.wav) - чистый студийный звук без фонового эха;notes.txt- ровно одна строка, например: «Расскажи, как установить библиотеку Laya и почему System 1 быстрее стандартных LLM».
Шаг 2: Умная обрезка пауз и выбор лучших дублей (It Cuts the Voice)
Это самая больная мозоль монтажера. Когда ты говоришь на камеру, ты запинаешься. Ты повторяешь первое предложение трижды, пока оно не прозвучит идеально.
Скилл прогоняет аудио через модель локального распознавания речи (faster-whisper) с посекундными и пословными таймкодами (word-level timestamps). Алгоритм обнаруживает повторы одной и той же семантической конструкции и автоматически оставляет только последний дубль (last take rule). Все паузы длиннее 250 миллисекунд (мертвый воздух / dead air) беспощадно вырезаются.
«Я говорю 3 минуты без остановки, ошибаясь и повторяя фразы. Скилл оставляет ровно 30 секунд чистого, плотного мяса без пауз и запинок», - делится Альберт.
Шаг 3: Агентский фактчекинг и исправление оговорок (It Checks the Facts)
Случалось ли у тебя, что на записи ты оговорился: назвал компанию не тем именем или ошибся в цифре релиза? Обычно приходится переписывать весь дубль заново.
Здесь подключается Claude Agent в связке с рефлекторной моделью Jev (или локальной Laya). Агент парсит расшифровку, сверяет факты через поисковые API или документацию, находит актуальные логотипы компаний в векторе (SVG), подтягивает точные цифры и исправляет опечатки в тексте плашек. Если ты вслух сказал «версия 0.2», а в репозитории уже 0.3.4 - на экране появится правильная версия 0.3.4 с аккуратной сноской.
Для глубокого анализа скриптов, моушн-реверса и генерации визуального контента нужны самые мощные модели текущего поколения: Gemini 3.8 Pro с режимом глубоких рассуждений, генератор видео Google Veo 3.1 и визуал Nano Banana 2. Чтобы не мучиться с зарубежными картами и постоянными банами аккаунтов, загляни на мою витрину: Доступ к Google AI Pro на 18 месяцев подключается напрямую на твой личный Google-аккаунт в РФ с лимитом 1 000 кредитов в месяц (и возможностью расширения до 10 000 кредитов).
Шаг 4: Рисование сцен чистым кодом Python (It Draws Every Scene)
Никаких шаблонов из Canva, никаких тяжелых проектов в After Effects и даже без статических скриншотов. Скилл генерирует графические сцены на чистом Python:
- Окно терминала с красивыми закругленными кнопками MacOS;
- Имитация набора команды
pip install layaс мигающим курсором; - Редактор кода с подсветкой синтаксиса Python;
- Даже корпус ноутбука MacBook рисуется программно с помощью векторов и математических скруглений.
Поскольку графика генерируется кодом, разрешение всегда идеальное (crisp vector quality), размер файла минимален, а рендеринг происходит в десятки раз быстрее, чем компиляция тяжелых веб-страниц через Chromium.
Шаг 5: Пословная синхронизация и 91 звуковой эффект (It Lands on the Word)
Это главный секрет удержания внимания (retention) в Reels, Shorts и TikTok. Зритель скроллит ленту на автопилоте, пока мозг не зацепит идеальное совпадение звука и картинки.
Поскольку у скилла есть пословная карта времени (word-level alignment), он точно знает, в какую миллисекунду диктор произносит конкретное слово:
{
"word": "250",
"start": 4.120,
"end": 4.370,
"trigger": "highlight_badge",
"sfx": "pop_click.wav"
}
Когда спикер произносит слово «двести пятьдесят», именно на 4.120 секунде на экране всплывает оранжевая плашка, а аудио-дорожка подмешивает тихий щелчок (pop). В обычном 30-секундном ролике скилл расставляет до 90+ микро-звуков (вжухи, клики, переходы, шуршание интерфейса), создавая кинематографичную динамику.
Шаг 6: Автоматический самоконтроль и QA-цикл (It Checks Its Own Work)
Что делает обычный скрипт, если в кадре что-то пошло не так? Он молча выплевывает битый MP4.
В скилле Альберта зашит обязательный Self-Verification QA Loop:
- Скрипт проверяет отрендеренное видео покадрово;
- Если обнаружен черный экран (blank frame) - тест провален;
- Если видеоряд застыл дольше чем на 0.5 секунды (frozen frame) - тест провален;
- Если звук оборвался или рассинхронизировался с картинкой - тест провален;
- Система вносит поправку в тайминг и автоматически перезапускает рендер, пока 100% чеков не загорятся зеленым.
Почему модель Jev стала прорывом для этой задачи?
Многие спрашивают: почему именно Jev от TypeSafe AI, а не Claude или GPT-5?
Ответ кроется в концепции System 1 (Рефлекторное мышление). Традиционные LLM - это System 2: они медленно рассуждают, строят цепочки мыслей и генерируют текст токен за токеном. Их отклик - от 3 до 15 секунд. Если заставлять такую модель принимать 200 микро-решений по каждому слову и кадру ролика, рендер одного рилса растянется на часы и будет стоить $10 за ролик.
Jev работает принципиально иначе:
- Отклик 70-150 мс: решение принимается за один прямой проход (single forward pass);
- Цена $0.042 за миллион токенов: обработка целого ролика обходится в сотые доли цента;
- Строгая типизация: модель выдает не «болтовню», а строго валидный JSON с вероятностями: «Оставить дубль: да (0.98), Плашка: терминал (0.94), SFX: whoosh_fast (0.91)».
Если ты работаешь локально и хочешь полную независимость от облачных API, у Jev есть открытый аналог - Laya (pip install laya), который запускается прямо на процессоре твоего компьютера без видеокарты.
Первоисточник: закрытая база из 37 Claude Skills от Альберта
В отличие от инфобизнесменов, продающих «секретные промпты» в PDF за деньги, Альберт Олгаард в своем сообществе выложил всю библиотеку скиллов в открытый доступ на Google Drive. В этой коллекции 37 готовых Claude Skills для продакшна, среди которых:
famous-reel-editorиalbert-reel- базовые скиллы монтажа вертикальных роликов с динамическими врезками;youtube-popup-graphic- генерация всплывающих графических плашек, окон терминалов и кода на чистом Python;capcut-smartcutиyoutube-clean- алгоритмы очистки пауз, вздохов и мусорных дублей;youtube-broll-maker- автоматический подбор и вставка перебивок (B-roll);famous-ig-carouselиalbert-carousel-ig- сборка вирусных каруселей для Instagram.
Ты можешь изучить и скачать всю библиотеку из 37 оригинальных скиллов напрямую из первоисточника: Google Drive папка Альберта Олгаарда (37 Claude Skills).
Секретный конфиг Claude Code: как отключить подтверждения
Главная проблема новичков в Claude Code CLI - агент постоянно останавливается и спрашивает подтверждение: «Разрешить запустить Bash?», «Разрешить прочитать файл?». При монтаже видео, где скрипт делает сотни микро-запросов к файловой системе и ffmpeg, эти паузы убивают весь смысл автономности.
Вот оригинальный конфиг settings.local.json, который использует Альберт для снятия всех блокировок:
{
"permissions": {
"allow": [
"Bash",
"Read",
"Edit",
"Write",
"WebFetch",
"Grep",
"Glob",
"NotebookEdit",
"WebSearch"
],
"deny": [],
"ask": []
}
}
Либо запускай Claude Code одной терминальной командой с пропуском диалогов подтверждения:
claude --dangerously-skip-permissions
Практический код: как я адаптировал этот скилл под свой контент-завод
Оригинальный скилл Альберта ориентирован на англоязычный YouTube и локальную MacOS среду. Я, Коля WebSanSay, адаптировал эту архитектуру под боевой продакшн на Linux/Windows серверах с поддержкой русскоязычной речи, локального faster-whisper и связки с n8n.
1. Установка необходимых библиотек
# Устанавливаем движок решений, транскрибацию и обработку медиа
pip install laya faster-whisper moviepy pillow ffmpeg-python
2. Скрипт транскрибации и поиска лучших дублей (take_selector.py)
Этот микросервис извлекает аудио, транскрибирует слова с точностью до миллисекунды и находит паузы для удаления:
import os
from faster_whisper import WhisperModel
def extract_and_align_speech(audio_path):
# Загружаем компактную модель Whisper (работает молниеносно на CPU)
model = WhisperModel("base", device="cpu", compute_type="int8")
segments, info = model.transcribe(
audio_path,
word_timestamps=True,
vad_filter=True, # Автоматический фильтр тишины (VAD)
vad_parameters=dict(min_silence_duration_ms=250)
)
word_map = []
for segment in segments:
for word in segment.words:
word_map.append({
"word": word.word.strip(),
"start": round(word.start, 3),
"end": round(word.end, 3),
"probability": round(word.probability, 2)
})
print(f"Обработано {len(word_map)} слов с точными таймкодами.")
return word_map
if __name__ == "__main__":
words = extract_and_align_speech("audio_recording.mov")
# Далее word_map передается в роутер решений
3. Генерация графического окна на чистом коде (ui_drawer.py)
Вот пример того, как с помощью библиотеки Pillow генерируется аккуратное окно терминала без каких-либо графических редакторов:
from PIL import Image, ImageDraw, ImageFont
def draw_terminal_window(width=720, height=450, command="pip install laya", output="Installed laya-0.3.4"):
img = Image.new("RGBA", (width, height), (0, 0, 0, 0))
draw = ImageDraw.Draw(img)
# Фон окна с закругленными углами
draw.rounded_rectangle([0, 0, width, height], radius=16, fill="#16181D")
# Шапка окна
draw.rounded_rectangle([0, 0, width, 44], radius=16, fill="#21252B")
draw.rectangle([0, 24, width, 44], fill="#21252B") # Выравнивание нижней границы шапки
# Кнопки MacOS (красная, желтая, зеленая)
draw.ellipse([16, 15, 28, 27], fill="#FF5F56")
draw.ellipse([36, 15, 48, 27], fill="#FFBD2E")
draw.ellipse([56, 15, 68, 27], fill="#27C93F")
# Текст команды
try:
font = ImageFont.truetype("consola.ttf", 22)
except:
font = ImageFont.load_default()
draw.text((30, 80), f"$ {command}", fill="#BFFF00", font=font)
draw.text((30, 130), output, fill="#A6AAAC", font=font)
img.save("terminal_frame.png")
print("Кадр терминала успешно сгенерирован!")
if __name__ == "__main__":
draw_terminal_window()
4. Системный промпт для Claude Skill (SKILL.md) под стек WebSanSay
Чтобы запустить весь этот процесс автономно через Claude Code или Antigravity, добавь в папку своего проекта скилл .agent/skills/websansay-reel-editor/SKILL.md:
---
name: websansay-reel-editor
description: Автономный монтаж вертикальных видео из двух сырых файлов без участия человека под стек WebSanSay
---
# Автономный Режиссер Монтажа (WebSanSay Auto Reel Editor)
Твоя задача - взять два сырых файла:
1. `raw_camera.mp4` (видеоряд со спикером)
2. `raw_audio.mov` (звук с микрофона)
3. Однострочную заметку темы `topic.txt`
## Алгоритм работы:
1. Запусти `python take_selector.py` для извлечения пословных таймкодов через faster-whisper.
2. Исключи все паузы тишины длиннее 0.25 сек. Если фраза повторяется, удали черновой дубль и оставь последний, сказанный без запинки.
3. Проанализируй текст: если в речи упомянута библиотека, инструмент или статистика, вызови `ui_drawer.py` и сгенерируй всплывающий визуал.
4. Наложи визуальные элементы ровно в ту миллисекунду, когда диктор произносит ключевое слово.
5. Добавь короткий звуковой щелчок (SFX) на каждое появление плашки.
6. Выполни тестовый прогон через ffmpeg и проверь результирующий файл на отсутствие застывших кадров.
Главные выводы для авторов и бизнеса
То, что показал Альберт Олгаард - это тектонический сдвиг. До сих пор автоматизация контента делилась на два лагеря:
- Топорные шаблоны: сервисы, которые просто накладывают субтитры посередине экрана поверх сырого видео;
- Сложные кодовые монстры: фреймворки вроде Remotion, требующие сотни строк кода и ручной подгонки каждого кадра.
Связка Claude Skill + модель Jev / Laya стирает эту границу. Модели типа System One забирают на себя рутинные микро-решения (где резать, какой дубль лучше, когда вставить звук), а Python и ffmpeg компилируют безупречный видеоряд за считанные минуты.
Если ты создаешь экспертный контент, продаешь услуги или развиваешь личный бренд, твоя главная задача - формулировать смыслы на камеру, а не тратить драгоценные часы жизни на перемещение ползунков на таймлайне. Будущее видеомонтажа принадлежит автономным кодовым агентам.
Читайте также смежные материалы на Хабе:
- Нейросеть Jev: Революция за 4 копейки. Почему модель System One порвала IT-мир и как внедрить её в свой бизнес
- Моушн-дизайн за 10 минут без After Effects: Промпт-реверс через Claude и Google Flow
- AI-команда контента в Claude Code: как один инженер заменяет продакшн-студию
- Google AI PRO на 18 месяцев: Gemini 2.5/3 Pro, Nano Banana и Veo
Хочешь запустить подобную систему генерации и монтажа контента для себя или своего бизнеса? Я сам, Коля WebSanSay, собираю и внедряю такие автономные медиа-фабрики под ключ: от генерации идей и сценариев до автоматического рендеринга видео, публикации по соцсетям и сквозных воронок продаж в Telegram. Ты только надиктовываешь мысли в микрофон или записываешь пару дублей - вся остальная машина работает автономно на твоем сервере.
Присоединяйся к моему Telegram-каналу с практическими разборами: @ai_websansay, а если хочешь обсудить индивидуальное внедрение или аудит процессов - пиши мне в личку: Telegram @websansay.