Следующий этап — извлечение смысла из самого видео.
Для этого аудиодорожка отправляется в сервис транскрибации, где используется Whisper. На выходе система получает JSON с текстом речи и временными метками.
Именно здесь видео перестает быть просто файлом. Транскрипция становится исходными данными для следующего этапа обработки — автоматического формирования метаданных.
Полученные данные передаются в менеджер задач. Его задача — регулировать количество одновременно выполняемых операций с LLM и не допускать неконтролируемого роста нагрузки.
После этого LLM обрабатывает транскрипцию и формирует данные, которые помогают ориентироваться в содержимом ролика:
- краткое описание;
- тайм-коды ключевых фрагментов.
Таким образом, пользователю не приходится вручную пересматривать часовую запись, чтобы понять, о чем в ней говорится, или самостоятельно размечать основные моменты.
Автоматическая транскрибация и навигация по видео — отдельное направление, о котором мы уже рассказывали в
кейсе Frisbee с ИИ-ассистентом и транскрибацией.