В 21:47 я в очередной раз вернул запись на несколько секунд назад. Преподаватель говорил быстро, из аудитории доносился скрип стульев, а в середине фразы кто-то задал вопрос с четвертого ряда.
Я набрал два предложения, снова включил запись и через минуту повторил тот же цикл.
Так выглядела расшифровка обычной полуторачасовой лекции. На нее уходило около трех часов: прослушать, остановить, набрать текст, проверить термин, вернуться к неразборчивому месту. Если запись была сделана на ноутбук из конца аудитории, работа растягивалась почти на весь день.
В конце месяца я посмотрел задачи в трекере. Почти 40 часов ушло только на перевод лекций и семинаров в текст. В это время не вошли редактура конспектов, загрузка материалов в LMS и подготовка субтитров.
Стало понятно, что искать нужно не очередной сервис для диктовки. Нужен процесс, который принимает готовые аудио и видеофайлы, различает хотя бы основных участников и отдает текст, пригодный для быстрой вычитки.
Почему запись лекции сложнее обычного созвона
На онлайн-встрече каждый участник обычно говорит в собственный микрофон. Расстояние до него измеряется десятками сантиметров, а программа получает достаточно чистый цифровой сигнал.
В аудитории все иначе.
Преподаватель перемещается между доской и кафедрой. Студенты задают вопросы без микрофона. В запись попадают вентиляция, проектор, кашель, шелест тетрадей и разговоры на последних рядах. Отражения от стен и потолка накладываются на речь, поэтому окончания слов теряются даже там, где человек в аудитории все понял.
Условная схема нашей аудитории выглядела так:
Аудитория около 200 кв. м
┌──────────────────────────────────────────┐
│ ДОСКА преподаватель [MIC] │
│ 1,5 м │
│ │
│ ряд 1 студент А 4 м │
│ ряд 2 студент Б студент В 6 м │
│ ряд 4 вопрос из аудитории 8 м │
└──────────────────────────────────────────┘
Громче всего записывается преподаватель.
Вопросы из зала звучат тише и сильнее смешиваются с шумом.
Есть и языковая проблема. Университетская речь плохо похожа на повседневный разговор:
- дивергенция ряда Фурье;
- гомоморфизм группы;
- дисперсионный анализ;
- batch normalization;
- функция активации ReLU;
- ВКР, ФГОС, СДО и другие сокращения.
В одной фразе преподаватель может несколько раз переключиться между русским и английским. Иногда термин произносится по-английски, а его объяснение дается по-русски. Если система не учитывает контекст дисциплины, batch normalization превращается в случайный набор похожих слов.
Отдельная проблема возникает на семинаре. Преподаватель начинает отвечать, студент перебивает его уточнением, а на заднем плане продолжают обсуждать предыдущий вопрос. Распознавание речи может восстановить большую часть слов, но надежно разделить три одновременно звучащих голоса сложно.
Поэтому обещание точной расшифровки любого аудио мало что говорит о качестве. Проверять сервис нужно на собственных записях: с тем же помещением, микрофоном, терминологией и манерой речи преподавателя.
Попытка 1. Голосовой ввод в Google Docs
Первым вариантом был голосовой ввод Google Docs. Русский язык поддерживается, функция бесплатная и открывается прямо в браузере.
Для живой диктовки этого достаточно. Преподаватель говорит в микрофон, текст появляется в документе.
С готовой записью такой сценарий неудобен. Google Docs работает через микрофон браузера и не предлагает загрузить полуторачасовой файл как отдельную задачу. Можно включить лекцию через динамики или настроить виртуальный аудиокабель, но обработка все равно идет в реальном времени.
Полуторачасовую запись придется воспроизводить полтора часа. В это время вкладка должна оставаться открытой, а посторонние звуки могут попасть в результат. Остановки, паузы и смена говорящих также требуют ручного контроля. [1]
На тестовой академической записи больше всего ошибок появилось в терминах и вопросах из аудитории. Для быстрых заметок способ подходит. Для регулярной транскрибации лекций онлайн он оказался слишком зависимым от ручных действий.
Попытка 2. Otter.ai
Otter часто упоминают в подборках сервисов для встреч и учебы. Поэтому мы проверили его следующим.
На этом тест фактически закончился. По состоянию на май 2026 года Otter транскрибирует английский, испанский, французский, немецкий, японский и упрощенный китайский. Русского в списке поддерживаемых языков нет. [2]
Русский акцент при разговоре на английском и русский язык как объект распознавания являются разными задачами. Возможность перевести готовый английский текст также не заменяет исходную расшифровку русской лекции.
Для англоязычной программы Otter может быть уместен. Для российского вуза, где большая часть материала звучит по-русски, строить на нем основной процесс не получилось.
Попытка 3. Запустить Whisper локально
Локальный Whisper выглядел логичным вариантом. Модель можно установить на собственный компьютер, файлы не нужно передавать во внешний сервис, а результат полностью остается внутри инфраструктуры университета.
Базовый запуск действительно выглядит просто:
pip install -U openai-whisper
whisper lecture.mp3 --model turbo --language Russian
На практике потребуется установить ffmpeg, проверить совместимость Python и PyTorch, загрузить модель и подобрать оборудование.
В официальном репозитории для модели large указано около 10 ГБ видеопамяти. Для turbo, оптимизированной версии large-v3, требуется около 6 ГБ. Реальная скорость зависит от видеокарты, процессора, языка и самой записи. [3]
Наш учебный ноутбук с 4 ГБ видеопамяти для такого сценария не подходил. На CPU распознавание запускалось, но скорость оказалась неудобной для регулярной работы. Методисту также пришлось бы разбираться с обновлениями, зависимостями, очередями файлов и контролем зависших процессов.
Для EdTech-команды с системным администратором или ML-инженером локальная установка имеет смысл. Для методического отдела это уже отдельный программный продукт, который нужно поддерживать.
Есть еще один нюанс: Whisper сам по себе не решает полноценную диаризацию. Чтобы разделять реплики по людям, обычно добавляют отдельный компонент, а затем синхронизируют его результат с сегментами распознавания.
После нескольких тестов мы решили, что локальный запуск оставим для задач с особыми требованиями к контуру. Повседневные лекции удобнее отправлять в готовую систему.
Как мы организовали перевод лекций в текст
Для пилота выбрали Speech2Text.ru. Нас интересовали четыре функции:
- загрузка готовых аудио и видеофайлов;
- разделение текста по спикерам;
- выгрузка результата в DOCX и SRT;
- возможность перейти к пакетной обработке через API.
В веб-интерфейсе сценарий занимает несколько действий: загрузить запись, дождаться обработки, проверить спикеров и скачать результат.
На сайте сервиса указано, что часовой файл обычно обрабатывается примерно за десять минут. На практике время зависит от очереди, длины записи и выбранных функций, поэтому мы не стали закреплять десять минут как гарантированный срок.
Первый тест провели на коротком фрагменте продолжительностью десять минут. В нем были:
- речь преподавателя у доски;
- два вопроса студентов;
- несколько английских терминов;
- шум проектора;
- пауза без речи.
Короткий тест полезнее загрузки всего архива. За десять минут можно понять, как система слышит конкретного преподавателя, насколько хорошо разделяет участников и какие термины придется исправлять вручную.
После проверки мы перешли к полуторачасовым лекциям.
Попробуйте перевести лекцию или семинар в текст бесплатно
Что изменилось в рабочем процессе
Раньше методист начинал с пустого документа. Теперь исходником стал машинный транскрипт.
Работа разбилась на четыре этапа:
Запись лекции
↓
Автоматическая транскрибация
↓
Проверка терминов и спикеров
↓
Конспект, субтитры или публикация в LMS
Самое заметное изменение произошло не на этапе распознавания, а при редактуре. Исправить ошибочно распознанный термин быстрее, чем печатать весь абзац с нуля.
Мы также перестали одинаково обрабатывать все материалы.
Для внутреннего архива достаточно почти дословного текста с тайм-кодами. Для студенческого конспекта убираются повторы, организационные реплики и длинные отступления. Для субтитров сохраняются короткие сегменты и точные временные интервалы.
Одна расшифровка стала основой для нескольких форматов.
Как мы проверяли качество
Универсальной точности для транскрибации лекций не существует. Результат зависит от микрофона, расстояния до говорящего, шума, дисциплины и состава участников.
Для внутреннего теста мы вручную подготовили эталонный текст короткого фрагмента, а затем сравнили его с результатами распознавания. В таблице приведены данные этого пилота, а не лабораторный рейтинг сервисов.
WER показывает долю замененных, пропущенных и лишних слов. Этот показатель удобен для тестирования, но не всегда отражает трудоемкость редакторской работы.
Например, ошибка в предлоге почти не влияет на смысл. Неверно распознанная фамилия ученого, формула или название метода может испортить весь абзац.
Поэтому дополнительно мы считали:
- сколько терминов пришлось исправить;
- сколько раз перепутались спикеры;
- были ли пропущены вопросы студентов;
- сколько минут заняла финальная вычитка.
Для методического отдела последний показатель оказался полезнее общего процента точности.
| Способ | Результат на русской лекции | Основное ограничение |
|---|---|---|
| Ручная расшифровка с вычиткой | около 0-2% ошибок | 2-3 часа работы на час записи |
| Google Docs через воспроизведение | около 35-40% WER | реальное время, термины, вопросы из зала |
| Otter.ai | не тестировался | русский язык не поддерживается |
| Локальный Whisper | около 12% WER | оборудование и сопровождение |
| Speech2Text.ru | около 8-15% WER | зависит от микрофона и акустики |
Что распознавание пока не решает
После первых удачных результатов легко решить, что ручная работа больше не нужна. На учебных материалах это быстро приводит к ошибкам.
Формулы на доске
Система распознает звук, но не видит написанное выражение. Фраза икс в квадрате плюс игрек останется обычным текстом.
Чтобы получить полноценный конспект, формулы нужно добавлять из презентации, фотографии доски или отдельного документа преподавателя.
Слайды без комментария
Если преподаватель молча переключил слайд, содержание слайда в транскрипт не попадет. Для такого материала требуется извлечение текста из презентации или видеокадров.
Одновременная речь
Когда два студента говорят одновременно, отдельные слова могут потеряться. Диаризация также способна назначить одну реплику не тому человеку.
Редкие сокращения
СФУ, ВКР, ФГОС и названия кафедр полезно проверять поиском по готовому тексту. Для регулярных курсов мы завели небольшой словарь терминов и сокращений.
Длинные участки тишины
На записях с шумом, музыкой или длинными паузами модели распознавания иногда создают лишний текст. Такие места нужно просматривать отдельно.
Как получить конспект из видео лекции
Полный транскрипт и конспект решают разные задачи.
Транскрипт сохраняет ход лекции и позволяет найти нужную фразу. Конспект сокращает материал и группирует его по темам.
Наш процесс выглядит так:
- Загружаем видео или извлеченную аудиодорожку.
- Получаем текст с тайм-кодами.
- Проверяем фамилии, термины и формулировки определений.
- Разбиваем материал по темам.
- Выносим определения, примеры и задания.
- Добавляем формулы и изображения из презентации.
- Публикуем документ рядом с видеозаписью.
Автоматически сокращать лекцию лучше после вычитки исходного текста. Иначе ошибка распознавания может попасть в итоговый конспект уже без контекста, по которому ее можно заметить.
Для студентов удобно оставлять ссылки на временные метки:
00:08:14 Определение предела последовательности
00:21:36 Разбор первого примера
00:47:05 Типичная ошибка при вычислении
01:12:40 Домашнее задание
Такой документ помогает вернуться к конкретному фрагменту, не пересматривая всю запись.
Субтитры для онлайн-курса
Для видеокурсов мы выгружаем результат в SRT. Speech2Text поддерживает сохранение субтитров в этом формате. [4]
SRT содержит порядковый номер реплики, время начала, время окончания и текст:
1
00:00:03,200 --> 00:00:07,800
Сегодня разберем свойства определенного интеграла.
2
00:00:08,100 --> 00:00:12,900
Начнем с геометрического смысла площади.
Перед загрузкой в LMS или на видеоплатформу субтитры нужно просмотреть.
Мы проверяем:
- помещается ли реплика на экран;
- совпадает ли текст с моментом произнесения;
- не объединились ли слова двух участников;
- правильно ли записаны формулы и термины;
- нет ли слишком длинных строк.
Автоматический транскрипт заметно ускоряет подготовку субтитров, но не отменяет контроль качества.
Для слабослышащих студентов текстовая версия повышает доступность материала. При этом она не заменяет сурдоперевод, адаптацию курса и другие меры, которые могут потребоваться конкретному студенту.
Пакетная обработка через API
Когда в работе было несколько файлов в неделю, веб-интерфейса хватало. Для архива за семестр потребовалась автоматизация.
Публичная страница Speech2Text описывает очереди задач, массовую обработку, webhook и получение результатов в TXT, JSON, RAW и XML. При этом открытая схема запросов и точные адреса методов на странице не опубликованы. [4]
Поэтому мы не стали вставлять в рабочий код выдуманный адрес вида /api/v1/transcribe. Параметры загрузки, авторизации и webhook нужно брать из документации, которую сервис предоставляет при подключении интеграции.
Общая схема получилась такой:
Папка с лекциями
↓
Скрипт отправляет файлы в очередь API
↓
Сервис возвращает идентификаторы задач
↓
Webhook сообщает о завершении
↓
JSON и SRT сохраняются в папку курса
↓
Методист получает список файлов для проверки
Самостоятельно писать такую интеграцию имеет смысл при десятках или сотнях часов аудио. Для 10-20 лекций за семестр проще начать с интерфейса и проверить, устраивает ли качество.
Сколько стоит транскрибация лекций в 2026 году
В первоначальном расчете мы ориентировались на стоимость за минуту. Для регулярной работы тариф с включенным объемом оказался понятнее.
На момент проверки действовали следующие условия:
- при регистрации предоставляется 180 бесплатных минут;
- бесплатный режим включает до 15 минут в день;
- персональный тариф Стандартный стоит 2300 рублей в месяц и включает до трех часов распознавания в день;
- тариф для организаций Стандартный стоит 9200 рублей в месяц, включает до 12 часов в день, до 20 пользователей и три потока обработки. [4]
Цены и лимиты могут меняться, поэтому перед закупкой их нужно повторно проверить на странице тарифов.
Пилот из 14 лекций
Средняя продолжительность лекции: 90 минут.
14 лекций × 90 минут = 1260 минут
1260 минут = 21 час аудио
При лимите три часа в день весь объем можно обработать за семь дней. Если тариф покупается только ради этого архива, условная стоимость одной лекции составит около 164 рублей:
2300 рублей ÷ 14 лекций = около 164 рублей
Это не стоимость одной операции по прайс-листу, а расчет при использовании месячного тарифа только для данного проекта.
Кафедра из восьми преподавателей
Допустим, каждый преподаватель проводит четыре полуторачасовые лекции в неделю:
8 преподавателей × 4 лекции × 1,5 часа = 48 часов аудио в неделю
За средний месяц получится около 208 часов.
Если ручная расшифровка одного часа записи занимает от двух до трех рабочих часов, полный объем потребует от 416 до 624 часов работы методиста в месяц. На практике такую задачу просто не будут выполнять целиком.
Тариф для организаций за 9200 рублей покрывает до 12 часов обработки в день. При равномерной загрузке пяти рабочих дней лимита достаточно для 48 часов аудио в неделю.
Условная стоимость обработки одного часа при полном использовании составит около 44 рублей:
9200 рублей ÷ 208 часов = около 44 рублей за час аудио
В расчет не включены вычитка, подготовка конспекта и исправление формул. Эти этапы остаются на стороне университета.
Экономия появляется за счет отказа от первоначального набора текста. Методист начинает работу с готового черновика и тратит время на смысловые ошибки, а не на перепечатывание речи.
Что нужно сделать до массовой записи занятий
Технически включить запись можно за минуту. Организационный регламент требует больше внимания.
В аудиозаписи могут содержаться персональные данные студентов и преподавателей. Голос относится к биометрическим данным, когда используется для установления личности. Даже без такой цели в записи могут звучать имена, оценки, вопросы о здоровье и другие сведения, которые нельзя бесконтрольно публиковать или передавать.
До запуска процесса мы рекомендуем определить:
- с какой целью записываются занятия;
- кто имеет доступ к исходным файлам;
- где и сколько времени они хранятся;
- можно ли публиковать запись за пределами курса;
- как участники уведомляются о записи;
- как обрабатываются выступления несовершеннолетних;
- кто отвечает за удаление файлов после окончания срока хранения.
Точный порядок лучше согласовать с ответственным за персональные данные и юристом образовательной организации.
Для обычной лекции мы заранее сообщаем о записи и стараемся не называть студентов по полному имени. Для защит, консультаций и обсуждения индивидуальных результатов нужен отдельный регламент.
Что получилось после пилота
Главный результат состоял не в полной автоматизации. Мы сократили ту часть работы, где человек механически переносит речь в документ.
После обработки 14 лекций у нас появились:
- текстовые версии занятий;
- временные метки для навигации;
- материалы для конспектов;
- SRT-файлы для видеокурса;
- основа для поиска по всему семестру.
Формулы, схемы и сложные диалоги все еще требуют ручного вмешательства. Термины также приходится проверять, особенно на первых лекциях нового курса.
Зато вопрос о том, когда преподаватель разбирал интеграл Лебега, больше не требует просмотра десяти видеозаписей. Достаточно поиска по папке с транскриптами.
Следующий шаг для нашего процесса: автоматическая отправка новых файлов через API и загрузка проверенных материалов в Moodle. Но начинать с интеграции мы бы не стали.
Сначала стоит взять короткую запись из реальной аудитории, выполнить перевод лекции в текст и посчитать время вычитки. Если результат экономит хотя бы час на одном занятии, можно переходить к архиву семестра.