🚀 Transcriptor - бесплатная live-транскрипция всего, что играет в браузере. Без подписок, регистрации и даже без SMS!
"Сделай краткую сводку этой встречи и вышли на почту" - знакомо?
Сразу ссылка на это расширение: https://chromewebstore.google.com/detail/fpgdnlmjjocgihdlfkamjogknmbpaoma?utm_source=item-share-cb
"Сделай краткую сводку этой встречи и вышли на почту" - знакомо? Надоело?
Или ещё бывает так, что ты сидишь на двухчасовом созвоне, коллеги что-то долго и нудно обсуждают, ты особо не слушаешь, так как занят более важными делами (смотришь аниме в рабочее время), но тебе внезапно прилетает вопрос "Егор, что думаешь об этом?", а ты типа беспалевно отвечаешь "Коллеги, что-то связь на секунду прервалась, повторите вопрос, пожалуйста" - знакомо же? (или я один такой тут?).
И думаешь, а есть ли какие-нибудь программы, которые позволяют в live режиме транскрибировать любую речь из аудио, которое проигрывается на компьютере?
В итоге пытаешься найти программы или сервисы для транскрипции аудио в реальном времени. Но многие их этих сервисов оказываются платными, без своих собственных desktop клиентских приложений (то есть клиента создавай сам).
Есть также вариант локальной транскрипции аудио с помощью моделей OpenAi, таких как whisper. Но чтобы они адекватно работали на своём ПК, нужна мощная Nvidia видеокарта, по типу RTX 4060, что есть далеко не у многих.
Короче, появилась идея сделать live-транскрипцию аудио с помощью уже существующего бесплатного Google Web Speech API в виде обычного расширения для Google Chrome - Transcriptor.
Расширение получает звук из вкладки браузера и отправляет на сервера Google, как будто это обычная речь с микрофона для input-полей. От серверов Google обратно присылается расшифрованный текст из аудио.
Что умеет Transcriptor?
Расширение открывается в отдельном окне и превращает аудио из любой вкладки в текст прямо на лету.
Вот основные фичи:
1) Распознавание звука прямо из вкладки - без установки дополнительного софта. Просто открываешь страницу с аудио, запускаешь расширение, выбираешь язык и жмёшь «Старт»
2) Поддержка 100+ языков
3) Живые промежуточные результаты - текст появляется по мере распознавания, а не только после паузы
4) Разбивка на фразы - расширение само определяет паузы (порог - 1.5 секунды тишины) и формирует строки
5) Несколько сессий - можно вести транскрипцию параллельно для разных встреч, переключаться между ними как между вкладками
6) Всё локально - настройки и расшифровки хранятся в браузере, ничего не улетает на сторонние серверы (кроме самого Web Speech API, но это уже Google). Всё сохраняется в localstorage вашего браузера.
Два режима работы.
1. Обычный режим (звук из вкладки).
Расширение захватывает аудиопоток из активной вкладки с помощью chrome.tabCapture и отправляет его напрямую в Web Speech API. Всё работает «из коробки» - ничего устанавливать не нужно.
2. Режим виртуального микрофона.
Подходит для случаев, когда нужно одновременно использовать другие программы для транскрипции (Whisper, Soniox и т.д.).Понадобится установить бесплатный виртуальный кабель, например VB-CABLE. Схема такая: звук из вкладки → виртуальная колонка → виртуальный микрофон → Web Speech API → текст в панели. Зато в этом режиме можно параллельно кормить аудио в Perplexity, ChatGPT, AliceAI и так далее, и транскрибировать за счёт их API (и тоже бесплатно, да, в наглую, но бесплатно).