Я люблю диктовать, а не печатать

Мой мозг, часто, лучше справляется с задачей, если порассуждать о ней вслух с самим собой, нежели печатать и планировать само печатание. Если у вас так же, то эта статейка для вас:

Ну англицизмы он совсем не понял куда деть, я произносил просто три рандомных слова: public, journal, statement.
Ну англицизмы он совсем не понял куда деть, я произносил просто три рандомных слова: public, journal, statement.

Куда потом девать это всё

Ну надиктовал я, а что дальше? В основном — отправляю это в нейронку и прошу переделать под нужные мне форматы: сообщение, список дел, план, что угодно. Мой любимый формат — ставить задачи на разработку/дизайн, описывать фичи и системы голосом.

На рынке есть куча разного рода транскрибаторов. Принцип один и тот же: вы зажимаете/нажимаете кнопку на клавиатуре, говорите, отжимаете кнопку, текст вставляется туда, где у вас сейчас курсор.

Важно понимать, что внутри них всегда одно и то же — модель Whisper от OpenAI. Модель открытая, скачать её может любой желающий, а значит и вы тоже. Мощная видеокарта для этого не нужна. Виспер может работать как на видюхе, так и на процессоре, поэтому если хоть что-то из этого у вас есть, то ваш компьютер справится.

Работают они все тоже +- одинаково, тут ничего умнее не придумать:

- выбираете кнопку для включения диктовки

- выбираете режим: либо записывать пока кнопка нажата, либо по отжатию

- выбираете режим: вставлять сразу, либо копировать в буфер обмена

- как вариант можно ещё выбрать режим, что нейронка будет рерайтить то, что вы надиктовали, но мне такое не нравится и вам не советую.

Платновое и бесплатновое

Из платных историй мне больше нравился whisprflow.ai, они процессят ваш голос в облаке. Бесплатно 2000 слов в неделю (что мало), но милый интерфейс, красиво работает, есть настройки и запоминание вашего личного словаря слов. Если совсем не хочется напрягаться, а карман тянут деньги, то это отличный вариант.

Что касается бесплатных, то, как я уже говорил выше, — если у вас есть хоть какие-то вычислительные возможности, то платная история вам ни к чему. Опенсорса у нас вами, друзья, полным-полно. Мой фаворит: openwhispr.

Что учесть при установке:

- Игнорируйте предлагаемые им платные планы, а в "Pick an engine for dictation and note recording" выбирайте Local.

- Среди предлагаемых моделей выбирайте Base для начала и смотрите по качеству распознавания, а также по задержке. Как только найдёте устраивающее вас соотношение — можно остановиться. У меня на маке с M3 процом нормально работает Base, а вот Large уже медленновата.

И всё, диктуйте где угодно и куда угодно.

Если что-то уже юзаете, поделитесь в комментах!

Больше новостей, заметок и, вскоре, ещё и бесплатные уроки по работе с агентами и нейронками в моём тг-канале.

1