Я люблю диктовать, а не печатать
Мой мозг, часто, лучше справляется с задачей, если порассуждать о ней вслух с самим собой, нежели печатать и планировать само печатание. Если у вас так же, то эта статейка для вас:
Куда потом девать это всё
Ну надиктовал я, а что дальше? В основном — отправляю это в нейронку и прошу переделать под нужные мне форматы: сообщение, список дел, план, что угодно. Мой любимый формат — ставить задачи на разработку/дизайн, описывать фичи и системы голосом.
На рынке есть куча разного рода транскрибаторов. Принцип один и тот же: вы зажимаете/нажимаете кнопку на клавиатуре, говорите, отжимаете кнопку, текст вставляется туда, где у вас сейчас курсор.
Важно понимать, что внутри них всегда одно и то же — модель Whisper от OpenAI. Модель открытая, скачать её может любой желающий, а значит и вы тоже. Мощная видеокарта для этого не нужна. Виспер может работать как на видюхе, так и на процессоре, поэтому если хоть что-то из этого у вас есть, то ваш компьютер справится.
Работают они все тоже +- одинаково, тут ничего умнее не придумать:
- выбираете кнопку для включения диктовки
- выбираете режим: либо записывать пока кнопка нажата, либо по отжатию
- выбираете режим: вставлять сразу, либо копировать в буфер обмена
- как вариант можно ещё выбрать режим, что нейронка будет рерайтить то, что вы надиктовали, но мне такое не нравится и вам не советую.
Платновое и бесплатновое
Из платных историй мне больше нравился whisprflow.ai, они процессят ваш голос в облаке. Бесплатно 2000 слов в неделю (что мало), но милый интерфейс, красиво работает, есть настройки и запоминание вашего личного словаря слов. Если совсем не хочется напрягаться, а карман тянут деньги, то это отличный вариант.
Что касается бесплатных, то, как я уже говорил выше, — если у вас есть хоть какие-то вычислительные возможности, то платная история вам ни к чему. Опенсорса у нас вами, друзья, полным-полно. Мой фаворит: openwhispr.
Что учесть при установке:
- Игнорируйте предлагаемые им платные планы, а в "Pick an engine for dictation and note recording" выбирайте Local.
- Среди предлагаемых моделей выбирайте Base для начала и смотрите по качеству распознавания, а также по задержке. Как только найдёте устраивающее вас соотношение — можно остановиться. У меня на маке с M3 процом нормально работает Base, а вот Large уже медленновата.
И всё, диктуйте где угодно и куда угодно.
Если что-то уже юзаете, поделитесь в комментах!
Больше новостей, заметок и, вскоре, ещё и бесплатные уроки по работе с агентами и нейронками в моём тг-канале.