voice-typing

Голосовой ввод на Linux: что работает в 2026 году (в любом приложении)

Melinte Mirela-LuminitaMelinte Mirela-LuminitaCEO, Lightning Assist10 мая 2026 г.8 мин чтения
linuxvoice-to-textdictationpush-to-talkspeech-to-textWaylandX11
Поделиться:

Linux отлично оснащён инструментами почти для всего — но голосовой ввод исторически был исключением. Пока пользователи Windows получили встроенный ярлык диктовки (Win+H), а macOS ещё несколько лет назад добавила системную функцию диктовки, пользователи настольного Linux в основном собирали решения из неполных частей. В 2026 году картина улучшилась, но всё равно требует понимания, что искать.

Это руководство написано для пользователей настольного Linux, которым нужна диктовка, работающая во всех приложениях, — а не только внутри одного редактора или приложения для заметок.

Состояние голосового ввода на Linux

Корневая проблема структурная. В X11 симулировать нажатия клавиш из внешнего процесса просто с помощью инструментов вроде xdotool. В Wayland компоузер контролирует, что может получать синтетические вводы, и большинство компоузеров существенно ограничивают это из соображений безопасности. Это означает, что инструмент, отлично работающий на X11, в Wayland может молча провалиться без ввода чего-либо — и без сообщения об ошибке.

Нет и аналога Speech Accessibility Framework из macOS или Speech Recognition API из Windows: единственного OS-уровня-хука, который настольное приложение могло бы вызвать, чтобы сказать «введи этот текст туда, на чём сфокусирован пользователь». Каждый инструмент диктовки для Linux решает эту проблему по-своему, с разными результатами.

Наконец, фрагментация аудиостека между ALSA, PulseAudio и PipeWire исторически делала доступ к микрофону ненадёжным. Большинство современных дистрибутивов (Ubuntu 22.04+, Fedora 38+, Pop!_OS 22.04+) перешли на PipeWire, что значительно улучшило ситуацию.

Что реально доступно

Вот честный обзор существующих инструментов — без завышения и без преуменьшения.

ibus-typing-booster — плагин автодополнения для IBus, который может принимать голосовой ввод через сервис GNOME Speech. Ограничен приложениями, использующими метод ввода IBus. Не является универсальным решением для диктовки.

Speech Note — автономное приложение на основе Whisper, которое расшифровывает речь офлайн и помещает результат в собственное текстовое окно. После этого вы копируете и вставляете там, где нужно. Точное и уважающее приватность, но шаг копирования-вставки добавляет трение и нарушает рабочий процесс.

Numen — голосовое управление рабочим столом, ближе по духу к замене клавиатуры/мыши, чем к инструменту диктовки. Полезен для доступности и навигации без рук, но не оптимизирован для сценария «произнёс фразу — она появилась».

Talon Voice — самый мощный вариант в пространстве голосового управления Linux. Поддерживает программируемые голосовые команды, грамматики для кода и совместимый с Wayland ввод в последних сборках. Кривая обучения крутая, ориентирован на опытных пользователей, желающих управлять всем рабочим процессом голосом. Если вам нужно писать код совсем без рук — Talon стоит изучить.

OpenWhispr — более новое приложение для диктовки с открытым исходным кодом (MIT), работающее в Linux, macOS и Windows и построенное на локальных моделях Whisper / NVIDIA Parakeet с опциональными облачными моделями через ваш собственный ключ API (BYOK). При полном запуске на вашей машине транскрипция не ограничена и приватна. Для пользователей Linux, которым нужен бесплатный инструмент только для диктовки с упором на приватность и которых не пугает настройка, это действительно хороший вариант — и самый ясный признак того, что эпоха «в Linux нет настоящего голосового ввода» закончилась.

Handy — ещё одно бесплатное приложение с открытым исходным кодом для распознавания речи в Linux, macOS и Windows (на базе Tauri), работающее полностью офлайн. Оно намеренно минималистично: настраиваемое сочетание клавиш push-to-talk, которое вставляет расшифровку в активное поле, без дополнительных возможностей. Стоит взглянуть, если нужно что-то лёгкое и приватное, а шаблоны текста и ИИ-редактирование не требуются.

Voxtype и Vocalinux — два недавних участника, подтверждающих тренд на офлайн-Whisper в Linux. Voxtype — это push-to-talk инструмент голосового ввода для Linux и macOS с полностью офлайн-распознаванием; Vocalinux сочетает whisper.cpp и VOSK для 100 % офлайн-диктовки с открытым исходным кодом. Оба только для диктовки: без шаблонов текста, без ИИ-редактирования, без кроссплатформенной учётной записи. Если офлайн-обработка — жёсткое требование, им место в вашем шорт-листе рядом с OpenWhispr и Handy.

Lightning Assist — кросс-платформенное настольное приложение на Electron с PTT-диктовкой (push-to-talk) и расширением текста. Подробнее описан ниже. Позиционирование отличается от Talon: проще, с моделью единственной горячей клавиши вместо программируемой грамматики.

Ни одно из них не является идеальным решением для голосовой диктовки на Linux. Они решают разные части проблемы.

Что в действительности требуется для «хорошего голосового ввода на Linux»

Прежде чем выбирать инструмент, полезно договориться, что считать планкой. Надёжное кросс-приложенческое решение для диктовки на Linux должно:

  • Работать в любом приложении — не только в собственном окне инструмента, а в браузерах, IDE, терминалах, приложениях Electron, нативных GTK/Qt-приложениях.
  • Поддерживать Wayland, или как минимум честно сообщать об ограничениях, специфичных для X11.
  • Не требовать root для запуска — диктовка — это инструмент продуктивности в пространстве пользователя, а не системный демон.
  • Не блокировать ввод — нажал клавишу, поговорил, отпустил, продолжил работу. Никакого модального диалога, перехватывающего фокус.
  • Нормально справляться с техническим словарём — пользователи Linux диктуют имена хостов, флаги команд, названия пакетов и идентификаторы кода. Модель, обученная на разговорной речи, споткнётся о systemctl, xdg-open или ~/.config/.

Бэкенды на основе Whisper (локальные или через API) лучше справляются с техническими терминами, чем старые модели, работающие только в облаке, — отчасти поэтому Linux-сообщество движется в сторону Whisper-решений.

Lightning Assist на Linux

Lightning Assist — это настольное приложение, написанное на Electron, то есть работающее на одной кодовой базе в Windows, macOS и Linux. Выпуск для Linux поставляется в форматах AppImage (универсальный — работает на Fedora, RHEL, Arch и любом дистрибутиве) и .deb для Debian/Ubuntu/Linux Mint/Pop!_OS. Пакета AUR пока нет; AppImage — дистрибутивно-независимый вариант.

Функция голосового ввода работает через push-to-talk: удерживайте Ctrl+Super (Super — это клавиша Meta/Windows на большинстве клавиатур), говорите, отпускайте. Бэкенд на основе Whisper расшифровывает аудио, результат вводится в окно, которое находится в фокусе. Поскольку приложение разработано как кросс-приложенческий инструмент — та же модель, что и на стороне расширения текста — переходить в специальное окно диктовки не нужно.

Lightning Assist также включает расширение текста с командами AI: короткие триггеры, которые разворачиваются в более длинный текст или вызывают модель AI inline. Для пользователей Linux, которым нужно и «введи этот сниппет», и «расшифруй, что я сказал», эта комбинация входит в одну подписку за $5,99/мес с доступным бесплатным пробным периодом.

Установка на Linux

Полное пошаговое руководство — в /get-started, последний пакет — на /downloads. Краткая версия:

AppImage (работает на большинстве дистрибутивов):

chmod +x Lightning-Assist-*.AppImage
./Lightning-Assist-*.AppImage

Установка не требуется. AppImage включает собственную среду выполнения.

Debian/Ubuntu/Linux Mint/Pop!_OS (.deb):

sudo dpkg -i lightning-assist_*.deb
sudo apt-get install -f   # устранить недостающие зависимости

После установки запустите приложение, войдите в систему и включите триггер AI-речь / push-to-talk на странице Триггеры. Права root во время работы не требуются.

Актуальные подробности о плане и длительности пробного периода — на /pricing.

Практические сценарии диктовки на Linux

Ценность кросс-приложенческой диктовки становится конкретной, когда соотносишь её с тем, что реально делаешь.

Сообщения коммитов Git. После подготовки изменений переведите фокус в терминал, удерживайте Ctrl+Super, продиктуйте «fix null pointer in the cache layer when membership changes», отпустите. Сообщение появится в приглашении терминала, готовое для git commit -m. Никакого переключения контекста, никакого тянутья к мыши.

Slack, Discord и Element. Эти приложения сами являются Electron-приложениями, то есть принимают синтезированный ввод так же, как текстовое поле в браузере. Диктуйте ответ прямо там, не открывая отдельного окна диктовки.

VSCode и JetBrains IDE. Переведите фокус в редактор, продиктуйте блок комментария или имя переменной в camelCase (большинство моделей Whisper reasonably обрабатывают произнесённый camelCase, если сказать «camel case»). Для длинного текста — докстринга, раздела README — диктовка быстрее набора.

Команды терминала. Короткие команды быстрее набрать, чем произнести. Но длинные, структурированные команды (curl -X POST https://api.example.com/v1/resources -H "Content-Type: application/json" -d '{"key": "value"}') быстрее продиктовать, как только паттерн входит в мышечную память под горячую клавишу.

Markdown-документация. Диктуйте в любом редакторе, отображающем Markdown — Obsidian, Typora, обычный буфер vim, VSCode с расширением Markdown. Расшифровка не знает, что вы пишете Markdown, поэтому обратные кавычки и символы заголовков придётся добавлять вручную, но диктовка прозы на уровне абзаца работает быстро.

Особенности Wayland

Приложения Electron под Wayland могут использовать флаг --ozone-platform=wayland или переменную окружения ELECTRON_OZONE_PLATFORM_HINT=auto (поддерживается в Electron 21+), чтобы работать нативно под протоколом Wayland, а не через XWayland.

Насколько хорошо работает синтетический текстовый ввод, зависит от компоузера. GNOME под Wayland (Mutter) и KDE Plasma под Wayland (KWin) оба реализуют протокол zwp_virtual_keyboard_v1, позволяющий приложению симулировать события клавиатуры — именно так работает межприложенческий ввод текста без xdotool из X11. На компоузерах, которые не реализуют этот протокол, инъекция ввода может откатываться к вставке из буфера обмена, что в некоторых приложениях (особенно терминалах с режимом bracketed paste) может работать иначе.

Если вы на Wayland и продиктованный текст не появляется там, где ожидалось, наиболее надёжный способ диагностики — проверить, какой протокол Wayland раскрывает ваш компоузер. В GNOME: wayland-info | grep keyboard. Подробности зависят от версии компоузера.

Запасной вариант — копирование в буфер обмена и вставка — работает в большинстве приложений, но может нарушать рабочий процесс push-to-talk, если в целевом приложении уже есть нужное содержимое в буфере обмена.

Это область, которая активно улучшается по всей экосистеме Linux. Ситуация в 2026 году материально лучше, чем в 2023-м.

Заключение

Голосовой ввод на Linux — не решённая проблема, но рабочая. Честная картина 2026 года: Speech Note даёт офлайн-транскрипцию Whisper с шагом копирования-вставки; Talon Voice даёт глубокую программируемость ценой крутой кривой обучения; Lightning Assist даёт простой слой push-to-talk, вводящий текст в любое приложение, в связке с расширением текста, за фиксированную месячную плату.

Если основная потребность — кросс-приложенческая диктовка с минимальной настройкой на Ubuntu, Fedora, Arch, Debian или Pop!_OS, начните с пробного периода Lightning Assist — скачайте на /downloads или следуйте руководству по началу работы. Если нужно полное управление рабочим столом без рук, обратитесь к Talon. Если нужна полностью офлайн-обработка без подписки, Speech Note закрывает этот пробел.

Разрыв между Linux и другими ОС в диктовке сокращается — частично потому, что Whisper сделал высококачественную офлайн-транскрипцию доступной, и частично потому, что протоколы ввода Wayland повзрослели. Если вы сдались в 2022 году или раньше, сейчас разумное время попробовать снова.

Источники