Ditado de voz em Linux: o que funciona em 2026 (em todos os aplicativos)

Última atualização: julho de 2026
Linux possui ferramentas excelentes para quase tudo – exceto, historicamente, ditado de voz. Embora os usuários de Windows tenham um atalho de ditado integrado (Win + H) e macOS tenha fornecido um recurso de ditado em nível de sistema anos atrás, os usuários de desktop Linux vêm, em sua maioria, remendando soluções a partir de peças incompletas. Em 2026, o quadro é melhor, mas ainda é preciso saber o que procurar.
Este guia foi escrito para usuários de desktop Linux que desejam um ditado que funcione em vários aplicativos, não apenas dentro de um editor ou aplicativo de anotações.
O estado do ditado de voz em Linux
A raiz do problema é estrutural. No X11, simular pressionamentos de teclas de um processo externo é simples com ferramentas como xdotool. No Wayland, o compositor controla o que pode receber entrada sintética, e a maioria dos compositores restringe isso significativamente por razões de segurança. Isso significa que uma ferramenta que funciona perfeitamente no X11 pode falhar silenciosamente ao digitar qualquer coisa no Wayland – sem nenhuma mensagem de erro.
Também não há equivalente ao framework Speech Accessibility do macOS nem à API Speech Recognition do Windows: nenhum ponto de interceptação único no nível do sistema operacional que um aplicativo de desktop possa chamar para dizer "digite este texto em qualquer coisa em que o usuário esteja focado". Cada ferramenta de ditado Linux resolve esse problema à sua maneira, com resultados variados.
Por fim, a fragmentação da pilha de áudio em ALSA, PulseAudio e PipeWire historicamente tornou o acesso ao microfone não confiável. A maioria das distribuições modernas (Ubuntu 22.04+, Fedora 38+, Pop!_OS 22.04+) migraram para o PipeWire, e isso melhorou consideravelmente as coisas.
O que está realmente disponível
Aqui está um tour justo pelas ferramentas que existem, sem inflar ou descartar nenhuma delas.
ibus-typing-booster — um plugin de autocompletar para o IBus que pode aceitar entrada de voz através do serviço GNOME Speech. Limitado a aplicativos que usam o método de entrada IBus. Não é uma solução geral de ditado.
Speech Note — um aplicativo independente baseado no Whisper que transcreve a fala offline e coloca o resultado em sua própria janela de texto. Em seguida, você copia e cola onde precisar. Preciso e favorável à privacidade, mas a etapa de copiar e colar adiciona atrito e interrompe o fluxo.
Numen — controle de voz para desktop, mais próximo de um substituto de teclado/mouse do que de uma ferramenta de ditado. Útil para acessibilidade e navegação sem o uso das mãos, mas não otimizado para o caso de uso "fale uma frase e ela é digitada".
Talon Voice — a opção mais poderosa no espaço de controle de voz Linux. Suporta comandos de voz programáveis, gramáticas de codificação e entrada compatível com Wayland em compilações recentes. A curva de aprendizado é íngreme e se inclina para usuários avançados que desejam controlar todo o seu fluxo de trabalho por voz. Se você precisa de voz para escrever código sem mãos, vale a pena investigar o Talon.
OpenWhispr — um aplicativo de ditado de código aberto (MIT) mais recente executado em Linux, macOS e Windows, desenvolvido em modelos locais Whisper/NVIDIA Parakeet com modelos de nuvem opcionais por meio de sua própria chave de API (BYOK). Execute-o totalmente em sua própria máquina e a transcrição é ilimitada e privada. Para usuários de Linux que desejam uma ferramenta gratuita, com prioridade na privacidade e voltada apenas para ditado, e que não se importam com um pouco de configuração, é uma opção genuinamente boa - e é o sinal mais claro de que a era "sem voz para texto real em Linux" acabou.
Handy — outro aplicativo de voz para texto gratuito e de código aberto para Linux, macOS e Windows (construído em Tauri) que funciona totalmente offline. É deliberadamente mínimo: um atalho push-to-talk configurável que cola a transcrição no campo ativo, sem o conjunto mais amplo de recursos. Vale a pena dar uma olhada se você quiser algo leve e privado e não precisar de trechos ou edição de IA.
Voxtype e Vocalinux — dois participantes mais recentes que confirmam a tendência do Whisper offline em Linux. Voxtype é uma ferramenta de voz para texto push-to-talk para Linux e macOS com reconhecimento totalmente offline; Vocalinux emparelha whisper.cpp e VOSK para ditado 100% offline e de código aberto. Ambos são apenas para ditado: sem trechos, sem edição de IA, sem conta multiplataforma. Se o processamento offline for um requisito inegociável para você, eles merecem estar na sua lista de finalistas ao lado de OpenWhispr e Handy.
Lightning Assist — um aplicativo de desktop Electron multiplataforma com ditado de voz push-to-talk no desktop e expansão de texto. Descrito mais abaixo. O posicionamento é diferente do Talon e das ferramentas de código aberto somente para ditado acima: ele combina voz com expansão de texto e comandos de IA em um aplicativo, com um único modelo de tecla de atalho em vez de uma gramática programável.
Nenhuma dessas é a solução perfeita para ditado de voz no Linux. Elas resolvem partes diferentes do problema.
O que um "bom ditado de voz Linux" realmente requer
Antes de escolher uma ferramenta, é útil definir qual é o nível mínimo aceitável. Uma solução sólida de ditado entre aplicativos em Linux precisa:
- Funcionar em qualquer aplicativo, não apenas na janela da própria ferramenta - navegadores, IDEs, terminais, aplicativos Electron, aplicativos nativos GTK/Qt.
- Lidar com o Wayland ou, pelo menos, ser honesto sobre as limitações exclusivas do X11.
- Não exigir root para ser executado — o ditado é uma ferramenta de produtividade do espaço do usuário, não um daemon do sistema.
- Não bloquear — segure uma tecla, fale, solte e continue trabalhando. Nenhum diálogo modal que roube o foco.
- Ter desempenho razoável com vocabulário técnico — os usuários de Linux ditam nomes de host, sinalizadores de comando, nomes de pacotes e identificadores de código. Um modelo treinado em fala coloquial vai tropeçar em
systemctl,xdg-openou~/.config/.
Os back-ends baseados em Whisper (sejam locais ou de API) se saem melhor com termos técnicos do que os modelos mais antigos somente em nuvem, o que é um dos motivos pelos quais a comunidade Linux migrou para as soluções Whisper.
Lightning Assist em Linux
Lightning Assist é um aplicativo de desktop desenvolvido com Electron, o que significa que ele é executado na mesma base de código em Windows, macOS e Linux. A versão Linux é empacotada como um AppImage (universal – funciona no Fedora, RHEL, Arch e qualquer distro) e um .deb para Debian, Ubuntu, Linux Mint e Pop!_OS. Nenhum pacote AUR neste momento; o AppImage é a opção independente de distribuição.
O recurso de ditado de voz funciona via push-to-talk: segure Ctrl+Super (Super sendo a tecla Meta/Windows na maioria dos teclados), fale, solte. O back-end baseado em Whisper transcreve o áudio e o resultado é digitado na janela em foco. Por ter sido projetado como uma ferramenta entre aplicativos – o mesmo modelo do lado de expansão de texto do aplicativo – não exige que você mude para uma janela de ditado dedicada.
Lightning Assist também inclui expansão de texto com comandos de IA: gatilhos curtos que se expandem para um texto mais longo ou invocam um modelo de IA em linha. Para usuários de Linux que desejam "digitar este trecho" e "transcrever o que eu disse", essa combinação está em uma assinatura de US$ 5,99/mês, com uma avaliação gratuita disponível.
Instalação em Linux
Consulte /get-started para obter o passo a passo completo e /downloads para obter o pacote mais recente. A versão curta:
AppImage (funciona na maioria das distribuições):
chmod +x Lightning-Assist-*.AppImage
./Lightning-Assist-*.AppImage
Nenhuma instalação necessária. O AppImage já traz o próprio runtime embutido.
Debian/Ubuntu/Linux Mint/Pop!_OS (.deb):
sudo dpkg -i lightning-assist_*.deb
sudo apt-get install -f # resolve any missing dependencies
Após a instalação, inicie o aplicativo, faça login e ative o gatilho AI Speech / push-to-talk na página Gatilhos. Nenhum acesso root é necessário em tempo de execução.
Consulte /pricing para obter detalhes do plano atual e duração do teste.
Fluxos de trabalho práticos de ditado em Linux
O valor do ditado entre aplicativos torna-se concreto quando você o mapeia para coisas que você realmente faz.
Mensagens de commit do Git. Coloque o foco no terminal após preparar suas alterações, segure Ctrl+Super, dite "corrigir o ponteiro nulo na camada de cache quando a associação for alterada", solte. A mensagem aparece no prompt do terminal pronta para git commit -m. Sem troca de contexto, sem precisar pegar o mouse.
Slack, Discord e Element. Esses são aplicativos Electron, o que significa que recebem entrada sintetizada da mesma forma que um campo de texto em um navegador. Dite sua resposta ali mesmo, sem abrir uma janela de ditado separada.
VSCode e IDEs JetBrains. Coloque o foco no editor, dite um bloco de comentários ou um nome de variável em camelCase (a maioria dos modelos Whisper lida com camelCase falado razoavelmente quando você diz "camel case"). Para prosa mais longa – um docstring, uma seção README – o ditado é mais rápido do que a digitação.
Comandos de terminal. Comandos mais curtos são mais rápidos de digitar do que de falar. Porém, comandos mais longos e estruturados (curl -X POST https://api.example.com/v1/resources -H "Content-Type: application/json" -d '{"key": "value"}') são mais rápidos de ditar, uma vez que você tenha o padrão na memória muscular para a tecla de atalho.
Documentação do Markdown. Dite em qualquer editor que renderize Markdown — Obsidian, Typora, um buffer vim simples, VSCode com uma extensão Markdown. A transcrição não sabe que você está escrevendo Markdown, então você precisará adicionar crases e símbolos de título manualmente, mas o ditado em prosa em nível de parágrafo é rápido.
Advertências sobre Wayland
Os aplicativos Electron executados no Wayland podem usar o sinalizador --ozone-platform=wayland ou a variável de ambiente ELECTRON_OZONE_PLATFORM_HINT=auto (suportada no Electron 21+) para executar nativamente no protocolo Wayland em vez de através do XWayland.
O funcionamento da entrada de texto sintético depende do compositor. GNOME sob Wayland (Mutter) e KDE Plasma sob Wayland (KWin) implementam o protocolo zwp_virtual_keyboard_v1 que permite que um aplicativo simule eventos de teclado - que é como a injeção de texto entre aplicativos funciona sem o xdotool do X11. Em compositores que não implementam este protocolo, a injeção de entrada pode recorrer à colagem da área de transferência, que pode se comportar de maneira diferente em alguns aplicativos (particularmente terminais com o modo bracketed paste).
Se você estiver no Wayland e o texto ditado não estiver aparecendo onde você espera, o diagnóstico mais confiável é verificar qual protocolo Wayland seu compositor expõe. No GNOME: wayland-info | grep keyboard. Os detalhes dependem da versão do seu compositor.
O substituto – copiar para a área de transferência e colar – funciona na maioria dos aplicativos, mas pode interromper o fluxo push-to-talk se o aplicativo de destino já tiver o conteúdo da área de transferência de que você precisa.
Esta é uma área que está melhorando ativamente em todo o ecossistema Linux. A situação em 2026 é materialmente melhor do que era em 2023.
Considerações finais
O ditado de voz em Linux não é um problema resolvido, mas é viável. O quadro honesto em 2026: o Speech Note oferece a transcrição do Whisper offline com uma etapa de copiar e colar; OpenWhispr e Handy oferecem ditado gratuito e de código aberto que digita em qualquer aplicativo (o OpenWhispr é executado até mesmo totalmente local); Voxtype e Vocalinux estendem a mesma tendência offline; o Talon Voice oferece programabilidade profunda ao custo de uma curva de aprendizado acentuada; o Lightning Assist oferece uma camada push-to-talk simples que digita em qualquer aplicativo, combinada com expansão de texto e comandos de IA, por uma taxa mensal fixa. Se você só precisa de ditado e quer isso de graça, comece com OpenWhispr; se você deseja ditado mais trechos e reescritas de IA em uma ferramenta, é aí que Lightning Assist se encaixa.
Se sua necessidade principal é o ditado entre aplicativos com configuração mínima no Ubuntu, Fedora, Arch, Debian ou Pop!_OS, comece com o teste do Lightning Assist — baixe-o em /downloads ou siga o guia de primeiros passos. A página dedicada voz para texto no Linux cobre os caminhos de instalação específicos do Linux e a configuração do Wayland com mais detalhes. Se você precisar de controle total da área de trabalho com as mãos livres, dê uma olhada no Talon. Se você precisar de processamento totalmente offline sem assinatura, o Speech Note preenche essa lacuna.
A lacuna entre Linux e outros sistemas operacionais para ditado está diminuindo, em parte porque o Whisper tornou acessível a transcrição offline de alta qualidade e em parte porque os protocolos de entrada do Wayland amadureceram. É um momento razoável para tentar novamente se você desistiu em 2022 ou antes.
Fontes
- OpenAI Whisper — modelo de reconhecimento de fala de código aberto.
- Numen — controle de voz para desktop.
- Talon Voice — site oficial.
- Speech Note — conversão de fala em texto offline para Linux.
- OpenWhispr — ditado multiplataforma de código aberto (Whisper / Parakeet).
- Handy — transcrição push-to-talk mínima de código aberto.
- Especificação do protocolo Wayland zwp_virtual_keyboard_v1.
- Lightning Assist — downloads, guia de primeiros passos, preços
- Voz para texto no desktop — passo a passo geral de configuração push-to-talk
- Digitação por voz push-to-talk em aplicativos de e-mail e bate-papo – ditado entre aplicativos explicado