La respuesta corta
¿Se puede crear una versión local de Wispr Flow?
Sí. Whisper puede transcribir en el dispositivo, pero necesitás construir el atajo global, la captura del micrófono, la eliminación del audio y la inserción del texto; usar Whisper por sí solo no garantiza privacidad.
Si solo leés una cosa
Las 4 ideas clave
- Whisper es el modelo abierto de OpenAI; Wispr Flow es una aplicación comercial distinta.
- Una app local necesita hotkey, micrófono, inferencia, limpieza e inserción de texto.
- Probala sin internet y revisá código y tráfico antes de decir que nada sale del equipo.
- En macOS, micrófono y Accessibility son permisos diferentes y sensibles.
Mapa visual
De tu voz al campo de texto
La privacidad depende de cada flecha: una sola API remota cambia la promesa de procesamiento local.
Primero: Whisper no es Wispr Flow
Whisper es un modelo general de reconocimiento de voz que puede transcribir varios idiomas, traducir audio al inglés e identificar el idioma. OpenAI publicó su código y pesos bajo licencia MIT; su repositorio supera las 100 mil estrellas en GitHub.
Wispr Flow es una aplicación completa de dictado con edición, contexto y sincronización. Según su propia documentación, la transcripción siempre ocurre en la nube, aunque Privacy Mode y Private Cloud Sync permiten controlar entrenamiento y retención. Eso no es igual a procesamiento 100% local.
Una versión local inspirada en ese flujo usa Whisper o whisper.cpp en tu computadora y agrega las piezas que faltan. No debería copiar el nombre, la marca ni la interfaz de Wispr.
Cuando funcione, podés documentarla como proyecto en tu portafolio de GitHub y convertir el checklist de pruebas en una Skill reusable.
Las cinco piezas de una app de dictado local
Una app funcional necesita una cadena corta y verificable:
- Atajo global: una tecla o combinación inicia y detiene el dictado.
- Captura del micrófono: la app guarda temporalmente el audio.
- Transcripción local: Whisper convierte el audio en texto sin una API remota.
- Limpieza controlada: reglas locales corrigen espacios, puntuación o términos frecuentes.
- Inserción: el texto se copia o pega en el campo que ya estaba activo.
En macOS, la aplicación necesita permiso para usar el micrófono. Para pegar automáticamente en otras aplicaciones también puede requerir permiso de Accessibility. Ese segundo permiso es poderoso: solo debería concederse a una app cuyo código y comportamiento entendés.
Whisper original o whisper.cpp
Para una app personal en una laptop, whisper.cpp suele ser una base práctica porque está diseñado para ejecutar los modelos de Whisper eficientemente en distintos dispositivos y ofrece ejemplos de micrófono en tiempo real. En Apple Silicon puede aprovechar Metal.
El repositorio original openai/whisper usa Python y PyTorch. Es excelente para experimentar y transcribir archivos, pero puede ser más pesado para una utilidad que vive encendida. La elección depende del sistema operativo, hardware y experiencia de quien la mantendrá.
| Opción | Conviene cuando… | Consideración |
|---|---|---|
| OpenAI Whisper | Ya trabajás con Python o querés seguir la implementación original | Dependencias más pesadas |
| whisper.cpp | Querés una app ligera, multiplataforma o integrada con Swift/C++ | Requiere compilar o usar bindings |
| API de transcripción | Priorizás rapidez de desarrollo sobre procesamiento local | El audio sale del dispositivo |
Cómo pedirle a Claude que construya la primera versión
No empecés solicitando “cloná Wispr Flow”. Definí un producto mínimo con límites, pruebas y privacidad verificable.
Copiá este brief:
Quiero construir una utilidad personal de dictado para macOS, inspirada en el flujo de sostener una tecla, hablar y pegar el resultado en la app activa. No copies la marca, el nombre ni la interfaz de Wispr Flow.
Requisitos de la primera versión:
1. Usar
whisper.cppy un modelo multilingüe descargado localmente.2. No llamar APIs de transcripción, LLMs remotos ni servicios cloud.
3. Mantener el audio solo durante la transcripción y eliminarlo al terminar.
4. Permitir configurar un atajo global push-to-talk.
5. Mostrar el texto antes de habilitar el pegado automático.
6. Solicitar únicamente permisos de micrófono y, si lo apruebo, Accessibility.
7. Incluir un indicador visible mientras el micrófono está activo.
8. Crear pruebas y un README que explique arquitectura, permisos, datos y desinstalación.
Antes de escribir código, proponé el stack, el diagrama de datos, los riesgos y criterios de aceptación. Trabajá por etapas y pedime aprobación antes de instalar dependencias o cambiar permisos del sistema.
Mostrar el texto antes de pegarlo hace que la primera versión sea menos mágica, pero mucho más fácil de probar. Cuando la transcripción sea estable, podés habilitar la inserción automática.
Cómo comprobar que realmente es local
“Usa Whisper” no demuestra que una aplicación sea privada. Whisper también puede ejecutarse detrás de una API. Para sostener que el audio no sale de la laptop, verificá:
- El modelo está descargado en una carpeta local.
- El código de transcripción no contiene endpoints ni claves de API.
- La app funciona con Wi-Fi apagado después de descargar el modelo.
- Los archivos temporales de audio se eliminan al terminar.
- No hay una función de reescritura que mande el texto a un LLM remoto.
- La telemetría, actualizaciones y reportes de errores están documentados.
- El README diferencia “no se almacena” de “no se transmite”.
La prueba sin conexión es útil, pero no reemplaza una revisión de código y tráfico de red. Si vas a dictar información de clientes, médica, legal o confidencial, pedí una revisión de seguridad antes de confiarle ese contenido.
Qué modelo elegir para español
Usá un modelo multilingüe; las variantes con .en están optimizadas para inglés. Un modelo pequeño responde más rápido y consume menos batería, mientras uno mayor suele mejorar precisión a cambio de memoria y latencia.
Probá con tu voz y vocabulario real. Prepará veinte frases que mezclen nombres propios, anglicismos de marketing, números, URLs y expresiones de Costa Rica. Medí cuánto tarda, cuántas correcciones hacés y si corta el inicio o final de la frase.
Un diccionario local de términos frecuentes puede mejorar nombres de marcas sin enviar contexto de la pantalla. Evitá agregar “context awareness” hasta entender exactamente qué texto leería la app y dónde se procesaría.
Criterios de aceptación antes de usarla todos los días
La app está lista cuando cumple pruebas observables, no cuando “parece funcionar”.
- El indicador del micrófono aparece y desaparece correctamente.
- El atajo no interfiere con shortcuts importantes del sistema.
- Transcribe español e inglés en las aplicaciones que realmente usás.
- No pega texto dos veces ni reemplaza contenido seleccionado por accidente.
- Funciona sin internet después de instalar el modelo.
- El audio temporal desaparece al completar o cancelar.
- Podés desactivar el pegado automático y revocar permisos fácilmente.
También agregá una salida de emergencia: presionar Escape debería cancelar, borrar el audio temporal y no insertar nada.
¿Vale la pena construirla?
Sí, si querés aprender, necesitás control local o el dictado es central en tu día. Pero “gratis” no significa costo cero: vas a invertir tiempo en instalación, pruebas, actualizaciones y mantenimiento cuando macOS cambie permisos o APIs.
Si preferís una experiencia pulida y soporte, una herramienta comercial puede seguir teniendo sentido. Revisá sus controles de privacidad y decidí según la sensibilidad de lo que dictás. Si elegís construir, empezá pequeña: push-to-talk, Whisper local, preview y copiar. La magia puede llegar después; la confianza tiene que llegar primero.
Sin tecnicismos
Preguntas frecuentes
¿Whisper y Wispr Flow son lo mismo?
No. Whisper es un modelo abierto de reconocimiento de voz publicado por OpenAI. Wispr Flow es un producto comercial completo de dictado que procesa la transcripción en la nube.
¿Whisper funciona sin internet?
Sí, cuando descargás el modelo y ejecutás la inferencia localmente con la implementación original o una opción como whisper.cpp. Una app también puede usar Whisper mediante una API, por lo que hay que verificar su arquitectura.
¿Necesito saber programar?
Un asistente puede ayudarte, pero la app toca micrófono, atajos globales y permisos de Accessibility. Debés probarla, revisar dependencias y entender cómo desinstalarla y revocar accesos.
¿Qué modelo sirve para español?
Elegí una variante multilingüe, no una terminada en .en. Empezá con un tamaño pequeño o medio y compará velocidad y precisión con vocabulario real.
¿Cómo sé que el audio no sale de mi laptop?
Confirmá que funciona sin conexión, que no usa endpoints ni claves remotas, que elimina temporales y que ninguna función de edición envía texto a un LLM cloud. Para datos sensibles, solicitá una revisión adicional.
Para verificar y seguir
Fuentes oficiales
- OpenAI: repositorio oficial de Whisper (se abre en una pestaña nueva)
- ggml-org: whisper.cpp (se abre en una pestaña nueva)
- Apple: controlar acceso al micrófono (se abre en una pestaña nueva)
- Apple: permisos de Accessibility (se abre en una pestaña nueva)
- Wispr Flow: privacidad y procesamiento cloud (se abre en una pestaña nueva)



