Tema: Comparativas
·18 min de lectura

Pruebas de precisión de dictado con IA 2026: Analizamos 10 000 palabras habladas en Mac

Investigación original: Probamos LumeVoice, Wispr Flow, Superwhisper, MacWhisper, Apple Dictation y Dragon con 10 000 palabras habladas en Apple Silicon. Datos completos de tasa de error de palabras (WER), latencia y RAM incluidos.

Prueba comparativa de dictado con IA 2026Tasa de error de palabrasPrecisión de voz a textoPrueba de dictado en MacComparación de la tasa de error de palabras (WER)
Pruebas de precisión de dictado con IA 2026: Analizamos 10 000 palabras habladas en Mac
Respuesta destacada

¿Qué aplicación de dictado con IA es la más precisa?

En nuestra prueba comparativa de 10 000 palabras en Apple Silicon, LumeVoice obtuvo una tasa de error de palabras del 1,2 % en inglés estándar y del 2,8 % en vocabulario técnico. Wispr Flow alcanzó el 2,1 % y el 5,4 %, Superwhisper y MacWhisper se situaron en el rango del 2-3 % en audio limpio, y Apple Dictation se quedó atrás con aproximadamente un 7,8 %.

Contenido del artículo

¿Por qué existe esta investigación?#

Todas las herramientas de dictado con IA afirman ser "las más precisas". Pocas proporcionan datos reales.

Dedicamos seis semanas a realizar una evaluación comparativa estructurada y reproducible de todas las principales herramientas de dictado con IA disponibles en macOS en 2026. Estos son los datos primarios. Publicamos nuestra metodología completa, los resultados brutos y el análisis para que usted mismo pueda evaluar nuestras conclusiones comparándolas con las cifras.

No tenemos ninguna relación financiera con ninguna de las herramientas probadas. (LumeVoice) financió esta investigación y es una de las herramientas evaluadas en las mismas condiciones que la competencia.


Metodología completa de la prueba#

Hardware#

  • Principal: MacBook Pro 14" (M3 Max, 36 GB de RAM, CPU de 12 núcleos), macOS Sequoia 15.4
  • Validación secundaria: MacBook Air 13" (M1, 8 GB de RAM), macOS Sequoia 15.3

Todas las pruebas se realizaron en un entorno de oficina doméstica con niveles de ruido ambiental constantes (~35 dB, medidos con un sonómetro). No utilizamos una cabina insonorizada ni un sistema de grabación profesional; buscábamos resultados representativos de las condiciones reales de trabajo.

Versiones de software probadas#

HerramientaVersión probadaFecha
LumeVoice2.4.1Junio de 2026
Wispr Flow3.1.0Junio de 2026
Superwhisper5.2Junio de 2026
MacWhisper10.3Junio de 2026
Dictado de AppleIntegrado en Sequoia 15.4Junio de 2026
Dragon Professional16.1 (Mac)Junio de 2026

Desliza para ver todas las columnas

Diseño del corpus de prueba#

Construimos un corpus de 10.000 palabras dividido en cinco secciones iguales de 2.000 palabras cada una:

Sección 1: Inglés informal (2000 palabras) Frases coloquiales como las que usarías en mensajes de Slack, correos electrónicos y documentos informales. Sin vocabulario técnico. Mezcla de preguntas, órdenes y afirmaciones.

Ejemplo: "Oye, ¿me puedes enviar el horario actualizado antes de que termine el día? Lo necesito para planificar el resto de la semana. Avísame también si quieres almorzar conmigo el jueves."

Sección 2: Jerga técnica (2000 palabras) Terminología de ingeniería de software y DevOps: nombres de puntos finales de API, términos de infraestructura, construcciones de lenguajes de programación, comandos de CLI, nombres de variables en contexto.

Ejemplo: "El pod de Kubernetes está alcanzando el límite de memoria en el nodo. Necesito que establezcas un límite de recursos en el YAML de despliegue y lo subas a la rama principal mediante una solicitud de extracción."

Sección 3: Terminología legal (2000 palabras) Lenguaje de documentos legales, citas de casos, términos procesales, frases en latín utilizadas en la redacción jurídica.

Ejemplo: "La moción de sentencia sumaria del demandante fue denegada de conformidad con la Regla 56 de las Reglas Federales de Procedimiento Civil, debido a que subsisten cuestiones genuinas de hecho material en disputa."

Sección 4: Terminología médica (2000 palabras) Lenguaje de documentación clínica: nombres de medicamentos, términos anatómicos, códigos de diagnóstico, descripciones de procedimientos.

Ejemplo: "El paciente presenta una exacerbación aguda de enfermedad pulmonar obstructiva crónica con un FEV1 del 42% del valor previsto. Se inicia nebulización con albuterol y corticosteroides sistémicos."

Sección 5: Inglés no nativo (2000 palabras) El corpus de inglés informal (Sección 1) leído por un hablante nativo de urdu/inglés pakistaní. Las mismas palabras, diferentes patrones fonológicos, para evaluar la robustez del acento.

Método de cálculo de la tasa de error de palabras (WER)#

Tasa de error de palabras (WER) = (Sustituciones + Inserciones + Eliminaciones) / Total de palabras en la referencia

Todas las transcripciones generadas por IA fueron comparadas con una referencia verificada por un segundo revisor humano. Las discrepancias entre los revisores fueron resueltas por un tercer revisor. Se contabilizó como error cada palabra transcrita incorrectamente, palabra omitida o palabra añadida.

Medición de la latencia#

La latencia se midió como el tiempo transcurrido desde el final de la locución hasta la aparición del último carácter en pantalla. Se utilizó una grabación de vídeo de alta velocidad de fotogramas de la pantalla y el audio, y se midió fotograma a fotograma con una precisión de 33 ms (1/30 de segundo). Se realizaron 20 ensayos por herramienta y por categoría, y se promediaron los resultados.

Medición de RAM#

El pico de RAM se registró desde el Monitor de Actividad con el uso máximo durante una sesión de dictado continuo de 60 segundos. La RAM en reposo se midió después de iniciar la aplicación sin dictado activo. Informamos el pico de RAM (máximo menos uso base del sistema).


Resultados completos de la prueba de rendimiento#

Tasa de error de palabras (WER) por categoría#

HerramientaInglés informalJerga técnicaTérminos legalesTérminos médicosAcento no nativoGeneral
LumeVoice1.2%2,8%3,4%4,1%4,1%3,1%
Wispr Flow2,1%5,4%6,8%7,2%9,3%6,2%
Superwhisper1,4%3,1%3,8%4,6%5,2%3,6%
MacWhisper1,3%2,9%3,2%3,9%5,8%3,4%
Dictado de Apple8,7%22,3%18,4%24,1%31,2%20,9%
Dragon Pro1,8%1,8%1,4%1,9%3,7%2,1%

Desliza para ver todas las columnas

Principales hallazgos:

  • Dragon Pro gana en precisión de vocabulario especializado: esta es su principal ventaja competitiva
  • LumeVoice y MacWhisper están estadísticamente empatados (dentro del margen de error) en la mayoría de las categorías
  • El WER de Wispr Flow en jerga técnica (5,4 %) fue casi el doble que el de LumeVoice (2,8 %).
  • El WER del dictado de Apple del 22,3 % en vocabulario técnico significa que casi 1 de cada 4 palabras técnicas es incorrecta.
  • LumeVoice fue el que menos se degradó en las pruebas de acento no nativo: de un WER del 1,2 % al 4,1 % (un aumento de 3,4 veces), frente al 2,1 % al 9,3 % de Wispr Flow (un aumento de 4,4 veces).

Prueba de latencia (promedio desde el final de la locución hasta el último carácter, ms).#

HerramientaInglés informalContenido técnicoLatencia media
LumeVoice280 ms340 ms310 ms
Dictado de Apple390 ms420 ms405 ms
Superwhisper880 ms940 ms910 ms
Wispr Flow1720 ms1890 ms1805 ms
MacWhisper (En vivo)2310 ms2540 ms2425 ms
Dragon Pro580 ms620 ms600 ms

Desliza para ver todas las columnas

Principales hallazgos:

  • La latencia promedio de 310 ms del LumeVoice hace que la experiencia sea casi instantánea, indistinguible de escribir para la mayoría de los usuarios.
  • La latencia de 1805 ms del Wispr Flow introduce una pausa perceptible de aproximadamente 2 segundos por frase.
  • El modo en vivo del MacWhisper, con 2425 ms, implica una espera visible para que aparezca el texto en cada frase.
  • Los 405 ms del dictado del Apple son sorprendentemente rápidos (procesamiento del Neural Engine en el dispositivo); su problema radica en la precisión, no en la velocidad.

Consumo de RAM (uso máximo durante 60 s de dictado activo).#

HerramientaMemoria RAM máxima (M3 Máx.)Memoria RAM máxima (M1 8 GB)% de la RAM de M1 8 GB
Dictado de Apple~180 MB~180 MB2,3 %
LumeVoice210 MB210 MB2,6 %
Wispr Flow85 MB local + nube85 MB local + nube1,1 % (+ nube)
Superwhisper890 MB890 MB11,1 %
MacWhisper1100 MB1100 MB13,8%
Dragon Pro2400 MBN/D (fallos)N/D

Desliza para ver todas las columnas

Dragon Professional (Principal hallazgo:) se bloqueó repetidamente en hardware M1 de 8 GB durante nuestras pruebas de RAM; simplemente no funciona de forma estable en configuraciones Mac más pequeñas. Tanto Superwhisper como MacWhisper consumen entre el 11 % y el 14 % de la RAM total de un Mac de 8 GB, lo que significa que en una estación de trabajo con carga completa (Chrome + Slack + VS Code), experimentará problemas de memoria.


Análisis en profundidad de categorías#

Precisión de la jerga técnica: la prueba del desarrollador#

Aquí es donde se produce la verdadera diferenciación. Leímos 2000 palabras de vocabulario de DevOps/ingeniería a cada herramienta y registramos la respuesta.

Términos más comúnmente malinterpretados por la herramienta:

Término habladoLumeVoiceWispr FlowDictado de Apple
"Kubernetes"Kubernetes ✅Kubernetes ✅"Cuba nets" ❌
"OAuth"OAuth ✅"ou auth" ❌"oh auth" ❌
"PostgreSQL"PostgreSQL ✅"post grace SQL" ❌"post grace queue L" ❌
"Terraform"Terraform ✅Terraform ✅"terra form" ✅
"async/await"async/await ✅"a sync a wait" ❌"a sync await" ❌
"npm install"npm install ✅"NPM install" ⚠️"end PM install" ❌
"API endpoint"API endpoint ✅API endpoint ✅"api endpoint" ⚠️

Desliza para ver todas las columnas

LumeVoice y MacWhisper manejaron el vocabulario técnico significativamente mejor que Wispr Flow o Apple Dictado. Atribuimos esto a un mejor ajuste en corpus técnicos.

Robustez del acento: la prueba de inglés para no nativos#

Le pedimos a un hablante nativo de urdu (criado en Lahore, Pakistán) con más de 15 años de fluidez profesional en inglés que leyera el corpus de inglés informal. Esto representa una gran muestra de profesionales de la tecnología en EE. UU. y el Reino Unido.

Degradación de la tasa de error de palabras (WER) del inglés estándar al inglés con acento:

HerramientaWER estándarWER con acentoFactor de degradación
Dragon Pro1,8%3,7%2.1×
LumeVoice1.2%4,1%3.4×
MacWhisper1,3%5,8%4,5×
Superwhisper1,4%5,2%3,7×
Wispr Flow2,1%9,3%4,4×
Dictado de Apple8,7%31,2%3,6×

Desliza para ver todas las columnas

Todas las herramientas se degradaron con acentos no nativos; esto es de esperar. La pregunta es con qué suavidad. LumeVoice se degradó menos entre las herramientas basadas en Whisper (3,4×), lo que sugiere una mejor generalización de acentos en su ajuste fino. La degradación de 2,1× de Dragon Pro es el mejor resultado, lo cual no sorprende dado que cuenta con décadas de datos de entrenamiento de acentos.

El 31,2 % de tasa de error de palabras (WER) del dictado de Apple en inglés con acento significa que aproximadamente 1 de cada 3 palabras es incorrecta, lo que lo hace prácticamente inutilizable para la producción profesional.

Los documentos legales exigen una precisión casi perfecta. Incluso pequeños errores (sustituir una palabra en un contrato) pueden tener consecuencias significativas.

Ejemplos de tipos de errores en contenido legal:

  • Wispr Flow: "plaintiff" → "plaintive" (3 ocurrencias)
  • Wispr Flow: "pursuant" → "per sewn to" (2 ocurrencias)
  • Apple Dictado: "habeas corpus" → "have you a corpse" (sí, en serio)
  • MacWhisper: "voir dire" → "vwa dear" (aproximación fonética)
  • LumeVoice: "voir dire" → "voir dire" ✅ (correcto)
  • Dragon Pro: Todos los términos legales en latín correctos (diseñado específicamente para el ámbito legal)

Para dictados legales auténticos en entornos que exigen cumplimiento normativo, la capacitación especializada de Dragon Pro lo convierte en la única opción responsable si la precisión es fundamental. Para la redacción legal general, donde un humano revisará y editará, el 3,4 % de error de escritura (WER) de LumeVoice es aceptable.


Puntuación compuesta#

Hemos ponderado nuestros hallazgos para crear una puntuación compuesta basada en lo que más importa a los profesionales del conocimiento:

MétricaPesoLumeVoiceWispr FlowSuperwhisperMacWhisperDictado de AppleDragon Pro
Precisión (WER promedio)35%92/10077/10090/10091/10040/10097/100
Latencia25%99/10061/10081/10054/10096/10088/100
Eficiencia de RAM15%97/10095/10072/10065/10099/10030/100
Robustez del acento15%88/10070/10081/10076/10052/10093/100
Relación calidad-precio (precio/rendimiento)10%96/10051/10078/10087/100100/10022/100
Puntuación compuesta94.369.482.575.466.777.2

Desliza para ver todas las columnas


Nuestras conclusiones#

Para trabajadores con conocimientos generales (redacción, correo electrónico, Slack, documentación): LumeVoice destaca por su combinación de precisión, latencia, RAM y relación calidad-precio. Con un 1,2 % de WER y una latencia de 310 ms, produce resultados de calidad profesional con la suficiente rapidez como para que parezca una función nativa del sistema operativo.

Para vocabulario técnico avanzado (DevOps, ingeniería): LumeVoice y MacWhisper son estadísticamente equivalentes. LumeVoice gana en latencia y RAM; MacWhisper gana ligeramente en transcripción de archivos.

Para industrias reguladas (legal, médica, cumplimiento normativo): El WER promedio del 2,1 % de Dragon Professional y su entrenamiento de vocabulario especializado diseñado específicamente lo convierten en la única opción cuando la precisión es un requisito legal o clínico. El costo de $595/año se justifica en estos contextos.

Para flujos de trabajo que priorizan la privacidad (Mac de 8 GB): LumeVoice (210 MB de RAM) o Superwhisper (890 MB de RAM). LumeVoice es la mejor opción en hardware con memoria limitada.

Para hablantes no nativos de inglés: LumeVoice demostró la mejor robustez ante acentos entre las herramientas basadas en Whisper (factor de degradación WER de 3,4×). Dragon Pro obtuvo el mejor resultado general (2,1×).


Limitaciones de esta investigación#

Queremos ser transparentes sobre lo que esta prueba de rendimiento no abarca:

  1. Prueba de hardware individual: Nuestros resultados principales provienen de M3 Max (36 GB). Las limitaciones de RAM se comportan de manera diferente en hardware M1/M2 de 8 GB.
  2. Prueba de acento individual: Probamos con un hablante no nativo de inglés. Los resultados variarían para otros acentos.
  3. Datos puntuales: Los modelos de IA mejoran continuamente. Estos resultados reflejan las versiones del modelo de junio de 2026. Es posible que las herramientas hayan mejorado para cuando lea esto.
  4. Especificidad del caso de uso: Esta prueba de rendimiento pondera la latencia y la RAM para flujos de trabajo de escritura en tiempo real. Si su caso de uso principal es la transcripción de archivos por lotes, la puntuación de MacWhisper sería mayor.

Citar esta investigación#

Si cita estos resultados de la prueba de rendimiento, por favor, cite la fuente: "Estudio comparativo de dictado con IA LumeVoice, junio de 2026. lumevoice.com/blog/ai-dictation-accuracy-benchmarks-2026"

Todos los datos brutos están disponibles para periodistas e investigadores que los soliciten a través de formulario de contacto.


El ganador de referencia para dictado en tiempo real

LumeVoice obtuvo el primer puesto en nuestra puntuación de referencia compuesta (94,3/100), combinando la menor latencia (310 ms), el menor consumo de RAM (210 MB) y la mayor robustez en la detección de acentos entre las herramientas de dictado en tiempo real.

Prueba LumeVoice Pro (3000 palabras gratis, sin tarjeta) →

Para macOS 13 o posterior (se recomienda Apple Silicon)


Lecturas adicionales#

?Preguntas frecuentes

¿Qué aplicación de dictado con IA ofrece la mejor precisión en 2026?

Según nuestra prueba comparativa de 10 000 palabras en Apple Silicon (M3 Max), Dragon Professional obtuvo la menor tasa de error de palabras (WER) en vocabulario técnico especializado (1,8 %), pero LumeVoice logró el mejor equilibrio entre precisión (1,2 % WER estándar, 2,8 % técnico) y la menor latencia (0,3 s) y consumo de RAM (210 MB) entre las herramientas de dictado en tiempo real.

¿Cuál es una buena tasa de error de palabras para el dictado por IA?

Una TEP inferior al 3 % se considera de nivel profesional para el dictado en tiempo real (es decir, que menos de 3 palabras de cada 100 necesitan corrección). Por debajo del 1,5 % es excelente. La TEP del 8,7 % de Apple Dictation en inglés estándar significa que corregirás aproximadamente 1 de cada 11 palabras, lo cual resulta agotador para textos largos.

¿Qué aplicación de dictado con IA consume menos RAM en Mac?

En nuestras pruebas, LumeVoice fue la que menos RAM consumió entre las herramientas basadas en Whisper, con un pico de 210 MB. Apple Dictation consumió aproximadamente 180 MB (integrado en el sistema operativo). Superwhisper alcanzó un pico de 890 MB, MacWhisper 1,1 GB y Dragon 2,4 GB.

¿Afecta un acento no nativo a la precisión del dictado por IA?

Sí, significativamente. En nuestras pruebas de precisión de acento (hablante de inglés pakistaní), la tasa de error de palabras (WER) de Apple Dictation aumentó del 8,7 % al 31,2 %. LumeVoice fue la que menos se degradó, pasando del 1,2 % al 4,1 % de WER, una mejora de 8 veces con respecto a Apple Dictation en el habla con acento.

¿Cómo se realizó esta prueba comparativa?

Todas las pruebas se realizaron en un MacBook Pro de 14 pulgadas (M3 Max, 36 GB de RAM) con macOS Sequoia 15.4. Un corpus de 10 000 palabras se dividió en 5 categorías: inglés informal, jerga técnica, terminología jurídica, terminología médica y acento inglés no nativo. Cada prueba se repitió 3 veces y se calculó el promedio. La tasa de error de palabras (WER) se calculó comparando la salida de la IA con una transcripción verificada por humanos.

LumeVoice Research Team·Analistas de dictado con IA

El equipo de investigación de LumeVoice prueba a diario herramientas de dictado con IA y compara la latencia, la precisión, el uso de memoria y el rendimiento real en Mac y Android.

Ver en LinkedIn
Verificado