
Transcripción japonesa con kanji: guía para 2026
Summarize this article with:
La transcripción japonesa es más difícil de lo que parece porque el propio sistema de escritura es el reto. Una transcripción correcta usa kanji, hiragana y katakana en los lugares adecuados, resuelve los homófonos por contexto y conserva las formas verbales de keigo que cargan significado social. Modelos modernos como Whisper Large-v3, Deepgram Nova-3 y AssemblyAI Universal-3 Pro soportan japonés con salida mixta correcta. Los dialectos regionales como el kansai y otros reducen la precisión de forma notable frente al habla estándar de Tokio.
Japanese audio transcribes into three writing systems simultaneously, and getting all three right is what separates a usable transcript from a readable one. When a speaker says "kyou wa hareru deshou," the correct written form is "今日は晴れるでしょう" not "きょうはれるでしょう." Both represent the same sounds. Only one is how Japanese is actually written.

This post covers how AI handles the script layer, the register layer, and the dialect layer for Japanese transcription in 2026, and what to look for when choosing a tool.
The Three-Script Problem
Japanese is written with three coexisting scripts:
- Kanji are Chinese-origin characters used for content words, place names, and verbs (共有する, 東京, 行く).
- Hiragana handles grammatical endings, particles, and function words (は, が, です, ている).
- Katakana is used for loanwords and foreign proper nouns (マーケティング, アジェンダ, コーヒー).
A proper transcript uses all three in the right places. An all-hiragana transcript is the machine equivalent of writing English without any capital letters or punctuation, technically decodable but not production-ready.
Older or lighter speech-to-text systems sometimes output all-hiragana or all-katakana. This was common with early cloud APIs and still appears with small Whisper variants (tiny, base). Whisper Large-v3, Deepgram Nova-3, and AssemblyAI Universal-3 Pro all output standard mixed-script Japanese as of 2026, verified against their published language documentation.
No Spaces and the Tokenization Layer
English words are separated by spaces. Japanese is not. The sentence "今日は東京に行きます" has no word boundaries marked in the text at all. This creates a fundamental upstream challenge: before an AI can output the right kanji, it has to segment continuous phoneme streams into the right morphemes and then assign the right written form.
Los modelos modernos de extremo a extremo manejan esto de forma implícita, pero explica por qué los errores de ASR en japonés se ven distintos de los errores en inglés. Un error en inglés sustituye una palabra por otra. Un error en japonés suele producir una cadena de caracteres que parece plausible, pero que es un kanji incorrecto, una palabra real con un significado diferente, o una combinación que no existe en el idioma.
Desambiguación de homófonos: el subproblema más difícil
El japonés tiene una gran cantidad de homófonos: palabras que suenan idénticas pero se escriben con kanji distintos y tienen significados diferentes. La palabra "kikan" puede ser 期間 (periodo de tiempo), 機関 (motor o institución), 器官 (órgano) o 帰還 (regreso), entre otras. El significado del hablante es obvio por el contexto. La IA tiene que usar ese contexto para elegir el kanji correcto.
Los modelos grandes resuelven correctamente la mayoría de los homófonos comunes. Whisper Large-v3 corrige errores de homófonos que Whisper Small produce con la misma entrada. El modo de fallo se reduce al vocabulario técnico, palabras compuestas poco frecuentes y nombres propios (especialmente apellidos japoneses, donde el mismo kanji puede tener varias lecturas válidas).
Una solución práctica: proporcionar un glosario de términos específicos del dominio y nombres propios antes de transcribir. La mayoría de las herramientas profesionales aceptan una pista de vocabulario o una entrada de aviso que orienta al modelo hacia el kanji correcto para términos especializados recurrentes.
Para un análisis más profundo de por qué el tamaño del modelo importa en idiomas como el japonés, consulta la discusión sobre factores de precisión en la transcripción.
On'yomi, Kun'yomi y polifonía
La mayoría de los kanji tienen al menos dos sistemas de lectura: el on'yomi (la pronunciación derivada del chino, que se usa típicamente en palabras compuestas) y el kun'yomi (la pronunciación nativa japonesa, que se usa cuando el kanji aparece solo o con terminaciones en hiragana). El kanji 水 se lee "sui" en 水曜日 (miércoles) y "mizu" cuando aparece solo y significa agua. El contexto suele determinar la lectura sin ambigüedad, pero con los caracteres más ambiguos (los investigadores cuentan varios cientos con lecturas que dependen genuinamente del contexto), incluso los modelos grandes aciertan a veces con la equivocada.
Este es un problema distinto al de los homófonos. Aquí tanto el sonido como la forma escrita son correctos, pero el modelo produce el carácter equivocado para el contexto. Estos errores son comparativamente raros en los modelos grandes actuales, pero siguen siendo más frecuentes en compuestos de kanji con pocos recursos y en nombres propios, donde los datos de entrenamiento son más escasos.
Keigo: el nivel de registro
El japonés tiene tres registros honoríficos que se usan en contextos empresariales y formales:
- Sonkeigo eleva al sujeto de la acción (la otra persona hace algo importante). "Irasshaimasu" en lugar de "kimasu" para "venir".
- Kenjougo rebaja al hablante (el hablante hace algo con humildad para la otra persona). "Itashimasu" en lugar de "shimasu" para "hacer".
- Teineigo es la forma cortés por defecto en la mayoría del habla empresarial. Terminaciones "desu" y "masu".
Una reunión de negocios japonesa alterna entre los tres según la jerarquía del hablante y la acción que se describe. Esto hace que el audio formal japonés tenga un vocabulario más variado que su equivalente en inglés, incluso cuando el tema es el mismo.
La transcripción con IA preserva el keigo al conservar exactamente lo que dijo el hablante. El modelo no aplana "irasshaimasu" a "kimasu". El riesgo real es que el modelo identifique mal la forma verbal en audio ruidoso o en contextos poco habituales, no que la sustituya por un equivalente menos formal. El habla cortés estándar (teineigo) la manejan de forma fiable los tres motores principales. Las construcciones complejas de sonkeigo en discursos ceremoniales muy formales, lenguaje ritual académico o ciertos dialectos regionales pueden presentar errores puntuales y agradecen una revisión editorial ligera.
Para las empresas japonesas esto importa porque el gijiroku (議事録), las actas formales de reunión que se esperan en la cultura corporativa japonesa, son documentos con implicaciones legales. Una transcripción que aplana la capa de keigo pierde información que los lectores japoneses extraen de la elección de palabras para entender quién mostraba deferencia hacia quién.
Préstamos katakana y latín intercalado
El audio de negocios y tecnología en japonés mezcla constantemente japonés nativo con préstamos y acrónimos. La forma escrita correcta sigue reglas predecibles:
- Las palabras de origen inglés pasan a katakana: "marketing" se convierte en マーケティング, "agenda" en アジェンダ.
- Los acrónimos latinos intercalados se mantienen en escritura latina: OKR, KPI, SaaS, PR.
- Algunos términos fluctúan entre ambos sistemas (マーケター frente a marketing manager, ambos aparecen en la práctica).
Un motor de transcripción que funcione correctamente para audio empresarial japonés produce katakana para los préstamos reconocidos y conserva la escritura latina para los acrónimos. Los motores que transliteran todo a kana o que convierten los préstamos de vuelta al inglés generan resultados no estándar.
Mi opinión: el manejo del katakana es una de las pruebas rápidas más claras para una herramienta de transcripción japonesa. Sube 30 segundos de una reunión de una startup tecnológica y comprueba si "platform" vuelve como プラットフォーム o algo no estándar. La mayoría de las herramientas con modelos grandes superan esta prueba. Las APIs más pequeñas o antiguas no.
Puntuación: ancho completo o incorrecto
El japonés usa caracteres de puntuación distintos a los del texto occidental:
- 、 (toten) es la coma.
- 。 (kuten) es el punto y final.
- 「」 son las comillas para el discurso directo.
- 『』 se usan para citas anidadas o títulos.
Una transcripción que devuelva "今日は晴れです, 散歩しました." con comas y puntos occidentales es incorrecta según los estándares tipográficos japoneses. En la tradición de escritura vertical original (tategaki, donde el texto corre de arriba abajo en columnas), estos caracteres también rotan y se posicionan de forma distinta que en el texto horizontal, pero la mayoría de las transcripciones digitales se generan en formato horizontal (yokogaki).
Los motores bien implementados producen automáticamente la puntuación japonesa de ancho completo cuando el idioma está configurado como japonés. Si tu transcripción sale con puntuación occidental, revisa la selección de idioma antes de asumir que es una limitación del modelo.
Precisión de los dialectos
El japonés tiene una variación dialectal regional notable. Los motores están entrenados principalmente con el japonés estándar de Tokio (el dialecto que se usa en las emisiones de NHK y en la mayoría de los medios formales).
El japonés estándar de Tokio y el habla formal estilo NHK se transcriben con mayor precisión en todos los motores principales. El dialecto de Kansai (Osaka, Kioto, Kobe) tiene patrones de acento tonal y vocabulario distintos del estándar de Tokio, y la precisión baja en comparación con el japonés estándar. Los dialectos de Tohoku y Kyushu presentan retos adicionales. Ninguno de los grandes motores internacionales ofrece actualmente modelos específicos para las variedades regionales del japonés.
Para contenido en un kansai-ben marcado, prevé más tiempo de edición que para una conferencia o reunión de negocios en japonés estándar de Tokio. Los kanji y las estructuras gramaticales básicas suelen salir bien; los errores se concentran en el vocabulario específico del dialecto y en los límites fonémicos derivados del acento tonal, donde los sesgos de entrenamiento de la IA son menos densos.
Qué motores soportan bien el japonés (2026)
Tres motores tienen soporte documentado para japonés con salida correcta de escritura mixta a mediados de 2026:
Whisper Large-v3 (OpenAI): el modelo más utilizado para transcribir japonés, tanto en código abierto como en entornos alojados. Genera texto japonés correcto con la mezcla de escrituras adecuada. La tasa de errores por homófonos aumenta con las variantes más pequeñas del modelo (base, small, medium). Requiere indicar el idioma en la llamada a la API para evitar una detección automática más lenta. Consulta precios y comparativa de modelos Whisper para ver el contexto de costes.
Deepgram Nova-3: el japonés está incluido en el modelo multilingüe Nova-3. La documentación publicada por Deepgram confirma que Nova-3 maneja la mezcla de kana, kanji y la pronunciación de préstamos lingüísticos, y ajusta el ritmo silábico específicamente para el japonés. Está disponible a través del endpoint general nova-3 con language=ja.
AssemblyAI Universal-3 Pro: admite japonés en transcripción asíncrona con diarización de hablantes verificada (el soporte para japonés se añadió junto con chino, hindi, coreano y vietnamita). El modelo Universal-3 Pro cubre 99 idiomas. El streaming en tiempo real para japonés está más limitado que el modo asíncrono a mediados de 2026. Consulta las mejores APIs de voz a texto para una comparativa más completa de motores.
Los tres manejan correctamente los préstamos en katakana, la puntuación japonesa y las formas verbales de keigo. La diferencia está en la precisión con homófonos en los casos menos frecuentes, la robustez ante dialectos y el modelo de precios.
Para audio en japonés con etiquetado de hablantes (reuniones, entrevistas), consulta diarización de hablantes explicada para ver cómo los modelos subyacentes abordan la estructura de turnos en japonés.
Comparativa de herramientas para transcripción en japonés
La conversación formal en japonés está más estructurada que en inglés, con turnos de habla más claros en contextos formales. Esto suele favorecer la calidad de la diarización. A continuación se muestra una comparativa de herramientas con soporte documentado para japonés, con precios vigentes a julio de 2026.
| Característica | Otter.ai | Notta | Trint | CATT |
|---|---|---|---|---|
| Transcripción en japonés | Sí (añadido a finales de 2025) | Sí | No documentado | Sí |
| Resumen con IA en japonés | Limitado (función reciente) | Sí (idioma incluido) | No | Sí |
| Plan gratuito | 300 min/mes | 120 min/mes (máx. 5 min por archivo) | Ninguno (prueba de 7 días, 3 archivos) | 10 min una vez (máx. 10 min por archivo) |
| Precio de entrada de pago | 16,99 $/mes (u 8,33 $/mes anual) | 13,99 $/mes (u 8,17 $/mes anual) | ~80 $/usuario/mes (anual) | 9,99 $/mes |
| Diarización en japonés | Sí | Sí | Sí | Sí |
Notta es el competidor mejor documentado para resúmenes con IA en japonés y tiene el japonés como mercado objetivo principal. Otter amplió su soporte al japonés a finales de 2025 e incluye chat en idioma nativo. Trint es una herramienta sólida para periodismo en inglés, pero carece de resúmenes documentados en japonés.
Si solo necesitas una transcripción limpia y una salida estructurada sin comprometerte con un ecosistema completo de bot de reuniones, ConvertAudioToText procesa archivos de audio en japonés directamente, sin instalar ninguna extensión de navegador.
Diarización de hablantes para japonés
La conversación formal en japonés está estructurada por turnos. Las reuniones de negocios con keigo siguen un protocolo claro: los hablantes esperan a que termine el turno del otro, especialmente cuando se dirigen a superiores. Esta estructura predecible suele favorecer la precisión de la diarización en audio formal japonés, en comparación con conversaciones informales con muchas interrupciones.
Las entrevistas formales con dos hablantes y las llamadas de negocios uno a uno tienden a diarizarse con mayor precisión. Las reuniones con grupos grandes (cuatro o más hablantes), con voces superpuestas o varias personas con un registro vocal similar, presentan los mismos retos que en cualquier otro idioma.
La grabación por micrófono (pistas de audio separadas por hablante) mejora notablemente la diarización en todos los motores. La mayoría de las grabaciones profesionales de estudio en Japón y muchas herramientas de reuniones empresariales ofrecen salida por pistas separadas.
Consejos para mejorar la transcripción en japonés
-
Set the language explicitly to
ja(Japanese). Auto-detection works but adds latency and occasionally misidentifies Japanese with heavy English loanwords as partially English. -
Provide a glossary of proper nouns. Japanese names have multiple valid kanji readings and models guess from frequency. "Watanabe" can be 渡辺, 渡邊, or 渡部. Providing the correct form prevents consistent kanji substitution errors for recurring names.
-
Japanese has soft fricatives (し, ち, つ) that degrade in background noise more than voiced consonants do. Low-noise recordings improve kanji selection accuracy on phoneme-adjacent characters.
-
For podcast transcription specifically, output language matters for downstream use. Japanese podcast show notes and SEO perform better in native Japanese than in an English summary that requires manual translation.
-
For gijiroku (meeting minutes), plan for a light editorial pass on any sonkeigo-heavy segments, as the most formal honorific constructions still surface occasional model errors in multi-speaker overlap.
Frequently Asked Questions
Which AI engines output proper kanji in Japanese transcripts?
Whisper Large-v3, Deepgram Nova-3, and AssemblyAI Universal-3 Pro all produce mixed-script output with kanji, hiragana, and katakana. Older or smaller models sometimes fall back to all-hiragana output, which is technically readable but not how Japanese is actually written. If your tool returns phonetic-only output, switch to one of these three.
How does AI decide which kanji to use when multiple kanji share the same sound?
Context is the primary signal. The word "hashi" can mean bridge (橋), chopsticks (箸), or edge (端) depending on the surrounding words. Large models trained on enough Japanese text learn these collocations well. Smaller models make more homophone errors, especially on low-frequency kanji compounds. Providing a vocabulary glossary of names and technical terms reduces errors on terms the model may not have seen often.
¿La transcripción con IA conserva las formas de cortesía keigo?
La transcripción con IA conserva lo que dice el hablante, así que las formas verbales de sonkeigo y kenjougo aparecen en la transcripción exactamente como se pronuncian. El riesgo está en identificar mal la forma verbal en sí, no en sustituirla por una equivalente en registro plano. La forma de cortesía estándar (teineigo) se maneja de forma fiable. Las construcciones honoríficas complejas en discursos formales de negocios o ceremonias pueden mostrar errores de vez en cuando, así que el contenido cargado de keigo se beneficia de una revisión editorial ligera.
¿Qué precisión tiene la transcripción en japonés para dialectos regionales como el kansai-ben?
El japonés estándar de Tokio (el registro que se usa en las emisiones de NHK y en la mayoría de contextos empresariales) se transcribe con la mayor precisión. El dialecto de Kansai, con su patrón de acento tonal y su vocabulario distintivos, reduce la precisión en comparación con el japonés estándar en la mayoría de motores. Los dialectos de Tohoku y Kyushu presentan retos adicionales. Ningún motor actual tiene un modelo específico para el kansai. Para contenido con mucho dialecto, prevé más tiempo de edición del que necesitarías con japonés estándar.
¿Qué puntuación usa una transcripción correcta en japonés?
Una transcripción correcta en japonés usa 、 (toten) como coma, 。 (kuten) como punto final y 「」 para las citas directas. Las comas y los puntos occidentales en texto japonés no son estándar. Si tu herramienta devuelve "こんにちは, 今日は晴れです." con coma y punto occidentales, la puntuación es incorrecta. Los motores bien implementados generan automáticamente la puntuación japonesa de ancho completo correcta.
¿Puedo obtener resúmenes con IA en japonés en lugar de en inglés?
No todas las herramientas producen resúmenes en japonés nativo. Notta admite resúmenes en japonés como una función documentada y tiene el japonés como uno de sus mercados objetivo principales. Otter amplió su soporte al japonés a finales de 2025, pero la profundidad de sus resúmenes en japonés es más reciente que su oferta principal en inglés. Trint no genera resúmenes en japonés. Si necesitas salidas en japonés para resúmenes y elementos de acción, revisa la documentación del proveedor antes de comprometerte con un plan.
Fuentes
- Anuncio de expansión de Otter.ai al mercado japonés (Business Wire, octubre de 2025): https://www.businesswire.com/news/home/20251022574971/en/Konnichiwa-Otter.ai-Expands-to-Japanese-Market-with-New-Japanese-Language-Support-for-AI-Meeting-Agent
- Página de precios de Otter.ai: https://otter.ai/pricing
- Página de precios de Notta: https://www.notta.ai/en/pricing
- Documentación de idiomas compatibles de Notta: https://support.notta.ai/hc/en-us/articles/4403155631131-What-languages-does-Notta-support
- Precios de Trint (Capterra): https://www.capterra.com/p/179896/Trint/pricing/
- Resumen de modelos e idiomas de Deepgram: https://developers.deepgram.com/docs/models-languages-overview
- Anuncio de Deepgram Nova-3 multilingüe: https://deepgram.com/learn/nova-3-multilingual-major-wer-improvements-across-languages
- Idiomas compatibles de AssemblyAI: https://www.assemblyai.com/docs/supported-languages
- Diarización de AssemblyAI en japonés (Newsletter 37): https://www.assemblyai.com/blog/assemblyai-newsletter-37
- Debate en GitHub sobre kanji en Whisper de OpenAI: https://github.com/openai/whisper/discussions/204
- Sociedad de Publicación del Diccionario de Kanji sobre homófonos japoneses: https://kanji.org/japanese/writing/japhom.htm
- Cultura corporativa de Gijiroku: https://kimi.wiki/work/gijiroku
- Página de precios de ConvertAudioToText: https://convertaudiototext.com/pricing
Try transcription free
Convert any audio or video to clean, unwatermarked text — speaker labels, timestamps, and AI summaries included. First 10 minutes free, no account.
Related Articles

Best Transcription Tool Alternatives, Honestly Compared (2026)
Leaving Otter, Descript, Transkriptor, Rev, or TurboScribe? Honest, sourced comparisons of every major transcription tool: real limits, verified pricing, and where each one genuinely wins.

Looking for a Transkriptor Alternative? Here's the Honest Math (2026)
Transkriptor meters your minutes and lets unused ones expire monthly. Here is its real 2026 pricing decoded, when staying is rational, and the unlimited alternatives at the same sticker price.