IA y audio

MuScriptor: el modelo open-source que transcribe audio multi-instrumento a MIDI en tiempo real

Kyutai y Mirelo AI lanzan MuScriptor, el primer modelo open-source de transcripción musical multi-instrumento entrenado a gran escala. Analizamos su arquitectura, los tres tamaños de modelo, cómo usarlo y qué cambia para el productor y el técnico de audio.

MuScriptor: el modelo open-source que transcribe audio multi-instrumento a MIDI en tiempo real

Cuarta entrega de la serie de SonidoenRed sobre inteligencia artificial en audio profesional. Tras analizar la generación musical con Suno y Udio, y el procesado de señal en directo con herramientas como Clarity Vx Live y smart:EQ live, llegamos a un territorio diferente: la transcripción automática de música. MuScriptor es el modelo que acaba de cambiar el estado del arte en esa categoría, y lo ha hecho siendo open-source.

Qué es MuScriptor y quién lo ha desarrollado

MuScriptor es un modelo de transcripción musical multi-instrumento de código abierto desarrollado conjuntamente por Kyutai y Mirelo AI, con participación del IRCAM de París. Fue lanzado públicamente el 10 de julio de 2026, con código disponible en GitHub, pesos del modelo en HuggingFace y una demo online en muscriptor.kyutai.org.

Kyutai es el laboratorio de investigación en IA fundado en París en 2023 con un enfoque explícito de uso abierto — ya publicaron en open-source Moshi, su modelo de voz conversacional en tiempo real. Mirelo AI es una startup especializada en herramientas de producción musical asistida por IA, que usa MuScriptor como motor de transcripción en su plataforma Mirelo Studio. El IRCAM —el Instituto de Investigación y Coordinación Acústica/Música— aporta la perspectiva musicológica y de señal que sustenta el diseño del sistema de tokens.

El modelo tiene paper académico publicado en arXiv (2607.08168), firmado por Simon Rouard, Michael Krause, Axel Roebel, Carl-Johann Simon-Gabriel y Alexandre Défossez — el mismo Défossez que diseñó EnCodec, el codec de audio neuronal de Meta que sustenta muchos de los modelos de generación de audio actuales, incluyendo el Bark de Suno.

Qué hace: transcripción automática multi-instrumento a MIDI

La transcripción automática de música (AMT, Automatic Music Transcription) es el proceso de convertir una grabación de audio en una representación simbólica de las notas — qué instrumento toca qué nota, cuándo empieza y cuándo termina. Es uno de los problemas más difíciles del procesado de señal musical porque requiere separar simultáneamente múltiples fuentes que se solapan en frecuencia, tiempo y timbre.

Interfaz de MuScriptor

Los sistemas anteriores resolvían bien la transcripción de un solo instrumento — piano monofónico, guitarra sola — pero se degradaban significativamente en mezclas con múltiples instrumentos simultáneos. MuScriptor está diseñado específicamente para ese caso difícil: mezclas reales con múltiples instrumentos, en cualquier género.

El resultado de la transcripción es un archivo MIDI estándar con las notas de cada instrumento separadas en pistas individuales — o un stream de eventos en tiempo real que el desarrollador puede consumir directamente. Ese MIDI puede abrirse en cualquier DAW, editarse, imprimirse como partitura, usarse como base de producción o pasarse a un sistema de síntesis.

La arquitectura técnica: un transformer decoder que trata la transcripción como lenguaje

MuScriptor utiliza una arquitectura transformer decoder-only — la misma familia que los modelos de lenguaje tipo GPT — aplicada al problema de transcripción musical. El enfoque conceptual es elegante: en lugar de diseñar un sistema especializado para detectar notas, el modelo aprende a "hablar el lenguaje de las notas" de la misma forma que un LLM aprende a generar texto.

El proceso funciona así: el modelo recibe un mel-espectrograma de un segmento de audio de 5 segundos y predice autorregressivamente tokens MIDI — pitch, timing, instrumento — uno tras otro. Sigue el esquema de tokenización MT3, el sistema desarrollado por Google Magenta para representar eventos musicales como secuencias de tokens, adaptado y extendido para el caso multi-instrumento de MuScriptor.

El procesado por chunks de 5 segundos permite que el modelo empiece a emitir resultados mientras sigue procesando el audio — no hay que esperar a que termine toda la transcripción para recibir las primeras notas. En la interfaz web oficial, esto se visualiza como un piano roll que se va construyendo en tiempo real mientras el audio avanza.

Hay un detalle técnico relevante para quien quiera entender los límites del modelo: el tokenizador actual no preserva la velocidad (velocity) de las notas — solo recupera el timing de onset y offset, el pitch y el instrumento. La dinámica de la interpretación, en términos de intensidad por nota, no está en el output actual.

Dataset de entrenamiento: 170.000 canciones, de clásica a heavy metal

MuScriptor es el primer modelo de transcripción musical entrenado a gran escala en un dataset de canciones reales y completas con múltiples instrumentos simultáneos. El corpus de entrenamiento incluye 170.000 canciones que abarcan desde música clásica hasta heavy metal, pasando por jazz, pop, rock y géneros electrónicos.

Esta amplitud de géneros es uno de los factores que distingue a MuScriptor de modelos anteriores. Los sistemas de AMT previos tendían a entrenarse en datasets dominados por piano clásico o guitarra acústica, lo que generaba degradación notable en géneros con un timbre instrumental más complejo — distorsión eléctrica, síntesis, percusión no convencional. MuScriptor, entrenado en un corpus amplio, generaliza mejor a esos casos.

Los modelos están disponibles bajo licencia CC BY-NC 4.0 en HuggingFace — uso libre para investigación y proyectos no comerciales. Para uso comercial, Mirelo AI licencia una versión mejorada del modelo a través de Mirelo Studio.

Tres tamaños de modelo para tres contextos de uso

MuScriptor se publica en tres variantes que cubren desde pruebas en CPU hasta producción en GPU:

  • Small (103M parámetros, 14 capas): el modelo práctico para máquinas sin GPU. Velocidad de procesado razonable en CPU, calidad suficiente para exploración y prototipado rápido.
  • Medium (307M parámetros, 24 capas): la variante por defecto. El equilibrio recomendado entre calidad de transcripción y recursos computacionales. Es el modelo que descarga automáticamente la librería en su primera ejecución.
  • Large (1.4B parámetros, 48 capas): la variante de máxima calidad. Requiere GPU para tiempos de procesado razonables. Es la referencia de benchmarks y la que Kyutai usa en la demo online.

Cómo se usa: CLI, Python API y web UI

MuScriptor está diseñado para ser accesible en tres niveles de integración:

Demo online sin instalación

La forma más rápida de probarlo es muscriptor.kyutai.org, donde se puede subir un archivo de audio y ver la transcripción en un piano roll interactivo que se construye en tiempo real mientras el modelo procesa. No requiere cuenta ni instalación.

CLI para uso directo

Con una sola línea se instala y se lanza la transcripción:

uvx muscriptor transcribe audio.wav -o out.mid

El resultado es un archivo MIDI estándar. Se puede especificar qué instrumentos esperar — lo que mejora la precisión cuando se conoce la instrumentación de la grabación — elegir la variante del modelo y ajustar parámetros de decodificación.

Un modo especialmente útil para evaluación es el auralize, que genera un archivo WAV de verificación con el audio original en el canal izquierdo y el MIDI sintetizado en el canal derecho. Permite escuchar directamente la diferencia entre lo que entró y lo que el modelo transcribió:

muscriptor transcribe audio.wav -o out.mid --auralize check.wav

Python API para integración en flujos de trabajo

Para integrarlo en herramientas propias, la API de Python es directa:

from muscriptor import TranscriptionModel
model = TranscriptionModel.load_model()
midi_bytes = model.transcribe_to_midi("audio.wav")

El método transcribe() devuelve un generador de eventos — NoteStartEvent, NoteEndEvent y ProgressEvent — que permite procesar la transcripción en streaming conforme va llegando, sin esperar a que termine el archivo completo.

Web UI local

Para quien quiera el piano roll interactivo pero ejecutando el modelo localmente — con privacidad total sobre el material de audio — existe la opción de servir la interfaz web desde el propio ordenador:

uvx muscriptor serve

Qué cambia para el productor y el técnico de audio

La transcripción automática de música no es un problema nuevo. Lo que cambia con MuScriptor es la combinación de tres factores que antes no coincidían en un mismo sistema: calidad real en mezclas multi-instrumento, corpus de entrenamiento amplio en géneros, y acceso open-source sin coste para uso no comercial.

Para el productor, las implicaciones más directas son:

  • Extraer la línea de bajo de una referencia de producción directamente a MIDI, sin necesidad de separar stems primero
  • Transcribir una idea improvisada grabada en el móvil directamente a MIDI para trabajarla en el DAW
  • Analizar la armonía y las voicings de un acorde de una grabación compleja sin necesidad de oído absoluto
  • Rearmonizar o reimaginar una melodía a partir de su transcripción MIDI

Para el músico que aprende, MuScriptor resuelve un problema que antes requería o transcripción manual — costosa en tiempo — o herramientas de pago limitadas: obtener la partitura o tablatura de una canción real con múltiples instrumentos, en cualquier género.

Para el técnico de sonido e instalador el impacto es más indirecto pero real: MuScriptor es un indicador de hacia dónde va la comprensión automática de audio en sistemas profesionales. La misma capacidad de identificar instrumentos y notas en tiempo real en una mezcla es la base técnica sobre la que pueden construirse sistemas de análisis de sala, detección de contenido y clasificación automática de fuentes en instalaciones complejas.

Las limitaciones que hay que conocer

Con toda la capacidad que demuestra, MuScriptor tiene límites concretos que el profesional debe tener en cuenta.

El más importante ya mencionado: no recupera velocity. El MIDI generado tiene notas con timing preciso pero sin información de intensidad relativa — todas las notas tienen la misma velocidad MIDI. Para usos donde la dinámica de la interpretación importa — grabación de orquesta, piano clásico, expresividad de jazz — el output necesita edición manual de velocidades.

El modelo procesa por chunks de 5 segundos, lo que introduce una discontinuidad potencial en las notas que cruzan la frontera entre chunks. En la mayoría de los géneros esto es imperceptible, pero en piezas con notas muy largas sostenidas — órgano, cuerdas, voces — puede generar artefactos en los puntos de corte.

Los instrumentos de percusión se transcriben como hits instantáneos — un NoteStartEvent seguido inmediatamente de su NoteEndEvent — lo que es musicalmente correcto pero diferente de cómo muchos productores prefieren ver la batería en MIDI.

Y la licencia CC BY-NC 4.0 de los pesos del modelo prohíbe el uso comercial. Quien quiera integrar MuScriptor en un producto o servicio comercial necesita hablar con Mirelo AI para un acuerdo de licencia.

Contexto: dónde encaja en el ecosistema de IA musical

MuScriptor ocupa un lugar diferente al de Suno y Udio, que analizamos en los dos artículos anteriores de esta serie. Suno y Udio generan música nueva a partir de un prompt. MuScriptor comprende música existente y la convierte en una representación simbólica editable.

Son dos direcciones opuestas de la misma transformación de fondo: el audio como dato que los modelos de IA pueden leer, escribir y procesar con la misma fluidez con que los modelos de lenguaje trabajan con el texto. Suno escribe audio desde texto. MuScriptor lee audio y produce texto musical — MIDI. Entre los dos extremos está emergiendo toda una familia de herramientas que pueden analizar, transformar, clasificar y generar audio con una competencia que hace tres años no existía.

Para el profesional del audio, eso no es una amenaza ni una promesa vaga. Es un conjunto de herramientas nuevas que ya están disponibles, muchas de ellas open-source, y que cambian lo que es posible hacer con tiempo y recursos razonables.

Conclusión

MuScriptor es el modelo de transcripción musical más capaz disponible en open-source a la fecha de este artículo. Entrenado en 170.000 canciones, con tres variantes de tamaño para distintos contextos de uso, API Python clara, CLI funcional y demo online sin fricción — es una herramienta lista para usar hoy.

El próximo artículo de esta serie abordará cómo la IA está transformando el flujo de trabajo en producción y postproducción: mezcla asistida, masterización automática y las herramientas que están redefiniendo qué se puede hacer fuera del directo.

Comentarios (0)

Sé el primero en comentar.