Back to Blog

Cómo Funciona Realmente la Separación de Stem: La IA Detrás de la División de Pistas

Has escuchado el resultado. Una voz extraída limpia de una pista mezclada, sin batería filtrándose, sin cola de reverb arrastrándose detrás. Un instrumental con el cantante completamente ausente. Una línea de bajo aislada para que puedas estudiar cada nota.

Eso es separación de stem — el proceso de dividir una pista de audio terminada y mezclada en sus componentes individuales (voces, batería, bajo, piano, guitarra y otros instrumentos). Y el hecho de que funcione en absoluto es un pequeño milagro del aprendizaje automático moderno. Aquí está lo que realmente está sucediendo bajo el capó, explicado para personas que hacen música — no para personas que escriben trabajos de investigación.


¿Qué Son los Stems en la Música?

Antes de entrar en cómo funciona la IA, definamos de qué estamos hablando. Un stem es una pista de audio individual de una grabación multicanal. En una sesión de estudio, cada instrumento y voz obtiene su propia pista — el bombo, la caja, la voz principal, el bajo, el pad de sintetizador. Estas pistas crudas son los stems. Cuando el ingeniero mezcla la canción, equilibra todos estos stems juntos y exporta un solo archivo estéreo. Ese archivo final es lo que escuchas en Spotify, en un set de DJ, o en la radio.

La separación de stem es el proceso inverso. Comienzas con la mezcla terminada y tratas de separar esos elementos individuales. Es como tomar un pastel horneado e intentar separarlo de nuevo en harina, huevos, azúcar y mantequilla. Esa analogía es en realidad bastante precisa — y explica por qué la separación de stem nunca es perfecta. Se pierde algo de información en el proceso de mezcla. Las frecuencias se superponen, las dinámicas se comprimen, y efectos como la reverb y el delay difuminan los sonidos a través del campo estéreo.

A pesar de esas limitaciones, la separación de stem moderna con IA se acerca notablemente. Buenos modelos pueden aislar voces con un mínimo de filtrado, extraer baterías que aún golpean, y obtener líneas de bajo que se mantienen ajustadas. No es limpio de estudio, pero es utilizable para mashups, remixes, ediciones de DJ, pistas de práctica y muestreo.

GreenGo soporta separación de 6 stems: voces, batería, bajo, piano, guitarra y otros (todo lo demás — sintetizadores, cuerdas, pads). Algunas herramientas también ofrecen separación de 2 stems, que solo divide voces de instrumental. La separación de 6 stems te da más control creativo porque puedes aislar instrumentos individuales en lugar de una categoría general de "otros".


¿Cómo Funciona la Separación de Stem?

En su núcleo, la separación de stem es un problema llamado separación de fuentes — la tarea de recuperar señales de fuente individuales de una señal mezclada. Ha sido estudiado en la investigación de audio durante décadas, pero el avance llegó alrededor de 2019 cuando los modelos de aprendizaje profundo comenzaron a producir resultados que realmente sonaban bien.

Aquí está el flujo básico:

  1. Convertir audio a una representación visual. La forma de onda de audio cruda — una larga secuencia de valores de amplitud — se transforma en un espectrograma. Un espectrograma es esencialmente una imagen 2D que muestra cómo cambia el contenido de frecuencia del audio a lo largo del tiempo. El tiempo corre a lo largo del eje x, la frecuencia a lo largo del eje y, y la intensidad (brillo) de cada píxel representa cuánta energía hay en esa frecuencia en ese momento.
  2. Alimentar el espectrograma en una red neuronal. El modelo analiza esta "imagen" y aprende a identificar patrones que corresponden a fuentes específicas. Las voces tienden a ocupar ciertos rangos de frecuencia (aproximadamente de 300 Hz a 4 kHz) y tienen patrones temporales específicos — notas sostenidas, vibrato, explosiones consonantes. Las baterías tienen ataques transitorios agudos. El bajo vive en las frecuencias bajas. La red ha sido entrenada en miles de ejemplos donde ve tanto el espectrograma mezclado como los espectrogramas de stems individuales, por lo que aprende a mapear de mezclado a individual.
  3. Generar máscaras. Para cada stem, el modelo produce una máscara — una cuadrícula del tamaño del espectrograma de valores entre 0 y 1. Esta máscara dice, para cada bin de tiempo-frecuencia, "cuánta de esta energía pertenece a voces vs. batería vs. bajo vs. otros." Multiplica la máscara por el espectrograma original y obtienes el espectrograma del stem aislado.
  4. Convertir de nuevo a audio. El espectrograma aislado se transforma de nuevo en una forma de onda utilizando una transformación inversa (como la STFT inversa). La información de fase de la mezcla original se reutiliza, ya que el modelo solo predice magnitud. Esta es una de las principales fuentes de artefactos — más sobre eso a continuación.
Diagrama del pipeline de separación de stem de IA que muestra el proceso de 4 etapas: forma de onda de audio mezclada, conversión a espectrograma, procesamiento de red neuronal y 6 salidas de stem aisladas

Ese es el enfoque clásico. Modelos más nuevos trabajan directamente sobre la forma de onda misma, omitiendo completamente el paso del espectrograma. Llegaremos a esa diferencia en un momento.

La clave es esta: el modelo no está haciendo nada mágico. Es reconocimiento de patrones a gran escala. Después de ver suficientes ejemplos de "así es como se ve una pista de batería mezclada en un espectrograma" y "así es como se ven las baterías aisladas," la red aprende a predecir la máscara de aislamiento para audio nuevo y no visto. La calidad de la separación depende completamente de cuán bien fue entrenado el modelo y qué arquitectura utiliza.


Los Modelos de IA Detrás de la Separación Moderna de Stem

Varios modelos de código abierto han impulsado el progreso en la separación de stem con IA. Aquí está cómo se comparan los principales:

ModeloDesarrolladorEnfoqueStemsPunto Fuerte Clave
SpleeterDeezer (2019)Enmascaramiento de espectrograma (U-Net)2 o 4Rápido, ligero, funciona en CPU
Demucs (HTDemucs)Meta / FAIR (2022)Híbrido de forma de onda + espectrograma4La más alta calidad, maneja bien la reverb
Open-Unmix (UMX)SIGSEP (2019)Enmascaramiento de espectrograma4Base de investigación abierta, modular
BS-RoFormerVarios (2023)RoFormer de banda dividida4+Estado del arte en benchmarks
Gráfico comparativo de 4 modelos de separación de stem con IA: Spleeter, Open-Unmix, Demucs HTDemucs y BS-RoFormer mostrando calificaciones de calidad y velocidad de 2019 a 2023

Spleeter fue el modelo que hizo que la separación de stem con IA fuera accesible. Lanzado por Deezer en 2019, utilizó una arquitectura U-Net — originalmente diseñada para segmentación de imágenes — aplicada a espectrogramas. Era rápido, podía funcionar en una CPU y producía resultados que eran lo suficientemente buenos para ediciones de DJ y remixes ásperos. Popularizó el concepto de separación de stem con IA para músicos.

Demucs del laboratorio FAIR de Meta tomó un enfoque diferente. En lugar de trabajar solo en espectrogramas, Demucs opera directamente sobre la forma de onda cruda utilizando una combinación de capas convolucionales y recurrentes. La última versión, HTDemucs (Demucs Híbrido Transformer), utiliza un enfoque híbrido: procesa tanto la forma de onda como el espectrograma simultáneamente, luego combina los resultados. En nuestras pruebas, Demucs produce aislamientos vocales notablemente más limpios que Spleeter, especialmente en pistas con mucha reverb o arreglos complejos. Maneja mejor el problema del "difuminado" porque puede aprender patrones temporales directamente de la forma de onda.

BS-RoFormer (RoFormer de Banda Dividida) es el estado del arte actual en el benchmark MUSDB18. Divide el rango de frecuencia en bandas y procesa cada banda con un transformador de incrustación de posición rotativa. Es más costoso computacionalmente pero produce las separaciones más limpias disponibles actualmente.

Todos estos modelos están entrenados en el mismo principio fundamental: aprendizaje supervisado en datos emparejados. Los investigadores utilizan conjuntos de datos como MUSDB18, que contiene 150 canciones completas con sus stems aislados. El modelo ve la pista mezclada como entrada y los stems individuales como salida objetivo. Minimiza la diferencia entre su predicción y el stem real, aprendiendo gradualmente a separar fuentes que nunca ha escuchado antes.


Enmascaramiento de Espectrograma vs Dominio de Forma de Onda — ¿Cuál es la Diferencia?

Hay dos enfoques principales para la separación de stem con IA, y la diferencia es importante para entender por qué algunas herramientas suenan mejor que otras.

Comparación lado a lado de enfoques de separación de fuentes de IA basados en espectrograma vs basados en forma de onda mostrando pros y contras de cada método

Basado en Espectrograma (Spleeter, Open-Unmix)

El audio se convierte en un espectrograma utilizando la Transformada de Fourier de Tiempo Corto (STFT). El modelo predice una máscara para cada stem, y el espectrograma enmascarado se convierte de nuevo en audio. La ventaja es la velocidad — los espectrogramas son compactos, y el modelo puede ser relativamente pequeño. La desventaja es que pierdes información de fase. La STFT te da tanto magnitud como fase, pero el modelo típicamente solo predice magnitud. Reutilizas la fase de la mezcla original, que es una aproximación. Esto causa artefactos, especialmente en voces con largas colas de reverb.

Basado en Forma de Onda (Demucs, BS-RoFormer)

El modelo opera directamente sobre las muestras de audio crudas. No se necesita conversión a espectrograma. La red aprende a predecir la forma de onda aislada directamente. La ventaja es que la fase se maneja de manera natural — es parte de la forma de onda. La desventaja es que las formas de onda son mucho más largas que los espectrogramas (una canción de 3 minutos a 44.1 kHz tiene casi 8 millones de muestras), por lo que el modelo necesita ser más complejo y requiere más computación.

El enfoque híbrido (HTDemucs) combina ambos: procesa la forma de onda para precisión temporal y el espectrograma para precisión de frecuencia, luego fusiona los resultados. Este es actualmente el punto óptimo para calidad vs. rendimiento.


Cómo Separar Stems con GreenGo

GreenGo incluye separación de stem con IA integrada directamente en la aplicación. No necesitas subir tus pistas a un sitio web, esperar en una cola, o lidiar con marcas de agua en la salida. Aquí está cómo funciona:

  1. Abre una pista. Reproduce cualquier audio en el navegador de GreenGo, o abre un archivo de audio local que ya tienes. La pista no necesita ser preprocesada o estar en un formato específico — GreenGo maneja WAV, MP3, FLAC y AAC.
  2. Haz clic en el botón de Separación de Stem. En la barra de herramientas de GreenGo, presiona el ícono de separación de stem. El modelo de IA se ejecuta localmente en tu escritorio y comienza a dividir la pista en seis stems: voces, batería, bajo, piano, guitarra y otros.
  3. Previsualiza cada stem. GreenGo te muestra los seis stems como formas de onda individuales. Aísla cualquier stem para escucharlo en aislamiento. Aquí es donde verificas el filtrado — si el stem vocal tiene artefactos de batería, o el stem de bajo tiene melodía filtrándose, puedes decidir si la calidad de separación es lo suficientemente buena para tu caso de uso.
  4. Exporta lo que necesites. Descarga stems individuales o los seis a la vez. Elige WAV para calidad sin pérdida (mejor para trabajo en DAW y muestreo) o MP3 para archivos más pequeños (suficiente para ediciones de DJ y práctica). GreenGo también analiza automáticamente el BPM de cada stem y la clave musical, y escribe los metadatos directamente en los archivos exportados.
  5. Incorpora a tu flujo de trabajo. Los stems exportados están etiquetados con metadatos ID3 — BPM, clave, artista, título — para que se importen limpiamente en Rekordbox, Serato, Traktor, Ableton, o cualquier otro software de DJ o DAW.

Todo el proceso toma segundos para una pista típica. Sin tiempo de carga, sin cola, sin servidor de terceros procesando tu audio. Todo se ejecuta en tu máquina — Windows o macOS. GreenGo ofrece una prueba gratuita de 7 días (se requiere tarjeta de crédito), y el nivel gratuito te permite separar hasta 3 canciones antes de suscribirte a $5.99/mes.


Consejos para Obtener los Mejores Resultados de Separación de Stem

La separación de stem con IA es buena, pero no es perfecta. Estos consejos te ayudarán a obtener los resultados más limpios:

  • Comienza con la fuente de la más alta calidad que puedas. Un MP3 de 320kbps o un WAV sin pérdida siempre se separará mejor que un stream de 128kbps. Los artefactos de compresión confunden al modelo — parecen ruido en todas las bandas de frecuencia, dificultando distinguir las fuentes.
  • Separa antes de estirar el tiempo. Si necesitas cambiar el tempo de una pista, separa los stems primero, luego estira el tiempo de cada stem individualmente. Estirar la pista mezclada primero introduce artefactos que el modelo de separación amplificará.
  • Usa los stems para lo que son buenos. La aislamiento vocal funciona mejor en pistas con una voz principal clara y vocales de respaldo mínimas. La separación de batería funciona mejor en pistas con baterías acústicas o electrónicas que tienen transitorios distintos. Mezclas densas, con capas de sonido que llenan el mismo rango de frecuencia siempre producirán más filtrado.
  • Ecualiza los stems después de la separación. Incluso con una buena separación, a menudo obtendrás filtrado de baja frecuencia en el stem vocal o filtrado de alta frecuencia en el stem de bajo. Un rápido filtro pasa alto en las voces (corte por debajo de 100 Hz) y un pasa bajo en el bajo (corte por encima de 2 kHz) limpia la mayoría del filtrado residual.
  • Revisa el stem "otros" para residuos vocales. Si la separación vocal no es perfecta, a veces escucharás voces fantasma en el stem otros. Esto es normal — el modelo divide la energía probabilísticamente. Si el residuo es demasiado fuerte, prueba con un archivo fuente diferente o acepta que la pista es demasiado densa para una separación limpia.
  • Evita el reprocesamiento. No separes un stem que ya ha sido separado. Ejecutar la separación de stem en un stem vocal para "limpiarlo más" generalmente lo empeora — el modelo no fue entrenado en audio parcialmente separado.
  • Iguala los formatos de stem a tu caso de uso. Exporta como WAV si vas a cargar los stems en un DAW para trabajo de producción. MP3 está bien para ediciones de DJ donde el tamaño del archivo importa más que la fidelidad absoluta. La calidad de separación es la misma de cualquier manera — el formato solo afecta la exportación final.

Preguntas Frecuentes

¿Cómo funciona la separación de stem?

La separación de stem utiliza modelos de aprendizaje profundo entrenados en datos de audio emparejados — canciones mezcladas junto a sus stems individuales. El modelo convierte el audio en un espectrograma (o procesa la forma de onda cruda), identifica patrones que corresponden a cada fuente (voces, batería, bajo, piano, guitarra, otros), y genera máscaras de aislamiento que separan la señal mezclada en stems individuales. El resultado se convierte de nuevo en audio.

¿Está mejorando la separación de stem con IA?

Sí, y notablemente. Los modelos de 2019 (Spleeter) producían separaciones con artefactos audibles y filtrado significativo. Modelos actuales como Demucs HTDemucs y BS-RoFormer producen aislamientos vocales que son casi lo suficientemente limpios para uso profesional. La mejora proviene de mejores arquitecturas (transformadores, procesamiento híbrido de forma de onda-espectrograma) y conjuntos de datos de entrenamiento más grandes.

¿Cuál es la diferencia entre la separación de 2 stems y 6 stems?

La separación de 2 stems divide una pista en voces e instrumental solamente. La separación de 6 stems divide en voces, batería, bajo, piano, guitarra y otros. La separación de 6 stems te da más control creativo — puedes aislar solo la batería para un breakbeat, extraer la línea de bajo para un remix, extraer el piano para un sample, o silenciar las voces para un instrumental. La separación de 2 stems es más rápida y suficiente si solo necesitas un acapella o un instrumental.

¿Puede la separación de stem aislar voces perfectamente?

No. Se pierde información permanentemente durante la mezcla. Las frecuencias se superponen, las colas de reverb se difuminan a través del campo estéreo, y la compresión afecta todas las fuentes simultáneamente. La IA moderna se acerca — 85-95% de aislamiento dependiendo de la pista — pero casi siempre escucharás trazas sutiles de otros instrumentos en el stem vocal, o voces fantasma en el instrumental. La ecualización y el gateo pueden reducir aún más estos artefactos.

¿Funciona la separación de stem en cualquier género?

Funciona en la mayoría de los géneros, pero los resultados varían. La música electrónica con rangos de frecuencia limpios y separados (house, techno) se separa bien. El hip-hop con voces prominentes y baterías distintas también funciona bien. Las mezclas de rock densas con guitarras, voces y platillos en capas que llenan el mismo rango de frecuencia son más difíciles. La música clásica y el jazz con instrumentos acústicos son los más desafiantes porque las fuentes se mezclan de manera más natural.

¿Es legal usar software de separación de stems musicales?

Usar software de separación de stems en pistas que posees o que has licenciado es legal. Usar stems separados para lanzamientos comerciales (remixes, muestras) requiere limpiar los derechos con el titular de derechos de autor. El uso personal — práctica, análisis, ediciones de DJ para tus propios sets — generalmente cae bajo el uso justo, pero la ley de derechos de autor varía según el país. Siempre verifica tus regulaciones locales.


La separación de stem ha pasado de ser una curiosidad de investigación a una herramienta práctica en solo unos pocos años. Los modelos de IA detrás de ella — Demucs, Spleeter, BS-RoFormer — siguen mejorando, y herramientas como GreenGo las hacen accesibles sin subir tu música a un servidor de un extraño. Ya sea que estés creando mashups, preparando ediciones de DJ, practicando sobre instrumentales, o muestreando para producción, entender cómo funciona la tecnología te ayuda a obtener mejores resultados de ella.

¿Quieres probarlo en tus propias pistas? La separación de stem está integrada en GreenGo — un clic, sin carga, sin marca de agua. Pruébalo gratis durante 7 días (se requiere tarjeta de crédito), y separa hasta 3 canciones en el nivel gratuito.

Escrito por Ihor — desarrollador de software musical y DJ en GreenGo.