SEALI: intra-acciones humano-máquina en la improvisación libre

Escobar Castañeda Aarón Arturo

SEALI: intra-acciones humano-máquina en la improvisación libre

Virtualis. Revista de cultura digital

Tecnológico de Monterrey, Dirección de Investigación de la Escuela de Humanidades y Educación

Resumen

Este artículo presenta el desarrollo de SEALI (Sistema de escucha automática para la libre improvisación), un sistema interactivo que utiliza la escucha de máquina para analizar elementos sonoros e incidir en la práctica de la libre improvisación musical. El sistema emplea técnicas algorítmicas aplicadas a la segmentación, el análisis y el entrenamiento de un corpus sonoro a través de redes neuronales, para generar modelos que describen la improvisación libre en términos tímbricos y formales. Para lograrlo, se analiza cómo el aprendizaje supervisado y sin supervisión pueden describir numéricamente esta práctica, así como las redes neuronales recurrentes—particularmente las redes LSTM—, pueden ofrecer una alternativa para la predicción de la forma musical. Estos modelos constituyen la base de este sistema, lo que posibilita la interacción en tiempo real con otros músicos. El artículo detalla las funcionalidades y hallazgos principales en torno a SEALI, aborda los estudios de caso que han contribuido a su evolución continua y retoma algunas discusiones sobre la agencialidad algorítmica en las prácticas artísticas.


Palabras clave:

improvisación libre, escucha artificial, sistemas interactivos, redes neuronales, música algorítmica, .

Introducción

El presente artículo parte de mi investigación doctoral sobre SEALI (Sistema de escucha automática para la libre improvisación) el cual es un sistema sonoro interactivo que parte de la escucha artificial, modelada desde mi propia escucha, para analizar elementos sonoros en un ámbito muy acotado de la libre improvisación y, también, para interactuar a varios niveles temporales con otros improvisadores mediante la clasificación y la predicción sonora en el contexto de dicha práctica. Las funcionalidades de este sistema las pienso desde una perspectiva algorítmica y que, en conjunto, articulan la arquitectura de SEALI. A grandes rasgos, éstas comienzan en la selección de un corpus sonoro, posterior a ello, se aplicaron técnicas de segmentación, estructuración, análisis y entrenamiento de redes neuronales para generar una serie de supuestos abstractos a nivel numérico (modelos) que describan esta práctica musical. Finalmente, se desarrolló un sistema interactivo en tiempo real para establecer una serie de respuestas coherentes en la libre improvisación.

Cada una de estas funcionalidades, implica varios procesos entrelazados por bucles de retroalimentación donde mi escucha y el aprendizaje de máquina se unen con el objetivo de desarrollar la metodología y las técnicas algorítmicas que posibilitaron la realización de SEALI y su integración en contextos artísticos musicales. En este artículo abordaré a detalle las funcionalidades más generales de ese sistema, así como los estudios de caso que han sido útiles para continuar su evolución, bajo el entendido de que su constante introducción en la práctica artística sigue modificando sus funcionalidades para adecuarse cada vez más a las necesidades contextuales de una práctica en permanente cambio como la libre improvisación.

Definición y caracterización de la libre improvisación y su convergencia con SEALI

La improvisación libre es una forma de música que no sigue reglas ni estructuras preestablecidas, sino que se basa en la creatividad y la interacción de los músicos al momento de hacerla (Matthews, W. (2012). . Turner Publicaciones.Matthews, 2012). Aunque difícil de datar exactamente en su origen debido a sus raíces en diversas corrientes musicales y académicas, se consolidó como práctica en los años sesenta en Europa y Estados Unidos. Galiana Gallach, J. L. (2018). De la naturaleza de la improvisación libre: Elementos esenciales para su identificación y diferencias con la composición escrita. Itamar. , 0.Galiana (2018) define la improvisación libre como 'un proceso creativo y no un producto acabado, manufacturado, listo para ser escuchado y consumido tantas veces como se desee'. Sin embargo, algunos improvisadores han llegado a considerar que la libre improvisación fue la primera forma musical creada por los humanos (Bailey, D. (1980). . Moorland.Bailey, 1980).

Inspirada por el free jazz y la música académica contemporánea, la improvisación libre surge como una práctica comprometida con la expresión artística y política que cuestionaba las injusticias sociales y económicas de la época. La práctica de la improvisación libre desafió las estructuras de poder en la industria musical, promoviendo la colaboración creativa y rompiendo con las convenciones musicales establecidas, dando lugar a nuevas técnicas y aproximaciones musicales. Los músicos de esta práctica exploran nuevas técnicas instrumentales, sonoridades, ritmos y formas de comunicación musical, rompiendo con las jerarquías y los géneros tradicionales. Algunos de los artistas más reconocidos de esta corriente son Evan Parker, John Coltrane, Peter Brötzmann, Derek Bailey, el grupo AMM, entre muchos otros.

Sí bien en la actualidad existen proyectos que comparten algunas características con SEALI (Escobar Castañeda, A. A. (2022). Resistencias maquínicas: Una caracterización a la improvisación libre con aprendizaje y escucha de máquina [Tesis doctoral, Universidad Nacional Autónoma de México]. Facultad de Música.Escobar-Castañeda, 2022), este sistema se distingue por su enfoque en la convergencia entre la escucha artificial y la libre improvisación. En este sistema, la escucha artificial se concibe como un proceso modelado a través de algoritmos de aprendizaje y escucha de máquinas (Collins, N. (2012). Automatic composition of electroacoustic art music utilizing machine listening. , (3), 8-23.Collins, 2012), partiendo de mi propia escucha, generando así un marco de referencia que toma mi bagaje como compositor e improvisador.

Inicialmente, este enfoque contempla el análisis de elementos sonoros dentro de la libre improvisación y, más adelante, la interacción dinámica entre la escucha artificial y la improvisación. Algunos elementos principales por destacar en este proceso son: la selección de un repertorio sonoro, la aplicación de técnicas algorítmicas para su análisis, la implementación de redes neuronales capaces de capturar numéricamente la esencia de la improvisación libre. Estas técnicas no solo posibilitan el análisis y la respuesta en tiempo real a la improvisación, sino también las interacciones a distintos niveles temporales con otros improvisadores, contribuyendo así a la evolución y expansión de la improvisación libre.

Desarrollo de SEALI

A continuación, presento una revisión de las funcionalidades que componen a SEALI. Estos aspectos se dividen en dos categorías: las funcionalidades relacionadas con la clasificación tímbrica y las relacionadas con la predicción de la estructura en la improvisación libre.

Corpus musical y base de datos

La primera tarea de SEALI, es analizar un corpus musical de improvisaciones libres que servirá como fuente de conocimiento a nivel tímbrico y de estructuras formales recurrentes en este contexto. Inicialmente, comencé con grabaciones de diversos improvisadores de Europa, Estados Unidos y México desde los años 60 hasta la actualidad, sumando 350 archivos de audio, 29 GB de datos y 45 horas de reproducción. Cabe destacar, que este corpus sigue en evolución a lo largo de la investigación debido a la retroalimentación con otros músicos y las adecuaciones constantes al sistema.

Criterios de segmentación sonora

Una vez consolidado este corpus, el proceso subsecuente implica un análisis en dos fases: primero, la segmentación del corpus, y segundo, la construcción de una base de datos mediante la extracción de características de audio digital presentes en cada segmento. Como exploraremos más adelante, estas características se denominan descripciones o descriptores de audio (Vinet, H., Herrera, P., y Pachet, F. (2002). The CUIDADO project. En 3rd International Society for Music Information Retrieval (ISMIR) Conference (pp. 197-203). Paris, France. Content Based Retrieval.Vinet, 2002). Este proceso garantiza que los segmentos individuales mantengan coherencia entre sí y sean objetos significativos más allá de su contexto. La segmentación se basa en el análisis de gestos sonoros, elementos auditivamente reconocibles y significativos por sí mismos. Estos gestos pueden estar caracterizados por propiedades, como el timbre, la altura, el ritmo, el contenido, la densidad, la energía y la complejidad espectral. El desafío de esta tarea radica en que estos gestos pueden variar en altura, intensidad, duración, contenido espectral e intención al ser ejecutados, lo que crea un fenómeno multidimensional en constante evolución en función del contexto y la interpretación. Por lo tanto, es esencial entrenar al algoritmo de escucha y aprendizaje automático con una base de datos que contenga una amplia variedad de muestras sonoras representativas de la práctica.

El concepto de objeto sonoro, influenciado por la obra de Schaeffer, P., y De Diego, A. C. (1996). (Serie Alianza música). Alianza.Schaeffer (1996) desempeña un papel esencial en la segmentación del audio en SEALI. Schaeffer introdujo el término 'música concreta' para comprender la música como cualquier fenómeno sonoro perceptible y reproducible, independientemente de su origen o significado. El concepto de objeto sonoro se define como una manifestación sonora percibida como una entidad coherente, independientemente de su origen o significado. Los objetos sonoros se relacionan con el gesto, pensado como unidad sonora, que puede evocar emociones y significados sin depender de un contexto musical previo o futuro. Así, el gesto comunica una idea y contiene atributos comunicativos, su apertura a la reelaboración y recontextualización le otorgan un carácter polisémico y una curva energética.

Cabe mencionar que, a lo largo de la investigación, se examinaron distintas aproximaciones a la segmentación de audio dentro de la improvisación libre, lo que condujo a realizar ajustes y modificaciones en la metodología. Por limitaciones de espacio, en este artículo solo abordaré una de las aproximaciones más significativas.

Segmentación basada en cambios MFCCs mediante SBIC

A través de experimentaciones con diferentes descriptores y una validación auditiva, se determinó que los cambios tímbricos eran el criterio más adecuado para la segmentación en el contexto de la improvisación libre. Esta segmentación de audio se basó en el uso del algoritmo SBic (Segmentation on Bayesian Information Criterion) (Peeters, G., y Rodet, X. (2004). Automatically selecting signal descriptors for sound classification. En (pp. 464-467).Peeters & Rodet, 2004), que se enfoca en diferenciar segmentos en una cadena de audio utilizando un umbral principalmente espectral. Este algoritmo emplea un criterio de segmentación bayesiano en función de una matriz de descriptores de audio. En este caso, la matriz de descriptores MFCCs (Mel-frequency cepstral coefficients), propuesta por Davis, S., y Mermelstein, P. (1980). Comparison of parametric representations for monosyllabic word recognition in continuously spoken sentences. , (4), 357-366.Davis y Mermelstein (1980), fue útil para establecer el criterio de segmentación, enfocado en cambios tímbricos sustanciales en el audio. El proceso de segmentación consta de tres fases: segmentación en bruto, segmentación fina y validación de los segmentos. Como resultado, se obtuvieron segmentos de audio que variaban en duración, desde centésimas de segundo hasta treinta segundos. Este criterio permitió establecer un puente con el concepto de objeto sonoro, ya que cada segmento contenía las características necesarias para identificarlo como una unidad coherente, lo que llevó a la creación de un corpus de improvisaciones de gestos sonoros.

Descriptores para el análisis digital de la señal de audio

El siguiente paso fue construir una base de datos derivada del corpus de segmentos de audio, donde cada elemento se describe numéricamente. Para llevar a cabo esta tarea, se empleó la librería Essentia, que ofrece una amplia gama de descriptores de audio y herramientas, que permitieron explorar diversas combinaciones. En este contexto, la elección de descriptores de audio relevantes se vuelve esencial para garantizar resultados coherentes y no generar contradicciones ni ruido en el proceso de clasificación (Johnston, J. D. (1988). Transform coding of audio signals using perceptual noise criteria. , , 314–323.Johnston, 1988; Painter, T., y Spanias, A. (1997). A review of algorithms for perceptual audio coding of digital audio signals.Painter, 1997). La experiencia detallada reveló que la variedad y combinación de descriptores, como MFCCs, Onset Detection, Loudness, Spectral Centroid, Spectral Flatness, Spectral Contrast, Dynamic Complexity, Spectral Complexity, Mel Bands y Chromagram (Lerch, A. (2022). . Wiley.Lerch, 2022), inicialmente generaron clasificaciones fluctuantes y en ocasiones poco claras. Este análisis, marcado por resultados aparentemente aleatorios, destacó la importancia de una cuidadosa selección de descriptores de audio. Tras exhaustivas pruebas, fue posible identificar cuatro descriptores —flatness, loudness, spectral centroid y MFCCs— como los más relevantes para la clasificación de la improvisación libre. Este proceso apunta a la necesidad de seleccionar solamente los datos más relevantes para optimizar la eficacia de los modelos de aprendizaje automático.

Clasificación

Posteriormente, un algoritmo de aprendizaje automático fue empleado para analizar la base de datos generada. Este algoritmo tiene la capacidad de discernir entre las particularidades tímbricas individuales cada segmento de la base de datos a través de la modificación de sesgos y pesos durante el entrenamiento. Para realizar este proceso, la base de datos se divide en dos partes: una se destina al entrenamiento, y la otra a probar el modelo computacional resultante. Durante el aprendizaje, el modelo proporciona un índice de certeza para clasificar o predecir diversos datos en relación con los datos del conjunto de entrenamiento.

SEALI toma dos enfoques: el aprendizaje supervisado y el aprendizaje sin supervisión (Kotsiantis, S. B., Zaharakis, I. D., y Pintelas, P. E. (2006). Machine learning: A review of classification and combining techniques. , , 159–190.Kotsiantis et al., 2007). La distinción clave entre estos enfoques radica en que el primero requiere una base de datos anotada, mientras que el segundo usa datos no clasificados (Kotsiantis, S. B. (2007). Supervised machine learning: A review of classification techniques. , (3), 249-268.Kotsiantis, 2007). En el campo del aprendizaje automático, la clasificación se considera un caso de aprendizaje supervisado en el que se dispone de un conjunto de datos previamente etiquetados, ya sea por humanos o por un modelo de agrupación de datos (Hastie, T., Tibshirani, R., y Friedman, J. (2009). . Springer.Hastie et al., 2009). El aprendizaje no supervisado, por otro lado, se conoce como clustering (Xu, R., Wunsch, D. (2008). . Reino Unido: Wiley.Xu & Wunsch, 2008) y consiste en agrupar datos en categorías que comparten ciertas características basadas en una medida de similitud. Este tipo de modelo se crea utilizando datos de entrenamiento y su fin es identificar la categoría a la que pertenece un elemento con características específicas. Cuando se presenta un nuevo ejemplo sin etiquetar a un modelo de clasificación, este determina la etiqueta en función de su posición relativa con respecto a los límites definidos por el modelo.

El propósito de la clasificación es asignar subcategorías a un conjunto de categorías previamente definidas. Estas categorías deben estar etiquetadas previamente, ya sea mediante una clasificación binaria—one-hot-encode—o una clasificación de múltiples clases. Generalmente, estos datos se analizan individualmente al extraer propiedades numéricas llamadas características o descriptores de audio (Zhang, T., y Kuo, C. J. (2013). . Springer US.Zhang & Kuo, 2013). Los modelos de clasificación se construyen utilizando diversos enfoques, como umbrales simples, técnicas de regresión o redes neuronales (Alpaydin, E. (2004). . MIT Press.Alpaydin, 2004). El propósito del clasificador es generar una salida que corresponda a las categorías conocidas en los datos de entrenamiento. De esta manera, el modelo puede identificar elementos que no ha visto previamente, pero que comparten similitudes con los datos de entrenamiento. Otra aproximación implica entrenar al modelo para predecir valores futuros en función de secuencias de datos de entrada y datos históricos, a menudo utilizando redes neuronales recurrentes (Briot, J., Hadjeres, G., y Pachet, F. (2019). . Springer International Publishing.Briot et al., 2019).

La principal función del aprendizaje automático y de los modelos es la de procesar y analizar datos sin la necesidad de definir reglas explícitas para cada problema. A diferencia de los sistemas expertos que requieren reglas definidas, los modelos de redes neuronales pueden abstraer y sintetizar información para identificar patrones y predecir nueva información. Esto es útil en una amplia variedad de problemas, incluyendo aquellos relacionados con aspectos sensibles de naturaleza humana, así como la creatividad y el arte. Los modelos se construyen a través del entrenamiento, que implica la actualización de pesos y sesgos, la optimización y la regularización de los datos. Estas funciones permiten a los modelos definir límites en el espacio de datos para categorizar nuevas observaciones.

Fiebrink, R. A. (2011). Real-time human interaction with supervised learning algorithms for music composition and performance (Tesis doctoral). Princeton University, USA.Fiebrink (2011), añade que, los algoritmos de aprendizaje supervisado de uso general destinados a tareas de clasificación y regresión tienen la capacidad de aprender la relación entre las entradas y las salidas. A este respecto, un enfoque interesante es donde los usuarios pueden evaluar los modelos entrenados al ejecutarlos en tiempo real, observando cómo se comporta el sistema, por ejemplo, a través de la generación de sonidos sintetizados a medida que se introducen nuevas entradas. Además, los usuarios tienen la opción de ajustar y modificar de manera iterativa los ejemplos de entrenamiento y reentrenar los algoritmos utilizando los datos modificados. A aproximación podría llamarse aprendizaje automático interactivo y brinda a los usuarios la capacidad de corregir fácilmente múltiples errores del sistema mediante modificaciones al vuelo sobre los datos de entrenamiento. Por ejemplo, si el modelo entrenado produce un sonido incorrecto en respuesta a un gesto específico, el usuario puede registrar ejemplos adicionales de ese gesto junto con el sonido deseado y luego entrenar nuevamente el modelo. Esta flexibilidad también permite a los usuarios adaptar y modificar comportamientos del sistema a través del tiempo, como agregar de manera iterativa nuevas categorías de gestos hasta que la precisión aumente o no se requieran más categorías adicionales. El aprendizaje automático interactivo posibilita que las personas creen modelos precisos incluso con muy pocos ejemplos, logrando esto al insertar iterativamente nuevos ejemplos de entrenamiento en áreas del espacio de entrada que son críticas para mejorar el rendimiento del modelo (Fiebrink, R. A. (2011). Real-time human interaction with supervised learning algorithms for music composition and performance (Tesis doctoral). Princeton University, USA.Fiebrink, 2011).

En un contexto de trabajo con compositores enfocados en el diseño de instrumentos controlados por gestos mediante el uso del aprendizaje automático interactivo Fiebrink (2010), observa una estrategia útil para explorar nuevos sonidos y relaciones entre gestos y sonidos. En este enfoque, los compositores primero establecen los 'límites sonoros y gestuales del espacio compositivo', definiendo valores para los parámetros de síntesis y las posiciones gestuales del controlador. Luego, crean un conjunto inicial de datos de entrenamiento utilizando gestos y sonidos en estos límites establecidos. Después de entrenar las redes neuronales con estos datos, los modelos resultantes permiten a los compositores navegar por el espacio de gestos, descubriendo nuevos sonidos tanto dentro como fuera de los límites establecidos por los ejemplos iniciales.

De manera análoga a lo que se describe en Fiebrink, R., Trueman, D., Britt, C., Nagai, M., Kaczmarek, K., Early, M., y Cook, P. (2012, marzo). . ICMC.Fiebrink et al. (2012), en el contexto de SEALI, después de que el algoritmo Mean Shift Clustering analizó la base de datos y los agrupó en distintas carpetas según la clase asignada, los segmentos se sometieron nuevamente al análisis de los mismos descriptores de audio. Al finalizar este proceso, se logró construir una base de datos anotada definida por el algoritmo de agrupamiento MSC. Esta fase del proceso puede ser revisada posteriormente por un humano para verificar y corregir cualquier discrepancia. En este sentido, he decidido mantener en cierta medida la propuesta de clasificación del sistema, incorporando la colaboración humano-máquina, en la cual la máquina aporta su algoritmo derivado del proceso de toma de decisión—humana—orientada a la identificación de materiales sonoros.

Creación de base de datos anotada con Mean Shift Clustering

Una de las razones que me llevó a elegir el algoritmo de Mean Shift Clustering (Comaniciu, D., y Meer, P. (2002). Mean shift: A robust approach toward feature space analysis. , (5), 603-619.Comaniciu & Meer, 2002) fue la intención de evitar sesgos predefinidos para permitir que el proceso se basara en un sentido emergente, influenciado por la interacción algorítmica. Esto implicó que la aproximación se basara en una caracterización preconcebida o sesgada por teorías específicas relacionadas con alguna clasificación sonora o musical, sino generar un proceso que pudiera, en cierta medida, prescindir del juicio humano para distinguir entre las diferentes categorías sonoras dentro del corpus.

La idea detrás de esta aproximación es utilizar medidas de similitud o diferencias sonoras para definir grupos basados en características tímbricas. En este sentido, se empleó el algoritmo de MSC para agrupar segmentos sonoros en diferentes clases. Lo interesante de este algoritmo es que no requiere una indicación explícita sobre el número de clases a crear, a diferencia del algoritmo K-Means, ya que se basa en encontrar concentraciones de elementos en el espacio de datos y actualizar iterativamente los puntos centrales en función de un umbral de decisión. Después, se filtran los puntos para eliminar duplicados cercanos y se forma un conjunto final de puntos centrales rodeados por elementos cercanos a cada conjunto.

El objetivo de incluir este enfoque es permitir que los algoritmos descubran patrones numéricos en los datos del audio para así evitar el sesgo que un humano podría introducir en este proceso y dejar al algoritmo tomar esa decisión. Si bien, esto refleja una diferencia fundamental entre la percepción humana y de máquinas debido a que en algunos casos la clasificación no se adecuaba a las decisiones que un humano pudiera haber tomado, destaca la necesidad de comprender cómo funcionan los algoritmos de clasificación sin supervisión y cuáles son sus limitaciones en contextos complejos como los presentes en la improvisación libre. A continuación, presento los resultados de clasificación producidos por el algoritmo MSC utilizando esta base de datos según los criterios mencionados.

Figura 1



Clasificación de la base de datos con el algoritmo de MSCS

Figura 2



Mapa de conexiones de SEALI para la predicción tímbrica e interacción en la improvisación libre

Referencias

Alpaydin, E. (2004). . MIT Press.

Bailey, D. (1980). . Moorland.

Barad, K. M. (2007). . Duke University Press.

Briot, J., Hadjeres, G., y Pachet, F. (2019). . Springer International Publishing.

Brownlee, J. (2017). . Machine Learning Mastery.

Collins, N. (2006). Towards autonomous agents for live computer music: Realtime machine listening and interactive music systems (Tesis doctoral). University of Cambridge.

Collins, N. (2012). Automatic composition of electroacoustic art music utilizing machine listening. , (3), 8-23.

Davis, S., y Mermelstein, P. (1980). Comparison of parametric representations for monosyllabic word recognition in continuously spoken sentences. , (4), 357-366.

Comaniciu, D., y Meer, P. (2002). Mean shift: A robust approach toward feature space analysis. , (5), 603-619.

Dudas, R. (2010). Comprovisation: The various facets of composed improvisation within interactive performance systems. , , 29-31.

Escobar Castañeda, A. A. (2022). Resistencias maquínicas: Una caracterización a la improvisación libre con aprendizaje y escucha de máquina [Tesis doctoral, Universidad Nacional Autónoma de México]. Facultad de Música.

Fiebrink, R. A. (2011). Real-time human interaction with supervised learning algorithms for music composition and performance (Tesis doctoral). Princeton University, USA.

Fiebrink, R., Trueman, D., Britt, C., Nagai, M., Kaczmarek, K., Early, M., y Cook, P. (2012, marzo). . ICMC.

Galiana Gallach, J. L. (2018). De la naturaleza de la improvisación libre: Elementos esenciales para su identificación y diferencias con la composición escrita. Itamar. , 0.

Gillespie, T. (2013). The relevance of algorithms. En T. Gillespie, P. J. Boczkowski y K. A. Foot (Eds.), (pp. 167-194). MIT Press.

Hastie, T., Tibshirani, R., y Friedman, J. (2009). . Springer.

Hochreiter, S., y Schmidhuber, J. (1997). Long short-term memory. , (8), 1735–1780.

Johnston, J. D. (1988). Transform coding of audio signals using perceptual noise criteria. , , 314–323.

Kotsiantis, S. B. (2007). Supervised machine learning: A review of classification techniques. , (3), 249-268.

Kotsiantis, S. B., Zaharakis, I. D., y Pintelas, P. E. (2006). Machine learning: A review of classification and combining techniques. , , 159–190.

Lerch, A. (2022). . Wiley.

Matthews, W. (2012). . Turner Publicaciones.

Oliveros, P. (2005). . iUniverse.

Painter, T., y Spanias, A. (1997). A review of algorithms for perceptual audio coding of digital audio signals.

Peeters, G., y Rodet, X. (2004). Automatically selecting signal descriptors for sound classification. En (pp. 464-467).

Peeters, R. (2020). The agency of algorithms: Understanding human-algorithm interaction in administrative decision-making. , , 1-16.

Vinet, H., Herrera, P., y Pachet, F. (2002). The CUIDADO project. En 3rd International Society for Music Information Retrieval (ISMIR) Conference (pp. 197-203). Paris, France. Content Based Retrieval.

Schaeffer, P., y De Diego, A. C. (1996). (Serie Alianza música). Alianza.

Xu, R., Wunsch, D. (2008). . Reino Unido: Wiley.

Zhang, T., y Kuo, C. J. (2013). . Springer US.




Obras citadas Alpaydin, E. (2004). Introduction to machine learning. MIT Press. Alpaydin, E 2004 Introduction to machine learning Bailey, D. (1980). Improvisation. its nature and practice in music. Moorland. Bailey, D 1980 Improvisation Barad, K. M. (2007). Meeting the universe halfway: Quantum physics and the entanglement of matter and meaning. Duke University Press. Barad, K. M 2007 Meeting the universe halfway: Quantum physics and the entanglement of matter and meaning Briot, J., Hadjeres, G., y Pachet, F. (2019). Deep Learning Techniques for Music Generation. Springer International Publishing. Briot, J., Hadjeres, G., y Pachet, F 2019 Deep Learning Techniques for Music Generation Brownlee, J. (2017). Long short-term memory networks with Python: Develop sequence prediction models with deep learning. Machine Learning Mastery. Brownlee, J 2017 Long short-term memory networks with Python: Develop sequence prediction models with deep learning Collins, N. (2006). Towards autonomous agents for live computer music: Realtime machine listening and interactive music systems (Tesis doctoral). University of Cambridge. Collins, N 2006 Towards autonomous agents for live computer music: Realtime machine listening and interactive music systems (Tesis doctoral) Collins, N. (2012). Automatic composition of electroacoustic art music utilizing machine listening. Computer Music Journal, 36(3), 8-23. Collins, N 2012 Automatic composition of electroacoustic art music utilizing machine listening Computer Music Journal 36 3 8 23 Davis, S., y Mermelstein, P. (1980). Comparison of parametric representations for monosyllabic word recognition in continuously spoken sentences. IEEE Transactions on Acoustics, Speech, and Signal Processing, 28(4), 357-366. Davis, S., y Mermelstein, P 1980 Comparison of parametric representations for monosyllabic word recognition in continuously spoken sentences IEEE Transactions on Acoustics, Speech, and Signal Processing 28 4 357 366 Comaniciu, D., y Meer, P. (2002). Mean shift: A robust approach toward feature space analysis. IEEE Transactions on Pattern Analysis and Machine Intelligence, 24(5), 603-619. Comaniciu, D., y Meer, P 2002 Mean shift: A robust approach toward feature space analysis IEEE Transactions on Pattern Analysis and Machine Intelligence 24 5 603 619 Dudas, R. (2010). Comprovisation: The various facets of composed improvisation within interactive performance systems. Leonardo Music Journal, 20, 29-31. Dudas, R 2010 Comprovisation: The various facets of composed improvisation within interactive performance systems Leonardo Music Journal 20 29 31 Escobar Castañeda, A. A. (2022). Resistencias maquínicas: Una caracterización a la improvisación libre con aprendizaje y escucha de máquina [Tesis doctoral, Universidad Nacional Autónoma de México]. Facultad de Música. Escobar Castañeda, A. A 2022 Resistencias maquínicas: Una caracterización a la improvisación libre con aprendizaje y escucha de máquina [Tesis doctoral, Universidad Nacional Autónoma de México] Fiebrink, R. A. (2011). Real-time human interaction with supervised learning algorithms for music composition and performance (Tesis doctoral). Princeton University, USA. Fiebrink, R. A 2011 Real-time human interaction with supervised learning algorithms for music composition and performance (Tesis doctoral) Fiebrink, R., Trueman, D., Britt, C., Nagai, M., Kaczmarek, K., Early, M., y Cook, P. (2012, marzo). Toward understanding human-computer interaction in composing the instrument. ICMC. Fiebrink, R., Trueman, D., Britt, C., Nagai, M., Kaczmarek, K., Early, M., y Cook, P 2012 Toward understanding human-computer interaction in composing the instrument ICMC Galiana Gallach, J. L. (2018). De la naturaleza de la improvisación libre: Elementos esenciales para su identificación y diferencias con la composición escrita. Itamar. Revista de Investigación Musical: Territorios para el Arte, 0. Galiana Gallach, J. L 2018 De la naturaleza de la improvisación libre: Elementos esenciales para su identificación y diferencias con la composición escrita Revista de Investigación Musical: Territorios para el Arte Gillespie, T. (2013). The relevance of algorithms. En T. Gillespie, P. J. Boczkowski y K. A. Foot (Eds.), Media technologies: Essays on communication, materiality, and society (pp. 167-194). MIT Press. Gillespie, T 2013 The relevance of algorithms Media technologies: Essays on communication, materiality, and society Hastie, T., Tibshirani, R., y Friedman, J. (2009). The elements of statistical learning: Data mining, inference, and prediction. Springer. Hastie, T., Tibshirani, R., y Friedman, J 2009 The elements of statistical learning: Data mining, inference, and prediction Hochreiter, S., y Schmidhuber, J. (1997). Long short-term memory. Neural Computation, 9(8), 1735–1780. Hochreiter, S., y Schmidhuber, J 1997 Long short-term memory Neural Computation 9 8 1735 1780 Johnston, J. D. (1988). Transform coding of audio signals using perceptual noise criteria. IEEE on Selected Areas in Communications, 6, 314–323. Johnston, J. D 1988 Transform coding of audio signals using perceptual noise criteria IEEE on Selected Areas in Communications 6 314 323 Kotsiantis, S. B. (2007). Supervised machine learning: A review of classification techniques. Informatica, 31(3), 249-268. Kotsiantis, S. B 2007 Supervised machine learning: A review of classification techniques Informatica 31 3 249 268 Kotsiantis, S. B., Zaharakis, I. D., y Pintelas, P. E. (2006). Machine learning: A review of classification and combining techniques. Artificial Intelligence Review, 26, 159–190. Kotsiantis, S. B., Zaharakis, I. D., y Pintelas, P. E 2006 Machine learning: A review of classification and combining techniques Artificial Intelligence Review 26 159 190 Lerch, A. (2022). An introduction to audio content analysis: music information retrieval tasks and applications. Wiley. Lerch, A 2022 An introduction to audio content analysis: music information retrieval tasks and applications Matthews, W. (2012). Improvisando: La libre creación musical. Turner Publicaciones. Matthews, W 2012 Improvisando: La libre creación musical Oliveros, P. (2005). Deep listening: A composer's sound practice. iUniverse. Oliveros, P 2005 Deep listening: A composer's sound practice Painter, T., y Spanias, A. (1997). A review of algorithms for perceptual audio coding of digital audio signals. Painter, T., y Spanias, A 1997 A review of algorithms for perceptual audio coding of digital audio signals Peeters, G., y Rodet, X. (2004). Automatically selecting signal descriptors for sound classification. En Proceedings of the 2004 International Computer Music Conference (pp. 464-467). Peeters, G., y Rodet, X 2004 Automatically selecting signal descriptors for sound classification Proceedings of the 2004 International Computer Music Conference Peeters, R. (2020). The agency of algorithms: Understanding human-algorithm interaction in administrative decision-making. Information Polity, 25, 1-16. Peeters, R 2020 The agency of algorithms: Understanding human-algorithm interaction in administrative decision-making Information Polity 25 1 16 Vinet, H., Herrera, P., y Pachet, F. (2002). The CUIDADO project. En 3rd International Society for Music Information Retrieval (ISMIR) Conference (pp. 197-203). Paris, France. Content Based Retrieval. Vinet, H., Herrera, P., y Pachet, F 2002 The CUIDADO project Schaeffer, P., y De Diego, A. C. (1996). Tratado de los objetos musicales (Serie Alianza música). Alianza. Schaeffer, P., y De Diego, A. C 1996 Tratado de los objetos musicales (Serie Alianza música) Xu, R., Wunsch, D. (2008). Clustering. Reino Unido: Wiley. Xu, R., Wunsch, D 2008 Clustering Zhang, T., y Kuo, C. J. (2013). Content-Based audio classification and retrieval for audiovisual data parsing. Springer US. Zhang, T., y Kuo, C. J 2013 Content-Based audio classification and retrieval for audiovisual data parsing

Describe el contenido de la imagen