<?xml version='1.0' encoding='utf-8'?>
<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Publishing DTD v1.1 20151215//EN" "https://jats.nlm.nih.gov/publishing/1.1/JATS-journalpublishing1.dtd">
<article xmlns:mml="http://www.w3.org/1998/Math/MathML" xmlns:xlink="http://www.w3.org/1999/xlink" article-type="research-article" dtd-version="1.1" specific-use="sps-1.9" xml:lang="es">
	<front>
		<journal-meta>
			<journal-id journal-id-type="publisher-id">vrcd</journal-id>
			<journal-title-group>
				<journal-title>Virtualis. Revista de cultura digital</journal-title>
				<abbrev-journal-title abbrev-type="publisher">Virtualis Rev. cult. digi.</abbrev-journal-title>
			</journal-title-group>
			<issn pub-type="ppub">2007-2678</issn>
			<publisher>
				<publisher-name>Tecnológico de Monterrey, Dirección de Investigación de la Escuela de Humanidades y Educación</publisher-name>
			</publisher>
		</journal-meta>
		<article-meta>
			<article-id pub-id-type="doi">10.46530/virtualis.v18i31.449</article-id>
			<article-categories>
				<subj-group subj-group-type="heading">
					<subject>Artículos</subject>
				</subj-group>
			</article-categories>
			<title-group>
				<article-title>SEALI: intra-acciones humano-máquina en la improvisación libre</article-title>
				<trans-title-group xml:lang="en">
					<trans-title>SEALI: human-machine intra-actions in free improvisation</trans-title>
				</trans-title-group>
			</title-group>
			<contrib-group>
				<contrib contrib-type="author">
					<contrib-id contrib-id-type="orcid">0009-0002-5031-7391</contrib-id>
					<name>
						<surname>Escobar Castañeda</surname>
						<given-names>Aarón Arturo</given-names>
					</name>
					<xref ref-type="aff" rid="aff1">
						<sup>1</sup>
					</xref>
				</contrib>
				<aff id="aff1">
					<label>1</label>
					<institution content-type="original">Tecnológico de Monterrey, México. aaron.escobar@tec.mx</institution>
					<institution content-type="normalized">Tecnológico de Monterrey</institution>
					<institution content-type="orgname">Tecnológico de Monterrey</institution>
					<country country="MX">Mexico</country>
					<email>aaron.escobar@tec.mx</email>
				</aff>
			</contrib-group>
			<pub-date date-type="pub" publication-format="electronic">
				<day>30</day>
				<month>07</month>
				<year>2026</year>
			</pub-date>
			<pub-date date-type="collection" publication-format="electronic">
				<year>2026</year>
			</pub-date>
			<volume>18</volume>
			<issue>31</issue>
			<fpage>279</fpage>
			<lpage>300</lpage>
			<history>
				<date date-type="received">
					<day>04</day>
					<month>03</month>
					<year>2026</year>
				</date>
				<date date-type="accepted">
					<day>10</day>
					<month>06</month>
					<year>2026</year>
				</date>
			</history>
			<permissions>
				<license license-type="open-access" xlink:href="https://creativecommons.org/licenses/by-nc/4.0/" xml:lang="es">
					<license-p>Este es un artículo publicado en acceso abierto bajo una licencia Creative Commons</license-p>
				</license>
			</permissions>
			<abstract>
				<title>Resumen</title>
				<p>Este artículo presenta el desarrollo de SEALI (Sistema de escucha automática para la libre improvisación), un sistema interactivo que utiliza la escucha de máquina para analizar elementos sonoros e incidir en la práctica de la libre improvisación musical. El sistema emplea técnicas algorítmicas aplicadas a la segmentación, el análisis y el entrenamiento de un corpus sonoro a través de redes neuronales, para generar modelos que describen la improvisación libre en términos tímbricos y formales. Para lograrlo, se analiza cómo el aprendizaje supervisado y sin supervisión pueden describir numéricamente esta práctica, así como las redes neuronales recurrentes—particularmente las redes LSTM—, pueden ofrecer una alternativa para la predicción de la forma musical. Estos modelos constituyen la base de este sistema, lo que posibilita la interacción en tiempo real con otros músicos. El artículo detalla las funcionalidades y hallazgos principales en torno a SEALI, aborda los estudios de caso que han contribuido a su evolución continua y retoma algunas discusiones sobre la agencialidad algorítmica en las prácticas artísticas.</p>
			</abstract>
			<trans-abstract xml:lang="en">
				<title>Abstract</title>
				<p>This article presents the development of SEALI (Automatic Listening System for Free Improvisation), an interactive system that utilizes machine listening to analyze sound elements and influence the practice of free musical improvisation. The system employs algorithmic techniques applied to segmentation, analysis, and training of a sound corpus through neural networks to generate models that describe free improvisation in terms of timbral and formal characteristics. To achieve this, the article explores how supervised and unsupervised learning can numerically describe this practice, and how recurrent neural networks—particularly LSTM networks—can offer an alternative for predicting musical form. These models form the foundation of the system, enabling real-time interaction with other musicians. The article details SEALI’s functionalities and key findings, discusses case studies that have contributed to its ongoing evolution, and revisits discussions on algorithmic agency in artistic practices.</p>
			</trans-abstract>
			<kwd-group xml:lang="es">
				<title>Palabras clave:</title>
				<kwd>improvisación libre</kwd>
				<kwd>escucha artificial</kwd>
				<kwd>sistemas interactivos</kwd>
				<kwd>redes neuronales</kwd>
				<kwd>música algorítmica</kwd>
			</kwd-group>
			<kwd-group xml:lang="en">
				<title>Keywords:</title>
				<kwd>free improvisation</kwd>
				<kwd>artificial listening</kwd>
				<kwd>interactive systems</kwd>
				<kwd>neural networks</kwd>
				<kwd>algorithmic music</kwd>
			</kwd-group>
			<counts>
				<fig-count count="2"/>
				<table-count count="0"/>
				<equation-count count="0"/>
				<ref-count count="30"/>
				<page-count count="22"/>
			</counts>
		</article-meta>
	</front>
	<body>
		<sec sec-type="intro">
			<title>Introducción</title>
			<p>El presente artículo parte de mi investigación doctoral sobre SEALI (Sistema de escucha automática para la libre improvisación) el cual es un sistema sonoro interactivo que parte de la escucha artificial, modelada desde mi propia escucha, para analizar elementos sonoros en un ámbito muy acotado de la libre improvisación y, también, para interactuar a varios niveles temporales con otros improvisadores mediante la clasificación y la predicción sonora en el contexto de dicha práctica. Las funcionalidades de este sistema las pienso desde una perspectiva algorítmica y que, en conjunto, articulan la arquitectura de SEALI. A grandes rasgos, éstas comienzan en la selección de un corpus sonoro, posterior a ello, se aplicaron técnicas de segmentación, estructuración, análisis y entrenamiento de redes neuronales para generar una serie de supuestos abstractos a nivel numérico (modelos) que describan esta práctica musical. Finalmente, se desarrolló un sistema interactivo en tiempo real para establecer una serie de respuestas coherentes en la libre improvisación.</p>
			<p>Cada una de estas funcionalidades, implica varios procesos entrelazados por bucles de retroalimentación donde mi escucha y el aprendizaje de máquina se unen con el objetivo de desarrollar la metodología y las técnicas algorítmicas que posibilitaron la realización de SEALI y su integración en contextos artísticos musicales. En este artículo abordaré a detalle las funcionalidades más generales de ese sistema, así como los estudios de caso que han sido útiles para continuar su evolución, bajo el entendido de que su constante introducción en la práctica artística sigue modificando sus funcionalidades para adecuarse cada vez más a las necesidades contextuales de una práctica en permanente cambio como la libre improvisación.</p>
		</sec>
		<sec>
			<title>Definición y caracterización de la libre improvisación y su convergencia con SEALI</title>
			<p>La improvisación libre es una forma de música que no sigue reglas ni estructuras preestablecidas, sino que se basa en la creatividad y la interacción de los músicos al momento de hacerla (<xref ref-type="bibr" rid="B22">Matthews, 2012</xref>). Aunque difícil de datar exactamente en su origen debido a sus raíces en diversas corrientes musicales y académicas, se consolidó como práctica en los años sesenta en Europa y Estados Unidos. <xref ref-type="bibr" rid="B14">Galiana (2018)</xref> define la improvisación libre como “un proceso creativo y no un producto acabado, manufacturado, listo para ser escuchado y consumido tantas veces como se desee”. Sin embargo, algunos improvisadores han llegado a considerar que la libre improvisación fue la primera forma musical creada por los humanos (<xref ref-type="bibr" rid="B2">Bailey, 1980</xref>).</p>
			<p>Inspirada por el <italic>free jazz</italic> y la música académica contemporánea, la improvisación libre surge como una práctica comprometida con la expresión artística y política que cuestionaba las injusticias sociales y económicas de la época. La práctica de la improvisación libre desafió las estructuras de poder en la industria musical, promoviendo la colaboración creativa y rompiendo con las convenciones musicales establecidas, dando lugar a nuevas técnicas y aproximaciones musicales. Los músicos de esta práctica exploran nuevas técnicas instrumentales, sonoridades, ritmos y formas de comunicación musical, rompiendo con las jerarquías y los géneros tradicionales. Algunos de los artistas más reconocidos de esta corriente son Evan Parker, John Coltrane, Peter Brötzmann, Derek Bailey, el grupo AMM, entre muchos otros.</p>
			<p>Sí bien en la actualidad existen proyectos que comparten algunas características con SEALI (<xref ref-type="bibr" rid="B11">Escobar-Castañeda, 2022</xref>), este sistema se distingue por su enfoque en la convergencia entre la escucha artificial y la libre improvisación. En este sistema, la escucha artificial se concibe como un proceso modelado a través de algoritmos de aprendizaje y escucha de máquinas (<xref ref-type="bibr" rid="B7">Collins, 2012</xref>), partiendo de mi propia escucha, generando así un marco de referencia que toma mi bagaje como compositor e improvisador.</p>
			<p>Inicialmente, este enfoque contempla el análisis de elementos sonoros dentro de la libre improvisación y, más adelante, la interacción dinámica entre la escucha artificial y la improvisación. Algunos elementos principales por destacar en este proceso son: la selección de un repertorio sonoro, la aplicación de técnicas algorítmicas para su análisis, la implementación de redes neuronales capaces de capturar numéricamente la esencia de la improvisación libre. Estas técnicas no solo posibilitan el análisis y la respuesta en tiempo real a la improvisación, sino también las interacciones a distintos niveles temporales con otros improvisadores, contribuyendo así a la evolución y expansión de la improvisación libre.</p>
		</sec>
		<sec>
			<title>Desarrollo de SEALI</title>
			<p>A continuación, presento una revisión de las funcionalidades que componen a SEALI. Estos aspectos se dividen en dos categorías: las funcionalidades relacionadas con la clasificación tímbrica y las relacionadas con la predicción de la estructura en la improvisación libre.</p>
			<sec>
				<title>Corpus musical y base de datos</title>
				<p>La primera tarea de SEALI, es analizar un corpus musical de improvisaciones libres que servirá como fuente de <italic>conocimiento</italic> a nivel tímbrico y de estructuras formales recurrentes en este contexto. Inicialmente, comencé con grabaciones de diversos improvisadores de Europa, Estados Unidos y México desde los años 60 hasta la actualidad, sumando 350 archivos de audio, 29 GB de datos y 45 horas de reproducción. Cabe destacar, que este corpus sigue en evolución a lo largo de la investigación debido a la retroalimentación con otros músicos y las adecuaciones constantes al sistema.</p>
			</sec>
			<sec>
				<title>Criterios de segmentación sonora</title>
				<p>Una vez consolidado este corpus, el proceso subsecuente implica un análisis en dos fases: primero, la segmentación del corpus, y segundo, la construcción de una base de datos mediante la extracción de características de audio digital presentes en cada segmento. Como exploraremos más adelante, estas características se denominan descripciones o descriptores de audio (<xref ref-type="bibr" rid="B27">Vinet, 2002</xref>). Este proceso garantiza que los segmentos individuales mantengan coherencia entre sí y sean objetos significativos más allá de su contexto. La segmentación se basa en el análisis de gestos sonoros, elementos auditivamente reconocibles y significativos por sí mismos. Estos gestos pueden estar caracterizados por propiedades, como el timbre, la altura, el ritmo, el contenido, la densidad, la energía y la complejidad espectral. El desafío de esta tarea radica en que estos gestos pueden variar en altura, intensidad, duración, contenido espectral e intención al ser ejecutados, lo que crea un fenómeno multidimensional en constante evolución en función del contexto y la interpretación. Por lo tanto, es esencial entrenar al algoritmo de escucha y aprendizaje automático con una base de datos que contenga una amplia variedad de muestras sonoras representativas de la práctica.</p>
				<p>El concepto de objeto sonoro, influenciado por la obra de <xref ref-type="bibr" rid="B28">Schaeffer (1996)</xref> desempeña un papel esencial en la segmentación del audio en SEALI. Schaeffer introdujo el término ‘música concreta’ para comprender la música como cualquier fenómeno sonoro perceptible y reproducible, independientemente de su origen o significado. El concepto de objeto sonoro se define como una manifestación sonora percibida como una entidad coherente, independientemente de su origen o significado. Los objetos sonoros se relacionan con el gesto, pensado como unidad sonora, que puede evocar emociones y significados sin depender de un contexto musical previo o futuro. Así, el gesto comunica una idea y contiene atributos comunicativos, su apertura a la reelaboración y recontextualización le otorgan un carácter polisémico y una curva energética.</p>
				<p>Cabe mencionar que, a lo largo de la investigación, se examinaron distintas aproximaciones a la segmentación de audio dentro de la improvisación libre, lo que condujo a realizar ajustes y modificaciones en la metodología. Por limitaciones de espacio, en este artículo solo abordaré una de las aproximaciones más significativas.</p>
			</sec>
			<sec>
				<title>Segmentación basada en cambios MFCCs mediante SBIC</title>
				<p>A través de experimentaciones con diferentes descriptores y una validación auditiva, se determinó que los cambios tímbricos eran el criterio más adecuado para la segmentación en el contexto de la improvisación libre. Esta segmentación de audio se basó en el uso del algoritmo <italic>SBic</italic> (<italic>Segmentation on</italic>
					<italic>Bayesian Information Criterion</italic>) (<xref ref-type="bibr" rid="B25">Peeters &amp; Rodet, 2004</xref>), que se enfoca en diferenciar segmentos en una cadena de audio utilizando un umbral principalmente espectral. Este algoritmo emplea un criterio de segmentación bayesiano en función de una matriz de descriptores de audio. En este caso, la matriz de descriptores <italic>MFCCs</italic> (<italic>Mel-frequency cepstral coefficients</italic>), propuesta por <xref ref-type="bibr" rid="B8">Davis y Mermelstein (1980)</xref>, fue útil para establecer el criterio de segmentación, enfocado en cambios tímbricos sustanciales en el audio. El proceso de segmentación consta de tres fases: segmentación en bruto, segmentación fina y validación de los segmentos. Como resultado, se obtuvieron segmentos de audio que variaban en duración, desde centésimas de segundo hasta treinta segundos. Este criterio permitió establecer un puente con el concepto de objeto sonoro, ya que cada segmento contenía las características necesarias para identificarlo como una unidad coherente, lo que llevó a la creación de un corpus de improvisaciones de gestos sonoros.</p>
			</sec>
			<sec>
				<title>Descriptores para el análisis digital de la señal de audio</title>
				<p>El siguiente paso fue construir una base de datos derivada del corpus de segmentos de audio, donde cada elemento se describe numéricamente. Para llevar a cabo esta tarea, se empleó la librería <italic>Essentia</italic>, que ofrece una amplia gama de descriptores de audio y herramientas, que permitieron explorar diversas combinaciones. En este contexto, la elección de descriptores de audio relevantes se vuelve esencial para garantizar resultados coherentes y no generar contradicciones ni ruido en el proceso de clasificación (<xref ref-type="bibr" rid="B18">Johnston, 1988</xref>; <xref ref-type="bibr" rid="B24">Painter, 1997</xref>). La experiencia detallada reveló que la variedad y combinación de descriptores, como <italic>MFCCs, Onset Detection, Loudness, Spectral Centroid, Spectral Flatness, Spectral Contrast, Dynamic Complexity, Spectral Complexity, Mel Bands y Chromagram</italic> (<xref ref-type="bibr" rid="B21">Lerch, 2022</xref>), inicialmente generaron clasificaciones fluctuantes y en ocasiones poco claras. Este análisis, marcado por resultados aparentemente aleatorios, destacó la importancia de una cuidadosa selección de descriptores de audio. Tras exhaustivas pruebas, fue posible identificar cuatro descriptores —<italic>flatness, loudness, spectral centroid y MFCCs</italic>— como los más relevantes para la clasificación de la improvisación libre. Este proceso apunta a la necesidad de seleccionar solamente los datos más relevantes para optimizar la eficacia de los modelos de aprendizaje automático.</p>
			</sec>
			<sec>
				<title>Clasificación</title>
				<p>Posteriormente, un algoritmo de aprendizaje automático fue empleado para analizar la base de datos generada. Este algoritmo tiene la capacidad de discernir entre las particularidades tímbricas individuales cada segmento de la base de datos a través de la modificación de sesgos y pesos durante el entrenamiento. Para realizar este proceso, la base de datos se divide en dos partes: una se destina al entrenamiento, y la otra a probar el modelo computacional resultante. Durante el aprendizaje, el modelo proporciona un índice de certeza para clasificar o predecir diversos datos en relación con los datos del conjunto de entrenamiento.</p>
				<p>SEALI toma dos enfoques: el aprendizaje supervisado y el aprendizaje sin supervisión (<xref ref-type="bibr" rid="B20">Kotsiantis et al., 2007</xref>). La distinción clave entre estos enfoques radica en que el primero requiere una base de datos anotada, mientras que el segundo usa datos no clasificados (<xref ref-type="bibr" rid="B19">Kotsiantis, 2007</xref>). En el campo del aprendizaje automático, la clasificación se considera un caso de aprendizaje supervisado en el que se dispone de un conjunto de datos previamente etiquetados, ya sea por humanos o por un modelo de agrupación de datos (<xref ref-type="bibr" rid="B16">Hastie et al., 2009</xref>). El aprendizaje no supervisado, por otro lado, se conoce como <italic>clustering</italic> (<xref ref-type="bibr" rid="B29">Xu &amp; Wunsch, 2008</xref>) y consiste en agrupar datos en categorías que comparten ciertas características basadas en una medida de similitud. Este tipo de modelo se crea utilizando datos de entrenamiento y su fin es identificar la categoría a la que pertenece un elemento con características específicas. Cuando se presenta un nuevo ejemplo sin etiquetar a un modelo de clasificación, este determina la etiqueta en función de su posición relativa con respecto a los límites definidos por el modelo.</p>
				<p>El propósito de la clasificación es asignar subcategorías a un conjunto de categorías previamente definidas. Estas categorías deben estar etiquetadas previamente, ya sea mediante una clasificación binaria—<italic>one-hot-encode</italic>—o una clasificación de múltiples clases. Generalmente, estos datos se analizan individualmente al extraer propiedades numéricas llamadas características o descriptores de audio (<xref ref-type="bibr" rid="B30">Zhang &amp; Kuo, 2013</xref>). Los modelos de clasificación se construyen utilizando diversos enfoques, como umbrales simples, técnicas de regresión o redes neuronales (<xref ref-type="bibr" rid="B1">Alpaydin, 2004</xref>). El propósito del clasificador es generar una salida que corresponda a las categorías conocidas en los datos de entrenamiento. De esta manera, el modelo puede identificar elementos que no ha visto previamente, pero que comparten similitudes con los datos de entrenamiento. Otra aproximación implica entrenar al modelo para predecir valores futuros en función de secuencias de datos de entrada y datos históricos, a menudo utilizando redes neuronales recurrentes (<xref ref-type="bibr" rid="B4">Briot et al., 2019</xref>).</p>
				<p>La principal función del aprendizaje automático y de los modelos es la de procesar y analizar datos sin la necesidad de definir reglas explícitas para cada problema. A diferencia de los sistemas expertos que requieren reglas definidas, los modelos de redes neuronales pueden abstraer y sintetizar información para identificar patrones y predecir nueva información. Esto es útil en una amplia variedad de problemas, incluyendo aquellos relacionados con aspectos sensibles de naturaleza humana, así como la creatividad y el arte. Los modelos se construyen a través del entrenamiento, que implica la actualización de pesos y sesgos, la optimización y la regularización de los datos. Estas funciones permiten a los modelos definir límites en el espacio de datos para categorizar nuevas observaciones.</p>
				<p>
					<xref ref-type="bibr" rid="B12">Fiebrink (2011)</xref>, añade que, los algoritmos de aprendizaje supervisado de uso general destinados a tareas de clasificación y regresión tienen la capacidad de aprender la relación entre las entradas y las salidas. A este respecto, un enfoque interesante es donde los usuarios pueden evaluar los modelos entrenados al ejecutarlos en tiempo real, observando cómo se comporta el sistema, por ejemplo, a través de la generación de sonidos sintetizados a medida que se introducen nuevas entradas. Además, los usuarios tienen la opción de ajustar y modificar de manera iterativa los ejemplos de entrenamiento y reentrenar los algoritmos utilizando los datos modificados. A aproximación podría llamarse aprendizaje automático interactivo y brinda a los usuarios la capacidad de corregir fácilmente múltiples errores del sistema mediante modificaciones <italic>al vuelo</italic> sobre los datos de entrenamiento. Por ejemplo, si el modelo entrenado produce un sonido incorrecto en respuesta a un gesto específico, el usuario puede registrar ejemplos adicionales de ese gesto junto con el sonido deseado y luego entrenar nuevamente el modelo. Esta flexibilidad también permite a los usuarios adaptar y modificar comportamientos del sistema a través del tiempo, como agregar de manera iterativa nuevas categorías de gestos hasta que la precisión aumente o no se requieran más categorías adicionales. El aprendizaje automático interactivo posibilita que las personas creen modelos precisos incluso con muy pocos ejemplos, logrando esto al insertar iterativamente nuevos ejemplos de entrenamiento en áreas del espacio de entrada que son críticas para mejorar el rendimiento del modelo (<xref ref-type="bibr" rid="B12">Fiebrink, 2011</xref>).</p>
				<p>En un contexto de trabajo con compositores enfocados en el diseño de instrumentos controlados por gestos mediante el uso del aprendizaje automático interactivo Fiebrink (2010), observa una estrategia útil para explorar nuevos sonidos y relaciones entre gestos y sonidos. En este enfoque, los compositores primero establecen los “límites sonoros y gestuales del espacio compositivo”, definiendo valores para los parámetros de síntesis y las posiciones gestuales del controlador. Luego, crean un conjunto inicial de datos de entrenamiento utilizando gestos y sonidos en estos límites establecidos. Después de entrenar las redes neuronales con estos datos, los modelos resultantes permiten a los compositores navegar por el espacio de gestos, descubriendo nuevos sonidos tanto dentro como fuera de los límites establecidos por los ejemplos iniciales.</p>
				<p>De manera análoga a lo que se describe en <xref ref-type="bibr" rid="B13">Fiebrink et al. (2012)</xref>, en el contexto de SEALI, después de que el algoritmo <italic>Mean Shift Clustering</italic> analizó la base de datos y los agrupó en distintas carpetas según la clase asignada, los segmentos se sometieron nuevamente al análisis de los mismos descriptores de audio. Al finalizar este proceso, se logró construir una base de datos anotada definida por el algoritmo de agrupamiento <italic>MSC</italic>. Esta fase del proceso puede ser revisada posteriormente por un humano para verificar y corregir cualquier discrepancia. En este sentido, he decidido mantener en cierta medida la propuesta de clasificación del sistema, incorporando la colaboración humano-máquina, en la cual la máquina aporta su algoritmo derivado del proceso de toma de decisión—humana—orientada a la identificación de materiales sonoros.</p>
			</sec>
			<sec>
				<title>Creación de base de datos anotada con Mean Shift Clustering</title>
				<p>Una de las razones que me llevó a elegir el algoritmo de <italic>Mean Shift Clustering</italic> (<xref ref-type="bibr" rid="B9">Comaniciu &amp; Meer, 2002</xref>) fue la intención de evitar sesgos predefinidos para permitir que el proceso se basara en un sentido emergente, influenciado por la interacción algorítmica. Esto implicó que la aproximación se basara en una caracterización preconcebida o sesgada por teorías específicas relacionadas con alguna clasificación sonora o musical, sino generar un proceso que pudiera, en cierta medida, prescindir del juicio humano para distinguir entre las diferentes categorías sonoras dentro del corpus.</p>
				<p>La idea detrás de esta aproximación es utilizar medidas de similitud o diferencias sonoras para definir grupos basados en características tímbricas. En este sentido, se empleó el algoritmo de <italic>MSC</italic> para agrupar segmentos sonoros en diferentes clases. Lo interesante de este algoritmo es que no requiere una indicación explícita sobre el número de clases a crear, a diferencia del algoritmo <italic>K-Means</italic>, ya que se basa en encontrar concentraciones de elementos en el espacio de datos y actualizar iterativamente los puntos centrales en función de un umbral de decisión. Después, se filtran los puntos para eliminar duplicados cercanos y se forma un conjunto final de puntos centrales rodeados por elementos cercanos a cada conjunto.</p>
				<p>El objetivo de incluir este enfoque es permitir que los algoritmos descubran patrones numéricos en los datos del audio para así evitar el sesgo que un humano podría introducir en este proceso y dejar al algoritmo tomar esa decisión. Si bien, esto refleja una diferencia fundamental entre la percepción humana y de máquinas debido a que en algunos casos la clasificación no se adecuaba a las decisiones que un humano pudiera haber tomado, destaca la necesidad de comprender cómo funcionan los algoritmos de clasificación sin supervisión y cuáles son sus limitaciones en contextos complejos como los presentes en la improvisación libre. A continuación, presento los resultados de clasificación producidos por el algoritmo <italic>MSC</italic> utilizando esta base de datos según los criterios mencionados.</p>
				<p>
					<fig id="f1">
						<label>Figura 1</label>
						<caption>
							<title>Clasificación de la base de datos con el algoritmo de MSCS</title>
						</caption>
						<graphic xlink:href="https://revistavirtualis.mx/index.php/virtualis/article/download/449/820/2814"/>
					</fig>
				</p>
			</sec>
			<sec>
				<title>Análisis de la forma con redes neuronales recurrentes</title>
				<p>Cuando se trata de analizar la forma musical, es decir el desarrollo que una obra sonora o musical tiene a lo largo del tiempo, el análisis de las secuencias de las bases de datos es útil para comprender la estructura y predecir posibles estados futuros a partir de una secuencia inicial. Para lograrlo, los datos se dividen en series de “n” pasos de tiempo (<italic>timesteps</italic>) y se someten al análisis de una red neuronal recurrente (<italic>LSTM, long short term memory</italic>) (<xref ref-type="bibr" rid="B17">Hochreiter, 1997</xref>). Este proceso capacita a SEALI a discernir entre las particularidades tímbricas, pero no solo eso, también a organizar las estructuras numéricas presentes en el corpus a lo largo del tiempo. Como resultado, se genera un modelo computacional que puede ejecutarse en tiempo real para realizar nuevas clasificaciones o predicciones inicialmente sobre células sonoras y posteriormente sobre la forma musical.</p>
				<p>El abordaje de las redes LSTM en SEALI es esencial para explorar las estructuras sintagmáticas en la improvisación musical, lo que proporcionaría una comprensión más profunda sobre distintos parámetros del desarrollo temporal del sonido, como la amplitud, el cambio espectral y el timbre. Esta perspectiva se enfoca en evaluar la capacidad de estos modelos para prever la dirección de la improvisación y su aplicación en tiempo real para interactuar en la ejecución musical. Este enfoque no solo busca reconstruir improvisaciones pasadas, sino también anticipar elementos inéditos de manera coherente, ampliando así las posibilidades creativas de SEALI en la improvisación musical.</p>
				<p>Para validar su uso, realicé un ejercicio preliminar utilizando las <italic>Variaciones Golberg</italic> de J. S. Bach. El objetivo de este ejercicio fue evaluar de manera general las capacidades y limitaciones de esta herramienta, con el fin de identificar algunas de las variables de entrada y estado necesarias para generar reconstrucciones armónicamente coherentes dentro del lenguaje musical de Bach. Este análisis inicial resultó útil para demostrar que las redes LSTM pueden ofrecer una aproximación a la estructura musical, ya que, a partir de una secuencia inicial, pueden reconstruir los elementos subsecuentes utilizando la base de datos de entrenamiento. Además, pude identificar secciones musicales del tipo AABB presentes en las variaciones Goldberg, lo que contribuyó a mi comprensión sobre el funcionamiento de estas redes y su comportamiento en contextos musicales tonales. Para concluir este experimento, comparto algunos ejemplos generados con versiones del modelo en diferentes estados de entrenamiento, desde un 65 hasta un 95 por ciento de certeza, disponible en <ext-link ext-link-type="uri" xlink:href="https://archive.org/details/goldberg-65/">https://archive.org/details/goldberg-65/</ext-link>.</p>
				<p>Posteriormente, el primer experimento en torno a la improvisación libre y las redes LSTM, partió del álbum “More74” del improvisador Derek Bailey, que consiste en 13 improvisaciones libres realizadas con guitarra eléctrica. Para analizar estas improvisaciones, segmenté los audios según cambios tímbricos utilizando los algoritmos <italic>SBIC</italic> y <italic>MFCCs</italic> de la librería <italic>Essentia</italic>, resultando en un total de 17802 segmentos de audio con duraciones de 100 milisegundos a 1600 milisegundos (o 1.6 segundos). A continuación, extraje las características de audio de estos segmentos utilizando el descriptor <italic>Flatness</italic> para medir el nivel de ruido o sutileza tímbrica de cada uno y guardé estas características en un archivo <italic>csv</italic>. Posteriormente, transformé este archivo <italic>csv</italic> a formato <italic>json</italic>, redondeando todos los datos a un entero y dos decimales, lo que resultó en un máximo de 101 posibles elementos dentro de toda la base de datos. Los datos fueron dispuestos en secuencias con pasos de tiempo fijos estructurando así los 17802 elementos secuenciados en 100 pasos de tiempo, lo que resultó en 17802 listas de 100 elementos para análisis secuencial. Tras entrenar la red LSTM con estos datos durante 1723 iteraciones, la función de pérdida descendió hasta alcanzar un mínimo de 0.0100. Luego, realicé pruebas para verificar si el modelo podía reconstruir secuencias idénticas a las originales. Pasando la secuencia original del elemento 0 al 99, el modelo devolvió el elemento 100 como siguiente valor. Iterando este proceso 100 veces, donde las nuevas predicciones se convirtieron en nuevas entradas para las secuencias, se observó que el modelo reconstruyó perfectamente las secuencias derivadas de las originales.</p>
				<p>Una vez completados estos experimentos, el siguiente paso fue dotar a SEALI de herramientas para realizar predicciones multivariables utilizando vectores compuestos por varias características de audio, esta técnica es conocida como secuencia a secuencia (<italic>seq to seq)</italic>. Para ello es crucial integrar otras capas que permitieran trabajar con un formato multivariable en la red, como las capas <italic>Repeat Vector</italic> y <italic>Time distributed</italic> (<xref ref-type="bibr" rid="B5">Brownlee, 2017</xref>). La implementación de estas capas permitió que el modelo predijera estructuras multiparamétricas y pudiera sistematizar los momentos de una improvisación libre más allá de lo que se lograba al predecir un solo vector.</p>
				<p>Las redes LSTM <italic>seq to seq</italic> fueron fundamentales para dotar a SEALI de los mecanismos necesarios para analizar y predecir estructuras sonoras en improvisaciones libres. Los resultados obtenidos muestran el potencial de esta aproximación para la creatividad computacional en el contexto de la improvisación libre. En el arte, esta algoritmicidad <xref ref-type="bibr" rid="B26">Peeters (2020)</xref> puede representar una oportunidad para la exploración y la creatividad, aunque también plantea desafíos y cuestionamientos en cuanto a la interacción humano-máquina.</p>
			</sec>
			<sec>
				<title>Primera aproximación interactiva de SEALI</title>
				<p>El enfoque de las técnicas utilizadas en SEALI se centra en encontrar un equilibrio entre diversos componentes importantes en la improvisación musical, como la imprevisibilidad, el azar y la estructura formal. Se busca crear un sistema que integre estas perspectivas utilizando las posibilidades y limitaciones de la tecnología al momento de la creación de este proyecto y las capacidades de programación del autor que escribe este texto. Sin embargo, en el estado del arte actual, aún se reconocen ciertas limitaciones tecnológicas en la generación de audio de alta fidelidad en tiempo real a través de redes neuronales profundas. Por lo tanto, en la parte reactiva de SEALI, se emplea síntesis de sonido en tiempo real y transformaciones de muestras de audio.</p>
				<p>Para desarrollar un modelo computacional robusto capaz de interpretar nueva información en tiempo real a través de una base de datos anotada, se utiliza el aprendizaje supervisado mediante una red neuronal profunda creada con TensorFlow. Esta red consta de varias capas y miles de parámetros, lo que le permite realizar predicciones en tiempo real de nuevos ejemplos de audio a través de TensorFlow Server.</p>
				<p>Una vez que el modelo está entrenado, es capaz de realizar predicciones en tiempo real sobre nuevos ejemplos de audio. Estos nuevos ejemplos se capturan a través de un micrófono o una conexión interna utilizando JackClient. Cada segmento de audio capturado se somete a un análisis con una ventana temporal previamente definida, en este caso, una duración de dos segundos. Las características de cada segmento se extraen mediante SuperCollider y la librería SCMIR, luego se envían a Python a través de OSC, donde se convierten en formato JSON. Luego, esta información se envía a TensorFlow Server para su clasificación y se devuelve a Python en formato OSC. Una vez que los datos de clasificación se reciben en SuperCollider, se procesan a través de un módulo de generación sonora, que utiliza reglas basadas en límites de certeza de clasificación. Este módulo activa archivos de audio de la base de datos clasificada, sometiéndolos a transformaciones como estiramientos temporales, cambios de tono, síntesis granular y síntesis concatenativa. Además, activa sintetizadores cuyos parámetros se modifican según los datos de clasificación, lo que se considera como un proceso de sonificación de las clasificaciones del modelo. A continuación, presento un diagrama del funcionamiento antes descrito.</p>
			</sec>
			<sec>
				<title>Segunda aproximación interactiva de SEALI</title>
				<p>En esta segunda aproximación, se entregan nuevos ejemplos de audio al modelo, los cuales se dividen en segmentos de dos segundos u otra ventana temporal predefinida que se decida. Mediante Python y a través de la librería <italic>Essentia</italic>, se extraen las características de estos segmentos y los datos se envían a TensorFlow Server para obtener una nueva predicción. Una vez que la información sobre el segmento de audio se clasifica, se envía a Python en formato JSON y Python la convierte en formato OSC para que SuperCollider la reciba.</p>
				<p>
					<fig id="f2">
						<label>Figura 2</label>
						<caption>
							<title>Mapa de conexiones de SEALI para la predicción tímbrica e interacción en la improvisación libre</title>
						</caption>
						<graphic xlink:href="https://revistavirtualis.mx/index.php/virtualis/article/download/449/820/2815"/>
					</fig>
				</p>
				<p>A partir de los datos de predicción generados por el modelo, existen varias formas de abordar la interactividad de SEALI. Una opción es sonificar cada una de las clases detectadas por el modelo. Esta estrategia podría denominarse ‘aproximación continua’, ya que se consideran todos los valores de la predicción, lo que resulta en una continuidad numérica en los niveles de detección para cada clase. Además, si el modelo fue entrenado con 10 clases, devolverá 10 valores diferentes que suman uno en total, donde el valor más alto se interpretará como la clase predominante en la predicción. A continuación, presento una improvisación generada de la interacción de SEALI con la misma salida de audio que devuelve <italic>supercollider</italic>, es decir, escuchando sus propios procesos de retroalimentación (disponible en <ext-link ext-link-type="uri" xlink:href="https://archive.org/details/seali-sola-23-nov-2020">https://archive.org/details/seali-sola-23-nov-2020</ext-link>).</p>
				<p>La segunda opción sería una ‘aproximación discontinua con propiedades deterministas’, aquí, se podría asignar la activación de un proceso relacionado con la detección de la clase predominante, en un momento sonoro específico, mediante reglas booleanas. Es importante destacar que estas dos posibilidades, continua y discontinua, podrían combinarse para enriquecer las capacidades interactivas de SEALI. Esto significa que cuando se detecta una clase específica, se podría activar un sintetizador u otro proceso, y, además, sus parámetros podrían modularse continuamente según los valores de predicción del modelo.</p>
				<p>La metodología interna de SEALI abarca una serie de algoritmos que funcionan en línea tratando de emular un comportamiento en tiempo real, incluyendo la activación de entrada de audio, segmentación de audio, extracción de características, transformación de datos y generación sonora para la interacción. A pesar de que requiere escuchar un número de muestras de audio antes de interactuar, su capacidad de reacción es casi inmediata, lo que sugiere una respuesta instintiva y reactiva. En este estado de desarrollo, SEALI no tiene agencia sobre la toma de decisiones en este nivel interactivo, más allá de su capacidad para clasificar y detectar materiales. Además, la predicción de SEALI puede verse influenciada por factores externos, como ruidos ambientales, sonidos de los músicos y sonidos generados por SEALI, lo que afecta el resultado de la predicción. Una forma de abordar esta situación sería entrenar al sistema con ejemplos que incluyan estas texturas sonoras mixtas, lo que podría proporcionarle una comprensión más sólida de su propio proceso de retroalimentación y permitirle tomar acciones basadas en estas detecciones.</p>
			</sec>
		</sec>
		<sec>
			<title>Intra-acciones y procesos de retroalimentación humano-máquina</title>
			<p>Desde una perspectiva más teórica, un concepto clave que me sirvió para describir los procesos a los que estaba sujeto el desarrollo algorítmico de SEALI es la agencialidad algorítmica o <italic>algoritmicidad</italic> (<xref ref-type="bibr" rid="B26">Peeters, 2020</xref>). Este enfoque analiza cómo la algoritmicidad se inserta en los diferentes procesos dentro del ciclo de retroalimentación que contempla la práctica artística, el desarrollo tecnológico y la investigación. En este sentido, (<xref ref-type="bibr" rid="B26">Peeters, 2020</xref>) destaca cómo los algoritmos pueden ser considerados agentes activos en estos procesos, afectando activamente la interacción entre humanos y tecnología. Resulta interesante analizar a profundidad este ciclo de retroalimentación para comprender cómo la agencialidad algorítmica influye directamente en el desarrollo del proyecto y en los resultados sonoros generados. Estos resultados parecen surgir de mis decisiones personales, sin embargo, tanto los sesgos algorítmicos como los sesgos humanos impregnan todo el proceso, desde la micro hasta la macro-escala (<xref ref-type="bibr" rid="B15">Gillespie, 2013</xref>).</p>
			<p>Las funcionalidades de SEALI experimentan un proceso de afectación constante, influyendo de manera activa en la forma en que segmenta y clasifica la información recibida, en las predicciones de nuevos datos y en el resultado general que produce la interacción mutua de todas las partes implicadas en el proceso. Resulta relevante mencionar a <xref ref-type="bibr" rid="B3">Barad (2007)</xref> en este contexto, ya que introduce el concepto de intra-acción, el cual reconoce la constitución mutua de agencias entrelazadas, en contraposición a la noción de “interacción”, que sugiere agencias individuales separadas antes de cualquier interacción. Debido a la escucha artificial/(asistida) de SEALI y su capacidad para analizar, sistematizar, clasificar, predecir y aportar elementos en la improvisación, surge la noción de una forma de escucha trans-humana. Esta perspectiva considera a SEALI como más que una herramienta tecnológica, sino como un agente capaz de <italic>intra-accionar</italic> con otros músicos, influyendo en la transducción de sus propias formas de escuchar, hacer y concebir la música libremente improvisada. Esta transducción, que está condicionada por la retroalimentación humano-algorítmica, se ve afectada por múltiples procesos recursivos que han configurado el sistema en su conjunto. En este sentido, el concepto de intra-acción de Barad cobra relevancia al reconocer la co-constitución de agencias entrelazadas en esta dinámica trans-humana de creación musical.</p>
			<p>La escucha artificial de SEALI está intrínsecamente ligada a diversos aspectos que moldean su funcionamiento. Estos incluyen su conocimiento, que parte de la base de datos con la que se entrena, así como el sesgo algorítmico inherente que se deriva de la programación de los algoritmos. Además, se añaden a esta ecuación los múltiples bucles de retroalimentación que se generan a través de procesos de validación e interacción humana. Como resultado, el desarrollo de SEALI ha implicado una serie de intra-acciones que han requerido revisión, adecuación, modificación, reelaboración y reestructuración incluso de sus objetivos iniciales. Estos ajustes continuos reflejan la influencia constante de las intra-acciones humano-algoritmicas, resaltando así la importancia de considerar la performatividad de agencias entrelazadas en su propia praxis.</p>
			<p>Al considerar su activa performatividad en torno a la improvisación libre, se puede observar un tipo de <italic>transferencia de conocimiento</italic> a través de las bases de datos con las que el sistema fue entrenado. La transferencia de conocimiento se limita a la predicción numérica y las múltiples filtraciones a las que se sometieron los datos de entrada, así como el proceso de comparación entre entrada y salida, en lugar de una transferencia del conocimiento musical <italic>real</italic> sobre el estilo y las aproximaciones técnicas hacia la improvisación libre. Es evidente que una máquina no puede abstraer ni comprender lo que ocurre en la improvisación libre; en su lugar, puede sistematizar una serie de operaciones que le permiten identificar patrones superficiales del contorno de esta práctica musical. Además, fue necesario realizar numerosos procesos de abstracción en la información, lo que inevitablemente disminuye la resolución de las predicciones generadas por SEALI. Sin embargo, al restringir la escucha de máquina a ciertas descripciones numéricas del audio, es posible obtener resultados satisfactorios en las clasificaciones y predicciones del audio, así como la generación de réplicas numéricas estructurales idénticas a las versiones grabadas de algunas improvisaciones libres con las que trabajé durante su desarrollo.</p>
		</sec>
		<sec>
			<title>Aplicaciones en Contextos Artísticos</title>
			<p>SEALI fue sometido a diversas pruebas y etapas de desarrollo, entre ellas, la colaboración con improvisadores y músicos fue muy relevante. Estas colaboraciones proporcionaron valiosos aportes al proyecto, así como materiales sonoros que sirvieron para entrenar modelos computacionales adaptados a la práctica de improvisación libre y ‘<italic>comprovisación</italic>’ de los participantes (<xref ref-type="bibr" rid="B10">Dudas, 2010</xref>). Además, estas interacciones dieron lugar al ciclo de conciertos “Resistencias Maquínicas”, que exploró los procesos de colaboración humano-máquina en contextos de improvisación libre, esto ayudó a generar nuevos materiales musicales y mejorar la adaptabilidad de SEALI. Desde esta perspectiva, SEALI tuvo vínculos importantes con la escena de música experimental e improvisación libre en la Ciudad de México, enriqueciendo su desarrollo y llevándolo a interactuar de manera más asertiva con los músicos/improvisadores. Asimismo, se realizaron algunas colaboraciones en espacios como Toplap Barcelona y Hangar, esto ayudó a posicionar el proyecto a nivel internacional y recibir valiosa retroalimentación de comunidades interesadas en el desarrollo tecnológico y la creación musical, especialmente el livecoding. SEALI también tuvo presencia en el Programa Arte, Ciencia y Tecnología (ACT), en el Foro Internacional de Música Nueva Manuel Enríquez, en Música UNAM y en diversos foros independientes en la ciudad de Aguascalientes. Es importante mencionar que, si bien los desarrollos actuales de SEALI son el resultado del trabajo individual y la retroalimentación obtenida a través de la práctica improvisativa e investigativa, es necesario reconocer la valiosa participación en etapas tempranas del desarrollo de Diego Villaseñor, así como por Hugo Solis, Ivan Paz y Caleb Rascón.</p>
			<p>El sistema está disponible para su instalación y uso bajo licencias libres en el repositorio de GitHub <ext-link ext-link-type="uri" xlink:href="https://github.com/Atsintli/SEALI-V.I">https://github.com/Atsintli/SEALI-V.I</ext-link> Este repositorio está sujeto a la Licencia Pública General de GNU Versión 3 y se encuentra en constante evolución a medida que SEALI adquiere nuevas funcionalidades. La idea es fomentar la colaboración activa de futuro público interesado en el proyecto, músicos e improvisadores libres, con el fin de construir una comunidad en torno a esta iniciativa, sus posibles derivados y, especialmente, las técnicas de escucha y aprendizaje de máquinas aplicadas a la creación musical. Por otro lado, cabe mencionar que las bases de datos y los modelos creados, están abiertos y disponibles para realizar pruebas, experimentos futuros o sus posibles derivados.</p>
			<sec>
				<title>Interdictos protésicos, estudio de caso</title>
				<p>El desarrollo algorítmico de SEALI en su versión destinada a la comprovisación (<xref ref-type="bibr" rid="B10">Dudas, 2010</xref>), titulada “Interdictos Prostéticos” (<ext-link ext-link-type="uri" xlink:href="https://archive.org/details/aaron-escobar-interdictos-protesicos">https://archive.org/details/aaron-escobar-interdictos-protesicos</ext-link>), implicó desde el inicio una interacción creativa entre humanos y algoritmos. Esta versión toma una base de datos de gestos sonoros grabados por músicos e improvisadores, utilizando como inspiración los procesos de escucha automática de SEALI. Desde esta perspectiva, se busca establecer un vínculo entre la expresión sonora del músico/improvisador y la detección de elementos sonoros, formando un continuo orgánico-digital. Partiendo del concepto de escala, exploramos diversas aproximaciones a las cualidades acústicas y prácticas de los músicos, tomando tres parámetros: digitación, envolventes acústicas y contenido espectral, que a su vez incluyen brillo, complejidad, densidad y centralidad espectral. Los materiales generados fueron analizados para crear una base de datos de descriptores de audio y luego se agruparon con MSC. Posteriormente, estos datos reagrupados fueron analizados por una red neuronal profunda que generó un modelo capaz de identificar los materiales propuestos por cada músico/improvisador. A través de estos procesos de reconocimiento, SEALI toma decisiones en tiempo real en términos tímbricos, energéticos e interactivos, proponiendo gestos sonoros similares o contrastantes a los que escucha, de acuerdo con el conocimiento que tiene sobre el contexto de una improvisación. A continuación, presento una versión ensamblada con los materiales grabados por los músicos y las intra-acciones de SEALI: <ext-link ext-link-type="uri" xlink:href="https://bit.ly/3qagvMh">https://bit.ly/3qagvMh</ext-link>. Además de la versión que se estrenó en el MUAC, UNAM: <ext-link ext-link-type="uri" xlink:href="https://www.youtube.com/watch?v=U3PrrrzxB4c">https://www.youtube.com/watch?v=U3PrrrzxB4c</ext-link>
				</p>
				<p>Esta obra permite su interpretación en diferentes modalidades, con distintas instrumentaciones e intérpretes. En el performance de “Interdictos Prostéticos” realizado por Miguel Ángel Cuevas (<ext-link ext-link-type="uri" xlink:href="https://youtu.be/OUjAYWYenco">https://youtu.be/OUjAYWYenco</ext-link>), se observan varios fenómenos de retroalimentación que desafían tanto al improvisador como a SEALI. En ese performance, se destaca la propuesta musical estructural que aporta SEALI, la cual se basa en las aproximaciones a la forma musical que proponen los improvisadores que formaron parte de los datos de entrenamiento del sistema. De esta manera, se conserva una esencia estructural que guía la improvisación, permitiendo que SEALI adapte su comportamiento a diversas situaciones sonoras. Este proceso puede considerarse como una abstracción del estilo musical, trascendiendo el tiempo y el espacio para integrarse en un flujo iterativo y continuo en múltiples contextos. Al conservar ciertos rasgos cadenciales reconocibles por un improvisador, la improvisación puede guiarse estructuralmente desde el conocimiento que caracteriza a ese estilo.</p>
			</sec>
		</sec>
		<sec sec-type="results">
			<title>Resultados y discusión</title>
			<p>La principal innovación introducida por SEALI radica en sus múltiples funciones y su capacidad para integrarlas, lo que hace útil a cada una de ellas tanto para músicos como para no músicos, improvisadores, investigadores musicales y programadores. Esta estructura ofrece la flexibilidad de derivar cada función en distintas mini-aplicaciones según las necesidades del proyecto. Aunque improvisar con SEALI requiere recursos computacionales relativamente modestos para ejecutar los modelos creados, el entrenamiento de ellos no fue sencillo. Se necesitó trabajar con servidores del IIMAS en la UNAM, proporcionados por el Dr. Caleb Rascón, aunque la capacidad limitada de estos impidió la realización de experimentos más amplios debido a restricciones de memoria para trabajar con bases de datos y arquitecturas neuronales más complejas.</p>
			<p>Esta situación nos sitúa ante una nueva forma de tecnología que, si bien es accesible para cualquier persona con una computadora e internet, solo las grandes empresas o instituciones, en algunos casos universidades, pueden acceder a hardware especializado capaz de crear modelos mucho más grandes y complejos. A lo largo de esta investigación, se buscó tener acceso a algunos de los clústers de supercómputo de algunas instituciones en México, sin embargo, la falta de información y convocatorias vinculadas a proyectos de arte, ciencia y tecnología imposibilitó esta alternativa. Definitivamente, un mayor poder de cómputo ampliaría significativamente las capacidades de aprendizaje y memoria de SEALI.</p>
			<p>Una de las discusiones abiertas en torno al desarrollo de este sistema es su falta de accesibilidad a público no familiarizado con la programación. Pese a ser de código abierto y estar disponible bajo licencias libres, la complejidad de la interconexión de sus módulos requiere simplificarse. Una posible solución es emplear plataformas como Docker o Kubernetes, que permitirían centralizar la gestión de los módulos en un servidor. Esto simplificaría enormemente el proceso de instalación y utilización, haciendo que SEALI sea más accesible. En este contexto, al explorar diversas opciones, una idea es utilizar JavaScript, HTML y CSS para montar todo el sistema en una página web. Si bien esta aproximación tiene limitaciones en cuanto a la calidad y fluidez sonora, ampliaría la accesibilidad del sistema a personas que cuenten con acceso a internet y una computadora.</p>
		</sec>
		<sec sec-type="conclusions">
			<title>Conclusiones</title>
			<p>El desarrollo de este sistema busca abordar la afectación como una propiedad intrínseca y necesaria para la activación de espacios sujetos a la intra-acción, compartida tanto por agentes digitales como humanos. En este sentido, es fundamental encontrar un estado de relación más equitativo con los dispositivos tecnológicos y seguir cuestionando aquellos elementos externos que determinan nuestras posibilidades de relación con la tecnología, usualmente desde una lógica heredera del “racionalismo modernista europeo, que [insiste] en la legitimidad simbólica de un modelo de sociedad capitalista” (Adler, 2021). Por ello, en el desarrollo tecnológico propuesto en esta investigación, se promueve el empleo del software libre y el código abierto, así como la posibilidad de replicar los desarrollos tecnológicos por parte de otros artistas o programadores.</p>
			<p>Desde esta perspectiva, se considera que los desarrollos tecnológicos no necesariamente deben cumplir con criterios de funcionamiento óptimo o validación científica estricta para producir resultados estéticos o plantear cuestionamientos interesantes. Más bien, esta falta de rigor y la apuesta por reconocer los entrelazamientos agenciales humano-máquina, pueden ser aprovechados para transformar la práctica artística y las utilidades finales de estas herramientas, ampliando así el panorama de acción de cada área por separado y en conjunto.</p>
			<p>En el ámbito musical, se apuesta por cuestionar las prácticas y herramientas predominantes en la creación musical académica, buscando desmantelar sus estados más predominantes. Esto implica mirar hacia la multiplicidad que ofrecen el código, el pensamiento algorítmico y la creación sonora, partiendo de una escucha profunda (<xref ref-type="bibr" rid="B23">Oliveros, 2005</xref>) en interacción con la investigación y la improvisación libre.</p>
			<p>En su totalidad, esta investigación busca examinar el cruce del arte, la ciencia y la tecnología para abrir la posibilidad de aplicar herramientas tecnológicas a la creación de nuevas experiencias artísticas y otros posibles imaginarios creativos. Aunque aún hay aspectos de SEALI por explorar, como integrar más bases de datos, arquitecturas de redes neuronales más grandes y profundizar en sus mecanismos de interacción con otros improvisadores, los resultados obtenidos hasta ahora, de acuerdo con la retroalimentación de los músicos/improvisadores, son satisfactorios. Los procesos de organización emergentes, característica inherente del aprendizaje automático, permiten que surjan, por medio de la correcta utilización de las herramientas, los rasgos distintivos sobre la forma musical y otras características concernientes a la práctica de la improvisación libre. Pese a que aún no puede adaptarse a otras prácticas musicales más allá de la improvisación libre, su capacidad para reaccionar de manera agnóstica a lo que escucha es un aspecto interesante que le permite activar sus respuestas sonoras en cualquier situación, considerando sus restricciones booleanas presentes en los procesos de sonificación de datos y de transformación sonora.</p>
			<p>Sin duda, existen aspectos técnicos que requieren elaboración para lograr una integración más fluida entre los elementos sonoros propuestos por SEALI y los gestos sonoros proporcionados por los músicos/improvisadores, las improvisaciones presentadas aquí son evidencia de que es posible crear una forma musical diferente, incidir activamente en la praxis de la improvisación libre y en la forma en la que creamos en colaboración con las máquinas.</p>
		</sec>
	</body>
	<back>
		<ref-list>
			<title>Obras citadas</title>
			<ref id="B1">
				<mixed-citation>Alpaydin, E. (2004). <italic>Introduction to machine learning</italic>. MIT Press.</mixed-citation>
				<element-citation publication-type="book">
					<person-group person-group-type="author">
						<collab>Alpaydin, E</collab>
					</person-group>
					<year>2004</year>
					<source>Introduction to machine learning</source>
				</element-citation>
			</ref>
			<ref id="B2">
				<mixed-citation>Bailey, D. (1980). <italic>Improvisation. its nature and practice in music</italic>. Moorland.</mixed-citation>
				<element-citation publication-type="book">
					<person-group person-group-type="author">
						<collab>Bailey, D</collab>
					</person-group>
					<year>1980</year>
					<source>Improvisation</source>
				</element-citation>
			</ref>
			<ref id="B3">
				<mixed-citation>Barad, K. M. (2007). <italic>Meeting the universe halfway: Quantum physics and the entanglement of matter and meaning</italic>. Duke University Press.</mixed-citation>
				<element-citation publication-type="book">
					<person-group person-group-type="author">
						<collab>Barad, K. M</collab>
					</person-group>
					<year>2007</year>
					<source>Meeting the universe halfway: Quantum physics and the entanglement of matter and meaning</source>
				</element-citation>
			</ref>
			<ref id="B4">
				<mixed-citation>Briot, J., Hadjeres, G., y Pachet, F. (2019). <italic>Deep Learning Techniques for Music Generation</italic>. Springer International Publishing.</mixed-citation>
				<element-citation publication-type="book">
					<person-group person-group-type="author">
						<collab>Briot, J., Hadjeres, G., y Pachet, F</collab>
					</person-group>
					<year>2019</year>
					<source>Deep Learning Techniques for Music Generation</source>
				</element-citation>
			</ref>
			<ref id="B5">
				<mixed-citation>Brownlee, J. (2017). <italic>Long short-term memory networks with Python: Develop sequence prediction models with deep learning</italic>. Machine Learning Mastery.</mixed-citation>
				<element-citation publication-type="book">
					<person-group person-group-type="author">
						<collab>Brownlee, J</collab>
					</person-group>
					<year>2017</year>
					<source>Long short-term memory networks with Python: Develop sequence prediction models with deep learning</source>
				</element-citation>
			</ref>
			<ref id="B6">
				<mixed-citation>Collins, N. (2006). Towards autonomous agents for live computer music: Realtime machine listening and interactive music systems (Tesis doctoral). University of Cambridge.</mixed-citation>
				<element-citation publication-type="thesis">
					<person-group person-group-type="author">
						<collab>Collins, N</collab>
					</person-group>
					<year>2006</year>
					<source>Towards autonomous agents for live computer music: Realtime machine listening and interactive music systems (Tesis doctoral)</source>
				</element-citation>
			</ref>
			<ref id="B7">
				<mixed-citation>Collins, N. (2012). Automatic composition of electroacoustic art music utilizing machine listening. <italic>Computer Music Journal</italic>, <italic>36</italic>(3), 8-23.</mixed-citation>
				<element-citation publication-type="journal">
					<person-group person-group-type="author">
						<collab>Collins, N</collab>
					</person-group>
					<year>2012</year>
					<article-title>Automatic composition of electroacoustic art music utilizing machine listening</article-title>
					<source>Computer Music Journal</source>
					<volume>36</volume>
					<issue>3</issue>
					<fpage>8</fpage>
					<lpage>23</lpage>
				</element-citation>
			</ref>
			<ref id="B8">
				<mixed-citation>Davis, S., y Mermelstein, P. (1980). Comparison of parametric representations for monosyllabic word recognition in continuously spoken sentences. <italic>IEEE Transactions on Acoustics, Speech, and Signal Processing</italic>, <italic>28</italic>(4), 357-366.</mixed-citation>
				<element-citation publication-type="journal">
					<person-group person-group-type="author">
						<collab>Davis, S., y Mermelstein, P</collab>
					</person-group>
					<year>1980</year>
					<article-title>Comparison of parametric representations for monosyllabic word recognition in continuously spoken sentences</article-title>
					<source>IEEE Transactions on Acoustics, Speech, and Signal Processing</source>
					<volume>28</volume>
					<issue>4</issue>
					<fpage>357</fpage>
					<lpage>366</lpage>
				</element-citation>
			</ref>
			<ref id="B9">
				<mixed-citation>Comaniciu, D., y Meer, P. (2002). Mean shift: A robust approach toward feature space analysis. <italic>IEEE Transactions on Pattern Analysis and Machine Intelligence</italic>, <italic>24</italic>(5), 603-619.</mixed-citation>
				<element-citation publication-type="journal">
					<person-group person-group-type="author">
						<collab>Comaniciu, D., y Meer, P</collab>
					</person-group>
					<year>2002</year>
					<article-title>Mean shift: A robust approach toward feature space analysis</article-title>
					<source>IEEE Transactions on Pattern Analysis and Machine Intelligence</source>
					<volume>24</volume>
					<issue>5</issue>
					<fpage>603</fpage>
					<lpage>619</lpage>
				</element-citation>
			</ref>
			<ref id="B10">
				<mixed-citation>Dudas, R. (2010). Comprovisation: The various facets of composed improvisation within interactive performance systems. <italic>Leonardo Music Journal</italic>, <italic>20</italic>, 29-31.</mixed-citation>
				<element-citation publication-type="journal">
					<person-group person-group-type="author">
						<collab>Dudas, R</collab>
					</person-group>
					<year>2010</year>
					<article-title>Comprovisation: The various facets of composed improvisation within interactive performance systems</article-title>
					<source>Leonardo Music Journal</source>
					<volume>20</volume>
					<fpage>29</fpage>
					<lpage>31</lpage>
				</element-citation>
			</ref>
			<ref id="B11">
				<mixed-citation>Escobar Castañeda, A. A. (2022). Resistencias maquínicas: Una caracterización a la improvisación libre con aprendizaje y escucha de máquina [Tesis doctoral, Universidad Nacional Autónoma de México]. Facultad de Música.</mixed-citation>
				<element-citation publication-type="thesis">
					<person-group person-group-type="author">
						<collab>Escobar Castañeda, A. A</collab>
					</person-group>
					<year>2022</year>
					<source>Resistencias maquínicas: Una caracterización a la improvisación libre con aprendizaje y escucha de máquina [Tesis doctoral, Universidad Nacional Autónoma de México]</source>
				</element-citation>
			</ref>
			<ref id="B12">
				<mixed-citation>Fiebrink, R. A. (2011). Real-time human interaction with supervised learning algorithms for music composition and performance (Tesis doctoral). Princeton University, USA.</mixed-citation>
				<element-citation publication-type="thesis">
					<person-group person-group-type="author">
						<collab>Fiebrink, R. A</collab>
					</person-group>
					<year>2011</year>
					<source>Real-time human interaction with supervised learning algorithms for music composition and performance (Tesis doctoral)</source>
				</element-citation>
			</ref>
			<ref id="B13">
				<mixed-citation>Fiebrink, R., Trueman, D., Britt, C., Nagai, M., Kaczmarek, K., Early, M., y Cook, P. (2012, marzo). <italic>Toward understanding human-computer interaction in composing the instrument</italic>. ICMC.</mixed-citation>
				<element-citation publication-type="confproc">
					<person-group person-group-type="author">
						<collab>Fiebrink, R., Trueman, D., Britt, C., Nagai, M., Kaczmarek, K., Early, M., y Cook, P</collab>
					</person-group>
					<year>2012</year>
					<article-title>Toward understanding human-computer interaction in composing the instrument</article-title>
					<source>ICMC</source>
				</element-citation>
			</ref>
			<ref id="B14">
				<mixed-citation>Galiana Gallach, J. L. (2018). De la naturaleza de la improvisación libre: Elementos esenciales para su identificación y diferencias con la composición escrita. Itamar. <italic>Revista de Investigación Musical: Territorios para el Arte</italic>, 0.</mixed-citation>
				<element-citation publication-type="journal">
					<person-group person-group-type="author">
						<collab>Galiana Gallach, J. L</collab>
					</person-group>
					<year>2018</year>
					<article-title>De la naturaleza de la improvisación libre: Elementos esenciales para su identificación y diferencias con la composición escrita</article-title>
					<source>Revista de Investigación Musical: Territorios para el Arte</source>
				</element-citation>
			</ref>
			<ref id="B15">
				<mixed-citation>Gillespie, T. (2013). The relevance of algorithms. En T. Gillespie, P. J. Boczkowski y K. A. Foot (Eds.), <italic>Media technologies: Essays on communication, materiality, and society</italic> (pp. 167-194). MIT Press.</mixed-citation>
				<element-citation publication-type="journal">
					<person-group person-group-type="author">
						<collab>Gillespie, T</collab>
					</person-group>
					<year>2013</year>
					<article-title>The relevance of algorithms</article-title>
					<source>Media technologies: Essays on communication, materiality, and society</source>
				</element-citation>
			</ref>
			<ref id="B16">
				<mixed-citation>Hastie, T., Tibshirani, R., y Friedman, J. (2009). <italic>The elements of statistical learning: Data mining, inference, and prediction</italic>. Springer.</mixed-citation>
				<element-citation publication-type="book">
					<person-group person-group-type="author">
						<collab>Hastie, T., Tibshirani, R., y Friedman, J</collab>
					</person-group>
					<year>2009</year>
					<source>The elements of statistical learning: Data mining, inference, and prediction</source>
				</element-citation>
			</ref>
			<ref id="B17">
				<mixed-citation>Hochreiter, S., y Schmidhuber, J. (1997). Long short-term memory. <italic>Neural Computation</italic>, <italic>9</italic>(8), 1735–1780.</mixed-citation>
				<element-citation publication-type="journal">
					<person-group person-group-type="author">
						<collab>Hochreiter, S., y Schmidhuber, J</collab>
					</person-group>
					<year>1997</year>
					<article-title>Long short-term memory</article-title>
					<source>Neural Computation</source>
					<volume>9</volume>
					<issue>8</issue>
					<fpage>1735</fpage>
					<lpage>1780</lpage>
				</element-citation>
			</ref>
			<ref id="B18">
				<mixed-citation>Johnston, J. D. (1988). Transform coding of audio signals using perceptual noise criteria. <italic>IEEE on Selected Areas in Communications</italic>, <italic>6</italic>, 314–323.</mixed-citation>
				<element-citation publication-type="journal">
					<person-group person-group-type="author">
						<collab>Johnston, J. D</collab>
					</person-group>
					<year>1988</year>
					<article-title>Transform coding of audio signals using perceptual noise criteria</article-title>
					<source>IEEE on Selected Areas in Communications</source>
					<volume>6</volume>
					<fpage>314</fpage>
					<lpage>323</lpage>
				</element-citation>
			</ref>
			<ref id="B19">
				<mixed-citation>Kotsiantis, S. B. (2007). Supervised machine learning: A review of classification techniques. <italic>Informatica</italic>, <italic>31</italic>(3), 249-268.</mixed-citation>
				<element-citation publication-type="journal">
					<person-group person-group-type="author">
						<collab>Kotsiantis, S. B</collab>
					</person-group>
					<year>2007</year>
					<article-title>Supervised machine learning: A review of classification techniques</article-title>
					<source>Informatica</source>
					<volume>31</volume>
					<issue>3</issue>
					<fpage>249</fpage>
					<lpage>268</lpage>
				</element-citation>
			</ref>
			<ref id="B20">
				<mixed-citation>Kotsiantis, S. B., Zaharakis, I. D., y Pintelas, P. E. (2006). Machine learning: A review of classification and combining techniques. <italic>Artificial Intelligence Review</italic>, <italic>26</italic>, 159–190.</mixed-citation>
				<element-citation publication-type="journal">
					<person-group person-group-type="author">
						<collab>Kotsiantis, S. B., Zaharakis, I. D., y Pintelas, P. E</collab>
					</person-group>
					<year>2006</year>
					<article-title>Machine learning: A review of classification and combining techniques</article-title>
					<source>Artificial Intelligence Review</source>
					<volume>26</volume>
					<fpage>159</fpage>
					<lpage>190</lpage>
				</element-citation>
			</ref>
			<ref id="B21">
				<mixed-citation>Lerch, A. (2022). <italic>An introduction to audio content analysis: music information retrieval tasks and applications</italic>. Wiley.</mixed-citation>
				<element-citation publication-type="book">
					<person-group person-group-type="author">
						<collab>Lerch, A</collab>
					</person-group>
					<year>2022</year>
					<source>An introduction to audio content analysis: music information retrieval tasks and applications</source>
				</element-citation>
			</ref>
			<ref id="B22">
				<mixed-citation>Matthews, W. (2012). <italic>Improvisando: La libre creación musical</italic>. Turner Publicaciones.</mixed-citation>
				<element-citation publication-type="book">
					<person-group person-group-type="author">
						<collab>Matthews, W</collab>
					</person-group>
					<year>2012</year>
					<source>Improvisando: La libre creación musical</source>
				</element-citation>
			</ref>
			<ref id="B23">
				<mixed-citation>Oliveros, P. (2005). <italic>Deep listening: A composer's sound practice</italic>. iUniverse.</mixed-citation>
				<element-citation publication-type="book">
					<person-group person-group-type="author">
						<collab>Oliveros, P</collab>
					</person-group>
					<year>2005</year>
					<source>Deep listening: A composer's sound practice</source>
				</element-citation>
			</ref>
			<ref id="B24">
				<mixed-citation>Painter, T., y Spanias, A. (1997). A review of algorithms for perceptual audio coding of digital audio signals.</mixed-citation>
				<element-citation publication-type="book">
					<person-group person-group-type="author">
						<collab>Painter, T., y Spanias, A</collab>
					</person-group>
					<year>1997</year>
					<source>A review of algorithms for perceptual audio coding of digital audio signals</source>
				</element-citation>
			</ref>
			<ref id="B25">
				<mixed-citation>Peeters, G., y Rodet, X. (2004). Automatically selecting signal descriptors for sound classification. En <italic>Proceedings of the 2004 International Computer Music Conference</italic> (pp. 464-467).</mixed-citation>
				<element-citation publication-type="journal">
					<person-group person-group-type="author">
						<collab>Peeters, G., y Rodet, X</collab>
					</person-group>
					<year>2004</year>
					<article-title>Automatically selecting signal descriptors for sound classification</article-title>
					<source>Proceedings of the 2004 International Computer Music Conference</source>
				</element-citation>
			</ref>
			<ref id="B26">
				<mixed-citation>Peeters, R. (2020). The agency of algorithms: Understanding human-algorithm interaction in administrative decision-making. <italic>Information Polity</italic>, <italic>25</italic>, 1-16.</mixed-citation>
				<element-citation publication-type="journal">
					<person-group person-group-type="author">
						<collab>Peeters, R</collab>
					</person-group>
					<year>2020</year>
					<article-title>The agency of algorithms: Understanding human-algorithm interaction in administrative decision-making</article-title>
					<source>Information Polity</source>
					<volume>25</volume>
					<fpage>1</fpage>
					<lpage>16</lpage>
				</element-citation>
			</ref>
			<ref id="B27">
				<mixed-citation>Vinet, H., Herrera, P., y Pachet, F. (2002). The CUIDADO project. En 3rd International Society for Music Information Retrieval (ISMIR) Conference (pp. 197-203). Paris, France. Content Based Retrieval.</mixed-citation>
				<element-citation publication-type="book">
					<person-group person-group-type="author">
						<collab>Vinet, H., Herrera, P., y Pachet, F</collab>
					</person-group>
					<year>2002</year>
					<source>The CUIDADO project</source>
				</element-citation>
			</ref>
			<ref id="B28">
				<mixed-citation>Schaeffer, P., y De Diego, A. C. (1996). <italic>Tratado de los objetos musicales</italic> (Serie Alianza música). Alianza.</mixed-citation>
				<element-citation publication-type="book">
					<person-group person-group-type="author">
						<collab>Schaeffer, P., y De Diego, A. C</collab>
					</person-group>
					<year>1996</year>
					<source>Tratado de los objetos musicales (Serie Alianza música)</source>
				</element-citation>
			</ref>
			<ref id="B29">
				<mixed-citation>Xu, R., Wunsch, D. (2008). <italic>Clustering</italic>. Reino Unido: Wiley.</mixed-citation>
				<element-citation publication-type="book">
					<person-group person-group-type="author">
						<collab>Xu, R., Wunsch, D</collab>
					</person-group>
					<year>2008</year>
					<source>Clustering</source>
				</element-citation>
			</ref>
			<ref id="B30">
				<mixed-citation>Zhang, T., y Kuo, C. J. (2013). <italic>Content-Based audio classification and retrieval for audiovisual data parsing</italic>. Springer US.</mixed-citation>
				<element-citation publication-type="book">
					<person-group person-group-type="author">
						<collab>Zhang, T., y Kuo, C. J</collab>
					</person-group>
					<year>2013</year>
					<source>Content-Based audio classification and retrieval for audiovisual data parsing</source>
				</element-citation>
			</ref>
		</ref-list>
	</back>
</article>
