Reflexiones IA: mis heterodoxias

Reflexiones IA: mis heterodoxias

Sékioz de Niafre

La revolución IA: una pincelada de historia y biología

Es habitual en el gremio señalar a ILSVRC 2012
1
ImageNet Classification with Deep Convolutional Neural Networks Advances 12/2012
(aka «momento ImageNet») como punto de inflexión de la actual revolución IA,
2
Cf., e.g., Sebastian Ruder NLP's ImageNet moment has arrived 2018
y por eso me ha hecho bastante gracia descubrir la siguiente anécdota: «Malik remembers that Hinton asked him: “You're a sceptic. What would convince you?” Malik replied that a victory in the internationally renowned ImageNet competition might do the trick.»
3
Nicola Jones Computer science: The learning machines 2014, donde también notan que la fiebre por las DANN empieza un poco antes, con Building high-level features using large scale unsupervised learning 12/2011 (1B parameters, Google Brain).
(Por contextualizar la pregunta de Hinton, para entonces ya había roto otros record mediante el uso de redes de 8 capas entrenadas en GPU, empezando por Deep Belief Networks for phone recognition 12/2009.)
4
Para aún más contexto, véase el apéndice.
Esto me hace preguntarme si realmente la visión es un problema más complejo (o su solución más revolucionaria) que el reconocimiento de voz (o cualquier otro problema relativo a la percepción), o si por el contrario esa es sólo una preconcepción popular. Quiero decir, en la tradición islámica suele prestarse más atención al sentido del oído que no la vista (como muestran muchos de sus refranes), y en filosofía incluso existen proyectos gnosológicos basados en el olfato (como Etienne Bonnot de Condillac Tratado de las Sensaciones 1754
5
Real Science The Problem Dogs Solved That We Couldn't 2022 profundiza aún más en la riqueza del sentido del olfato.
).
Contra este escepticismo (o por inflar la importancia del «momento ImageNet», que estoy aquí tratando de relativizar), en el gremio suele hacerse palanca de la explicación de Parker (2003) a la explosión cámbrica.
6
Cf., e.g., Stanford University School of Engineering Lecture 1 | Introduction to Convolutional Neural Networks for Visual Recognition ft. Fei-Fei Li 2017.
Sin embargo, Wikipedia Cambrian explosion (8. Possible causes) nota que existen muchas otras hipótesis al respecto,
7
Si bien la Wikipedia no es la mejor fuente del mundo, la cito aquí por su bien documentada bibliografía.
y que la teoría de Parker no está exenta de críticas:
«Eyes may well have evolved long before the start of the Cambrian.
8
McCall The Vendian (Ediacaran) in the geological record: Enigmas in geology's prelude to the Cambrian explosion 2006
It is also difficult to understand why the evolution of eyesight would have caused an explosion, since other senses, such as smell and pressure detection, can detect things at a greater distance in the sea than sight can; but the appearance of these other senses apparently did not cause an evolutionary explosion.
9
Marshall Explaining the Cambrian "Explosion" of Animals 2006
»
Y hablando de la explosión cámbrica, aprovecho la ocasión para desmetir el mito de que contradice la teoría de Darwin:
«Existe una escuela de pensamiento muy anunciada entre los biólogos evolucionistas, cuyos proponentes [Eldredge y Gould, 1972] se hacen llamar interrupcionistas, y que inventaron el término "gradualista" para sus predecesores más influyentes. Han disfrutado de una enorme publicidad, entre un público que no sabe casi nada sobre evolución. Y se debe, en gran medida, a que su posición ha sido presentada por periodistas segundones, más que por ellos mismos, como radicalmente distinta de las posiciones de los evolucionistas anteriores, especialmente Charles Darwin.» (Dawkins El relojero ciego 1986)
10
A modo de complemento, cf. Jon Perry - Genetics & Evolution Stated Casually Natural Selection: What Did Darwin Get Wrong? 2022
Por brevedad, voy a obviar la recomendable argumentación que sigue a continuación en favor de una muestra:
«Las especies pertenecientes a distintos géneros y clases no han cambiado ni con la misma velocidad ni en el mismo grado. En las capas terciarias más antiguas pueden encontrarse todavía algunos moluscos hoy vivientes, en medio de multitud de formas extinguidas. [...] La Lingula silúrica difiere muy poco de las especies vivientes de este género, mientras que la mayor parte de los restantes moluscos silúricos y todos los crustáceos han cambiado mucho.» (Darwin El origen de las especies 1859)

1.1 Apéndice histórico: GPUs, records y arquitecturas

A modo de curiosidad, los primeros usos de GPGPU en ML se remontan a Oh y Jung GPU implementation of neural networks 2004, Steinkrau Using GPUs for Machine Learning Algorithms 2005 y Chellapilla High Performance Convolutional Neural Networks for Document Processing 2006, cf. Ian Goodfellow, Yoshua Bengio y Aaron Courville Deep Learning 2016 sec. 12.1.2 (link), facilitándose su implementación con la salida del lenguaje CUDA de NVIDIA a 6/2007. Por otra parte, cabe notar que ya se era consciente de la necesidad de algún tipo de paralelización desde al menos Hinton Massively parallel architectures for A.I.: Netl, Thistle, and Boltzmann machines 1983.
En cuanto a los records y competiciones, algunos precedentes son Wan Time series prediction by using a connectionist network with internal delay lines 1994 (competición del Santa Fe Institute 1993), Simard et al Best practices for convolutional neural networks applied to visual document analysis 2003 o Neal y Zhang High dimensional classification with Bayesian neural networks and Dirichlet diffusion trees 2006 (NIPS 2003 Feature Selection Challenge), cf. Jürgen Schmidhuber Deep Learning in Neural Networks: An Overview 2014 (sec. 5.13-19), discutido también en mi Consideraciones éticas entorno a: la integración de la IA en sociedad.
Resumiendo, aunque ya se estaba fraguando una revolución DANN silenciosa con el GMDH de Ivakhnenko (1971), el Neocognitron de Fukushima (1979, del que se terminan derivando las CNNs modernas con LeNet-5 1998) y las RNNs (1986, LSTM a 1995), es entorno a Raina Large-scale deep unsupervised learning using graphics processors 1/2009, con la adopción masiva del GPGPU, que se inicia el vigente auge de las DANN, acelerado con la introducción del transformer en Attention Is All You Need 6/2017 (Google Brain).

Difuminando tecnicismos

2.1 Dos sentidos de «muestra representativa»

«The term representative sample is often used, and it seems that the common view of a representative sample is that it is a miniature version of the population.»
11
Grafström, Anton; Schelin, Lina (2014). How to Select Representative Samples. Scandinavian Journal of Statistics, 41(2), 277–290. doi:10.1111/sjos.12016.

2.1.1 Paréntesis matemático

Para mi sorpresa, el artículo continua con una propuesta de definición matemática del concepto. Y es que, en efecto, parece ser que no hay precedente en la literatura. O al menos esa es mi impresión tras consultar los libros de texto: Fuller Sampling statistics 2009, Keener Theoretical Statistics: Topics for a Core Course 2010, Wackerly et al. Mathematical Statistics with Applications 2008, Hogg y Craig Introduction to Mathematical Statistics 1978.
Buscando en fuentes generalistas, veo que Wikipedia en español equipara el concepto al de muestra aleatoria, y define esta de la manera siguiente: «dada una variable aleatoria X con una distribución de probabilidad F , una muestra aleatoria de tamaño N es un conjunto finito de N variables independientes, con la misma distribución de probabilidad F ». Y he de reconocer que, aunque no parece un definición muy productiva, sí captura la idea de muestra representativa (aunque no sé si de aleatoria).
Para terminarlo de liar, la Wikipedia cita como fuente Wilks Mathematical Statistics 1943, donde efectivamente se define «representative sample» (en la sección 4.4), pero de manera diferente a como afirma Wikipedia (que además cita otra sección) y a como Wilks define «random sample» en las secciones 2.3 y 4.1, que de hecho se regodea de la diferencia entre estos dos métodos de muestreo con un teorema.
Sea como fuere, para el matiz que quiero discutir no necesito ni del formalismo de la Wikipedia, ni del tecnicismo de Grafström, por lo que voy a ignorar esta discusión.

2.1.2 ¿Representativa de qué?

Por el coloquialismo «muestra representativa de una población» se entiende a un subconjunto de la población que se comporta estadísticamente como la totalidad de la población. Y aunque no es posible determinar la representatividad de una muestra sin muestrar también la totalidad de la población (en contra del propósito mismo de muestra), sí existen herramientas como la desigualdad de Chebyshov que nos permiten orientarnos (en este caso, determinando el tamaño muestral necesario para obtener un cierto intervalo de confianza).
Sin embargo, incluso si tenemos una muestra perfectamente representativa, esta lo sería sólo en el momento de la recogida debido a que la mayoría de poblaciones son dinámicas, dando lugar a la deriva de los datos.
12
En este sentido, de hecho, creo que sería interesante hacer con los datos un estudio cualitativo de su dinámica (o de la dinámica del sistema complejo que definen), calculando sus puntos atractores y repulsores, periodos, etc., o interpretando su topología y geometría, etc.
Buscando al respecto, he encontrado trabajos que sofistican esta intuición en: Keydana Deep attractors: Where deep learning meets chaos a propósito de Gilpin Deep Reconstruction of Strange Attractors from Time Series 2020 y Strandqvist Attractors of autoencoders - Memorization in neural networks 2020
Y en este sentido, creo que es interesante también estudiar si una muestra dada es representativa o no de la totalidad del espacio muestral. Así, e.g., si representamos una base de datos dos dimensionales y normalizados mediante una nube de puntos sobre el plano, puede ser interesante superponerle un grid de una cierta resolución y examinar en cuales subsecciones faltan datos, pues serán fuente probable de problemas si los datos derivan hacia estas regiones. Todo lo cual no deja de ser una extraña manera de decir que es importante incluir datos OOD (posiblemente sintéticos, cf. VOS: Learning What You Don't Know by Virtual Outlier Synthesis 2022) en el entrenamiento.
Por supuesto, las secciones descritas por el grid pueden contener cierta variabilidad interna (conocida o no, según lo representativo que sea el muestreo), como si se tratasen de una suerte de microclimas, y entonces podemos hablar también de la falta de calidad o indeterminación de los datos, en el sentido de que dicha naturaleza difusa puede deberse fácilmente a factores de confusión que sólo podríamos desentrañar rompiendo nuestra caracterización de los datos en otras dimensiones alternativas.

2.2 Tipos de variables

En el gremio es habitual clasificar los tipos de datos en categóricos (nominales y ordinales) y numéricos (discretos y continuos).
13
Cf. Great Learning Team 4 Types Of Data – Nominal, Ordinal, Discrete and Continuous 2021, statcan Statistics: Power from Data! 2021 (4.2 Types of variables), Masum Rumi Can a discrete numeric variable be ordinal variable?? 2018...
Lo que aquí pretendo hacer es complejizar esta división a través de algunos ejemplos para notar que a menudo dicha división responde más a cómo operamos con el dato que no a la naturaleza misma del dato, en el sentido de que un mismo dato puede manipularse de una u otra manera a conveniencia según cómo enfoquemos el problema que queramos resolver y de los datos a nuestra disposición.

2.2.1 Año: categórica vs numérica (discreta vs ordinal)

Para determinar si una variable es numérica o categórica basta responder a la siguiente pregunta: ¿nos interesan las operaciones algebraicas y funcionales
14
No digo operaciones matemáticas en general porque ello incluiría a las asociadas a la teoría del orden, así como posibles modelizaciones matemáticas de nominales (cf. 2.2.2, 2.2.3). Tampoco lo dejo en operaciones aritméticas o algebraicas a secas (que sería lo habitual en variables discretas) para no excluir a las transformaciones (lineales o no) de variables continuas.
que pudiéramos hacer con la susodicha variable, o sólo su uso como identificativo y (de haberla) su relación de orden? Pues en un contexto de datación por radiocarbono (o, más en general, de series temporales), dado que vamos a operar con el año según la ley de decaimiento, trataremos al dato como discreto.
15
Técnicamente, el año no deja de ser una discretización de la variable continua del tiempo, que es con la que se trabaja en física, pero el ejemplo me vale igual para ilustrar la diferencia entre categórica y numérica. Ahondare sobre este matiz en 2.2.4.
Pero en un contexto de elaboración de vinos, pareciera por el contrario que el álgebra del año no nos aporta tanto, sino sólo si unos son más antiguos que otros.
16
Teniendo en cuenta que no hay una continuidad meteorológica, en el sentido de que a un año de buena cosecha puede seguirle uno de granizo temprano que la eche a perder, sería más preciso decir que el año funciona más como nominal que como ordinal.
Por supuesto, se podría contraargumentar que la media, aunque sea un operador estadístico, es en última instancia una operación algebraica, y que sí tiene sentido preguntarse por la media de los años de los vinos de una bodega. Ahora bien, y por construcción, toda variable ordinal puede tipificarse mediante números naturales,
17
Y, viceversa, en toda variable discreta puede definirse el orden usual.
Por dar otro ejemplo de una dualidad similar, piénsese que las operaciones algebraicas tienen además una contraparte geométrica, como pone de manifiesto el desarrollo histórico mismo del álgebra por Al-Khwarizmi, el teorema de la biyección del número y la recta, 3Blue1Brown Essence of linear algebra 2016, Mathemaniac Essence of Group Theory 2020, el álgebra geométrica de Clifford, la geometría algebraica de Grothendieck...
Por supuesto, en estructuras algebraicas más complejas que N puede ocurrir que no exista ningún orden compatible con sus operaciones, como ocurre con C , pero ello no quita que no podamos seguir definiendo algún orden, como podría ser el lexicográfico.
y siempre tiene sentido hablar de su media como medida de orden (respondiendo a: «¿sobre que parte del espectro recae más mi dataset?»), por lo que si admitiéramos dicho argumento tendríamos que conceder que todas las variables ordinales son en última instancia discretas.
18
Y viceversa, por lo dicho en la nota anterior, diluyendo la distinción hasta tal punto que ambos tipos pasarían a ser sinónimos. Insisto, la distinción entre variable ordinal y discreta no es ontológica o esencial («reality do not fit into neat boxes»), sino pragmática o accidental (¿qué convenimos llamar a qué?): al declarar una variable como ordinal simplemente estamos fijando cómo vamos a interpretar dicha variable.

2.2.2 Modelo de producto: nominal vs ordinal

Supongamos que tenemos un dataset donde cada registro (fila) representa un móvil, y que entre las características (columnas) del dataset se encuentra el modelo del móvil.
A priori, podríamos pensar que el modelo es un dato puramente identificativo y, por ende, nominal. Sin embargo, los modelos suelen nombrase de manera serializada (iPhone, iPhone 2, iPhone 3...), lo que sugeriría que es ordinal. Por supuesto, habrá marcas que no seguirán en su nomenclatura el orden usual de los números naturales, como deja constancia que Motorola A668 sea posterior a Motorola A830,
19
Quizá un ejemplo más flagrante sea: Xbox (2001), Xbox 360 (2005), Xbox One (2013).
pero ello es en el fondo irrelevante (como también lo es que dicha serialización no sea global o transversal a todas las marcas, y que Google Pixel 2 no tenga ninguna relación con iPhone 2): tampoco el orden dado por el teorema de Sharkovskii (o cualquier sucesión de la OEIS) coincide con el usual. La clave, por el contrario, es concretar la intuición de que dicha variable pueda estar capturando un orden a base de definirlo explícitamente, y preguntarse entonces si dicho orden está bien definido y es útil.
En este caso, la intuición es clara: podemos representar todos los modelos de todas las compañías en una línea temporal cronológica (pudiendo incluso renumerarlos globalmente en función de ésta), definiendo así una relación de orden: he visto a gente utilizar los modelos de distintos productos como marcador temporal,
20
Con frases tipo: sucedió cuando salió el iPhone, el SEAT 600, Juego de Tronos... o demás epítomes culturales que, en una suerte de metonimia, pasan a representar una fecha.
por lo que, aunque un tanto extravagante, no es inaudito. Sin embargo, el hecho de que diferentes modelos puedan (y suelan) aparecer simultáneamente (e.g., en eventos como el MWC) descarta esa posibilidad, salvo que queramos interpretar todos los modelos que aparecen a una misma fecha como el mismo modelo (o, más técnicamente, como distintos representantes de la misma clase de equivalencia). Más aún, teniendo en cuenta que podemos capturar directamente dicha información caracterizando a los móviles mediante una columna que sea su fecha de salida, dicha interpretación de la variable como ordinal sería redundante (y por extensión, poco útil), constituyendo además un factor de confusión (en el sentido de que estamos trabajando en el cociente de la susodicha relación de equivalencia y entremezclando nuestras intuiciones de fecha y marca).
Y razonando similarmente a propósito de un dataset de motores, tampoco sería usual ni práctico (aunque sí posible) interpretar como ordinal al tipo de combustible (gasoil, diesel...) a base de pensarlo en función de su eficiencia energética, precio, cantidad de residuos generados u otra lógica semejante.

2.2.3 Color: nominal vs discreta vs continua vs ordinal

De nuevo, la diferencia se traza muy fina, pues el color se puede indicar en función de la longitud de onda del espectro electromagnético (que es un continuo con un orden natural),
21
No voy a entrar aquí en si la naturaleza está en última instancia cuantizada con resolución la longitud de Planck, como postula la cuántica, o si es por el contrario continua, como postula la relatividad general de Einstein. Lo que sí voy a hacer es dar un ejemplo de un tal uso: Gabor et al. Quieting a noisy antenna reproduces photosynthetic light-harvesting spectra 2020.
mediante los espacios de color definidos por modelos matemáticos de representación discreta (HSV o RGBA para web, YUV para televisión analógica, CMYK para impresión, NCS para industria...),
22
Si bien todos estos modelos son multidimensionales (lo que no niega la condición de variable discreta), nada nos impide su mapeo a N (aunque tampoco lo recomendaría).
o a través de una nomenclatura en lenguaje natural de un muestrario de colores (Colour Index International, RAL, Crayola, Wikipedia List of colors by shade...).
Así, si sólo nos interesa indicar el color, será nominal (aunque se represente o se guarde en base de datos numéricamente), pero si nos interesa explotar su álgebra/aritmética para diseño (e.g., permitiendo interpolar dos colores en uno intermedio,
23
Técnicamente, interpolar es una operación continua, aunque siempre podemos redondear el resultado, como se hace en la mayoría de aplicaciones prácticas, donde se trabaja con una representación discreta.
o calcular sus complementarios
24
E.g., mediante The Sessions College Color Calculator.
En lo personal, creo que en ello se piensa más a la variable como ordinal (o, aun mejor, como espacio métrico, hablándose de colores cercanos en uno y otro eje, opuestos, equidistantes...) que como aritmética, pero técnicamente no se puede definir en el círculo cromático un orden global (aunque sí local) que sea compatible con dicha noción (pues, al unir topologicamente por sus extremos al segmento de luz visible en dicho círculo, rompemos la transitividad de la relación de orden en el punto de unión).
), será discreta (aunque nos den el dato mediante un nombre), y si nos interesa a nivel funcional
25
En el sentido matemático del análisis funcional.
para fotometría (permitiendo transformaciones sobre la función de luminosidad fotópica, e.g., para adaptaciones de accesibilidad en daltonismo), será continua, pero si nos interesa sólo sus niveles de energía asociados para fotobiogía y fotomedicina (e.g., para el tratamiento de la ictericia en recién nacidos vía fototerapia, a no confundir con la pseudociencia de la cromoterapia), será ordinal (pues lo que nos interesa es estar en rango de ciertas cotas o regular la intensidad).

2.2.4 Ronda relámpago: discretizaciones de variables continuas, y viceversa

Aunque el tamaño de un objeto puede siempre darse de manera precisa mediante una serie de variables continuas (e.g., a través del sistema diédrico), también es habitual indicarse de manera nominal como pequeño, mediano, grande o de tal o cual tipo (e.g., en el contexto automovilístico) cuando dicho objeto (al menos dentro de una cierta época) se presenta sólo en una serie de tamaños estandarizados (si no en su valor exacto, sí en su rango), lo que permite una conversión entre variables nominales y continuas (en el peor de los casos, dada con un cierto margen de error).
Por otra parte, aunque los caballos de vapor de un coche constituyen una unidad de medida de una variable continua (la potencia),
26
Variable medida en el Sistema Internacional en vatios, definidos por primera vez en 1882, cf. "Address by C. William Siemens". Report of the Fifty-Second meeting of the British Association for the Advancement of Science. Vol. 52. London: John Murray. 1883. pp. 1–33.
esta se usa de facto como variable discreta (en el sentido de prescindir de decimales), ora por cuestiones históricas (pues no existen medios caballos),
27
Aunque hoy se definen los caballos de vapor en función de los vatios, originalmente se definieron en función de los foot-pounds por minuto que producía un caballo de tiro (medida estandarizada en Watt & Bouldon 1783), remontándose la idea (de usar caballos como medida de potencia en lugar de carbón, como originalmente hacía Watt) a Thomas Savery The Miner's Friend 1702, cf. Kirby Engineering in History 1990 (p. 171) y Wikipedia Horsepower (1. History).
ora por razones de marketing, ora porque un caballo de vapor es una cantidad de potencia tan pequeña (al menos referida a coches) que no tiene sentido práctico bajar a los decimales, ora porque los caballos de vapor de un coche están íntimamente relacionados con el número (discreto) de cilindros que tiene y los límites legales de velocidad (por lo que el rango de posibles caballos de vapor es relativamente acotado).
Otro caso interesante es el del precio. Por una parte, podría considerarse una variable discreta (contándolo en céntimos), donde, como antes, no se dan en la práctica ciertos valores (si algo vale del orden de un millón de euros, la menor cifra significativa será del orden de mil, pues diferencias en los cientos se van a redondear por negligibles, incluso dando cuenta del efecto de anclaje en marketing que da lugar a precios tipo 499€). Pero por otra, dado que el precio es tan variable y puede darse en un continuo tan grande (incluso dentro de un mismo tipo de objeto, según si es de lujo o de gama baja de segunda mano), a diferencia de los caballos de vapor, se siente más como una variable continua que la unidad monetaria discretiza (algo que se ve exacerbado con el paso del pago físico en efectivo al digital por transacción bancaria o criptodivisa); no en balde, las variables continuas per se sólo existen como idealización matemática.
28
Piénsese, e.g., que las computadoras no operan en R , sino en un subconjunto de Q dado, e.g., por la representación en coma flotante de doble precisión, cuyo valor mínimo y máximo es de aproximadamente 1 0 -308 y 1 0 308 (para una propuesta de representación más moderna, cf. Gustafson y Yonemoto Beating Floating Point at its Own Game: Posit Arithmetic 2017).

2.2.5 Puertas de un coche: nominal vs discreta

Si bien se suele representar como variable discreta, también es cierto que los valores que puede tomar están muy acotados (a pesar de que técnicamente nada nos impida hacer coches indefinidamente largos con tantas puertas como se quiera, como ejemplifican las limusinas Superbus, de 16 puertas, y American Dream, de 30 m), y no sólo nos indican la cantidad, sino, indirectamente (dadas la implicaciones de diseño y uso), la categoría (o tipo) de coche (en una suerte de trueque de cantidad en calidad), y de ahí que (sospecho) se tienda a pensar más como nominal que como discreta.

2.2.6 Extra: de las unidades de medida

Otros temas interesantes relacionados con esto (i.e., con cómo se presentan y tratan los datos) son el cómo se estructuran los datos complejos (e.g., variables nominales que presentan subtipos para algunas de sus categorías) y la estandarización, homogeneización o unificación de las nomenclaturas y unidades de medida.
Aunque esto último pueda parecer una perogrullada, me remito a Matt Novak Five Massive Screw-ups That Wouldn't Have Happened If We All Just Used the Metric System 2019, que trae a colación tanto la ambigüedad de los datos sin especificación de unidad de medida (e.g., en un dataset internacional de coches, su consumo se especificara como l/100Km en Europa y como mpg en USA si no se ha normalizado antes)
29
De hecho, si lo único que nos indican en dicho dataset es el consumo, sin indicación de la unidad de medida, puede que el consumo ni siquiera haga referencia al combustible, sino (en coches de segunda mano) al kilometraje o la cantidad de tiempo en activo. De hecho, por poder, podría incluso tratarse de la cantidad de días que dura un deposito completo, ora estandarizando un uso promedio del vehículo, ora asumiendo un uso continuo a 90 Km/h (velocidad óptima para eficiencia energética según la DGT), etc. Todo lo cual pone de manifiesto lo inútil que es un dato sin su unidad de referencia.
como la legitimidad teórica y empírica de un método de conversión (e.g., si comparamos el consumo de coches diésel contra eléctricos usando la estimación de que un litro de diésel corresponde a 10,7 kWh, en ello vamos a suponer que estamos trabajando con motores ideales sin perdida de eficiencia);
30
Un problema similar ocurre en nutrición: la cantidad de un micronutriente dado (e.g., el calcio) presente en un cierto alimento (e.g., las almendras) no se corresponde con su biodisponibilidad, que depende de muchos otros factores, que son además dinámicos (e.g., la biodisponibilidad aumenta si el cuerpo identifica una carencia del mismo).
Otro buen ejemplo de esto es el de los caballos de vapor: antes de su estandarización en Watt & Bouldon 1783 ya se habían propuesto otras conversiones (cf. Kirby 1990), sin olvidar que, como notan Stevenson y Wassersug Horsepower from a horse 1993, la potencia pico de un caballo puede ser mucho mayor.
¿Más ejemplos? Un mismo valor de precio refleja realidades distintas (e.g., de coste de oportunidad) según época (debido a la inflación, cuya estimación nunca está exenta de polémica) y divisa (debido a las distintas condiciones materiales, culturales y políticas de cada región, lo que también es contingente a la época; el capitalismo mercantil justo se funda bajo el principio de que un mismo producto tiene valores distintos según la región).
Por último, incluso en las ciencias formales como la computación tenemos que la conversión de tipos de datos no es siempre transparente.
ninguna traducción es trivial, por más convenida y asentada que esté.

Entender el problema es la mitad de la solución: reinventando la rueda

Supongamos que queremos usar modelos de aprendizaje profundo para la predicción de apuestas de carreras de caballos, y que entrenamos nuestro modelo con un conjunto grande y variado de datos para tratar de lograr una buena representación de dicha realidad y minimizar así el número de predicciones erróneas derivadas de la falta de robustez del modelo, maximizando la especificidad (al menos hasta cierto punto, pues podría ocurrir que si somos demasiado exigentes el sistema nunca recomendase apostar) para apostar sólo cuando estemos seguros (pues el coste del fallo es muy alto, la bancarrota, que es justo el objetivo contrario que perseguiría un tal uso).
31
Sobre la dimensionalidad de los datos, es interesante observar que si alimentamos al sistema con demasiadas variables es fácil que termine encontrando correlaciones espurias debido a la carencia de sentido causal. E.g., ¿es casualidad o no, que la lluvia correlacione con el rendimiento particular de un caballo o jinete? Y si efectivamente afecta de manera desigual, ¿es porque afecta a su humor, o porque cambia las condiciones del terreno?
También hay que tener en cuenta, como se comenta en Wong 2019, que varias variables potencialmente relevantes (incluso si esotéricas) pueden no ser accesibles al público, como el estado anímico del jinete (que, si es supersticioso, puede verse afectado por el número del caballo), lesiones, cambios en las rutinas de crianza, etc., si bien se podría probar a prescindir de ellas en una primera fase y tratar de deducirlas cruzando datos si ese primer intento es insuficiente.
Supongamos además que, creyéndonos más inteligentes que nadie, y en vistas a Nauta et al. Uncovering and Correcting Shortcut Learning in Machine Learning Models for Skin Cancer Diagnosis 12/2021
32
Citando:
Lapuschkin, S.; Wäldchen, S.; Binder, A.; Montavon, G.; Samek, W.; Müller, K.R. Unmasking Clever Hans predictors and assessing
what machines really learn. Nat. Commun. 2019, 10, 1096.
Geirhos, R.; Jacobsen, J.H.; Michaelis, C.; Zemel, R.; Brendel, W.; Bethge, M.; Wichmann, F.A. Shortcut learning in deep neural
networks. Nat. Mach. Intell. 2020, 2, 665–673.
Mishra, N.K.; Celebi, M.E. An overview of melanoma detection in dermoscopy images using image processing and machine
learning. arXiv 2016, arXiv:1601.07843.
Winkler, J.K.; Fink, C.; Toberer, F.; Enk, A.; Deinlein, T.; Hofmann-Wellenhof, R.; Thomas, L.; Lallas, A.; Blum, A.; Stolz, W.; et al.
Association between surgical skin markings in dermoscopic images and diagnostic performance of a deep learning convolutional
neural network for melanoma recognition. JAMA Dermatol. 2019, 155, 1135–1141.
y OpenAI Faulty Reward Functions in the Wild 12/2016
33
El fenómeno es descrito en Specification gaming: the flip side of AI ingenuity 4/2020 (DeepMind), notando que dicha ingenuidad (o reward hacking) no sólo puede conducir a inesperadas y novedosas soluciones indeseadas, sino también a otras legítimas (como el movimiento 37 de AlphaGo, en la línea de du Sautoy Thinking Better: The Art of the Shortcut 2021 o, incluso, los speedrun hacks, dentro de su propia e inusual definición del objetivo), en función de lo bien alineada que esté la especificación de tarea (cuestión que se complementa con el reward tampering, que es cuando la máquina alinea al humano a ella y no viceversa, en la línea del «adapt-to-AI principle» de Gerd Gigerenzer How to Stay Smart in a Smart World 2022).
Para más ejemplos de reward hacking, el artículo cita Gwern The Neural Net Tank Urban Legend 2011 (actualizado a 2019), donde se añaden las relevantes observaciones: «Getting into more general economic, behavioral, or human situations would be going too far afield, but the relevant analogues are “principal-agent problem”, “perverse incentives”, “law of unintended consequences”, “Lucas critique”, “Goodhart’s law”, or “Campbell’s law”; such alignment problems are only partially dealt with by having ground-truth evolutionary ‘outer’ losses, and avoiding reward hacking remains an open problem (even in theory).», «And it can be hard to avoid errors: sure, in hindsight, once you’ve seen the converged reward hack, you can laugh and say “of course that particular bit of reward-shaping was wrong, how obvious now!”—but only in hindsight. Before then, the absence of the hack is just common sense: we are blinded by our knowledge, which is a burden optimization processes do not share.»
Por otra parte, el artículo de Gwern añade además una discusión (que incluye, entre muchos otros ejemplos, el del diagnóstico de cáncer de piel) del problema de los sesgos en los datos de entrenamiento de CNNs que puedan llevar a la detección de realidades distintas a la intencionada. Y si bien Gwern relativiza su gravedad, Goal MisGeneralization (MGM): Why Correct Specifications Aren’t Enough For Correct Goals 10/2022 (DeepMind, arXiv) parece reivindicarla en el anexo B.2 de correlaciones espurias en clasificación de imágenes (donde también se cita el estudio de Winkler sobre el diagnóstico de cáncer de piel), contextualizando (en la sección 6) el problema del GMG como subproblema de la falta de robustez (i.e., de generalización en inferencia a datos fuera de la distribución de entrenamiento) de los modelos de DANN, cuestión diseccionada en Geirhos Shortcut Learning in Deep Neural Networks 2020, Figure 4 (arXiv) en otros subproblemas (como el del domain shift, que da lugar a Visda: The visual domain adaptation challenge 2017-actualidad, Domain Generalization: A Survey 2021).
, tenemos la precaución de ignorar las cuotas (odds) de las apuestas para evitar que el modelo las use como atajo y prediga como ganador simplemente al caballo preferido. Entonces, digo, habremos caído rendidos ante nuestra propia hibris, perdiendo de vista el objetivo real de este sistema predictivo, que no es saber qué caballo va a ganar, sino cuándo merece la pena apostar, como se discute en The Royal Institution The 10 Equations that Rule the World - with David Sumpter 2020 a propósito de William Benter Computer Based Horse Race Handicapping and Wagering Systems: A Report 1994,
34
Como se comenta en Yeung Wong Bill Benter (1994) Computer Based Horse Race Handicapping and Wagering Systems: A Report 2019, una de las claves del sistema de Benter es que las cuotas se gestionan aparte en un segundo modelo.
en la línea de Computer Group (Michael Kent, Billy Walters...) en los 1980.
35
Cf. CBS News Sports Betting: Billy Walters 2011, donde se nota que el mercado de apuestas es un entorno más predecible que el de activos financieros, y bookie101 The Secret World of the Computer Group 2012 (link).
Para otro ejemplo de este enfoque cuantitativo, me remito a Sports Information Traders (2004, Jon Price). Y sobre la naturaleza adversaria del ecosistema, a Scott Eden Meet the world's top NBA gambler 2013 (link).
Todo lo cual me recuerda a Numberphile Statistics and Saving Lives - with Jennifer Rogers 2020, donde se reivindican a los modelos de estadística clásica (eso sí, en un contexto muy diferente: la modelización de fenómenos nuevos para los cuales aún no tenemos datos, como ocurría con la pandemia del COVID-19).

Aplicaciones peculiares

4.1 Análisis de sentimiento para periodización

Es habitual en filosofía y artes hablar de las etapas de un autor. Por ejemplo, según la Wikipedia, la crítica suele periodizar la obra de Picasso en: Período azul (1901–1904), Período rosa (1904–1906), Período de influencia africana (1907–1909), Cubismo analítico (1909–1912) y Cubismo sintético (1912–1919).
Con esto en mente, Experimental Philosophy | ExPhi Can an Artificial Intelligence System Read Plato? (Topic Modeling) 12/2021 se propone ver si la IA es capaz de llegar a la periodización habitual de Platón o, por el contrario, llega a otra partición. La demostración me parece bastante enriquecedora en tanto que en ella se discute en vivo las distintas pruebas de clustering (aka agrupamiento) que se van haciendo configurando distinto número de agrupaciones objetivo, poniendo de manifiesto la necesidad de conocer el dominio de los datos. (El clustering lo hace sobre las temáticas, no sobre la componente temporal, que es en lo que consistiría al final la periodización, y que aquí se hace a ojo.)
Esto me parece interesante por dos motivos:
  1. Periodizar es algo que también se hace en arqueología e historia, cambiando «obra» por «objetos» y «eventos».
  2. Periodizar suele ser algo controvertido, en el sentido de que se puede hacer de muchas maneras diferentes en función del criterio (o sesgo) que se tenga.
    36
    La historia de la historia es una movida en la que no voy entrar aquí, pero creo que Ernesto Castro De Schleiermacher a Dilthey | Hermenéutica (4/15) y Historia vs. narración | Hermenéutica (8/15) 2022 a propósito de Gadamer y Ricoeur ofrece una buena introducción (o, por citar algunas de sus referencias, White Metahistory 1973). Para otros recursos, véase mi Algunos recursos divulgativos contra el historicismo filosófico o incluso Wikipedia Periodización. Para un ejemplo menos ideológicamente cargado, si la memoria no me falla, recomiendo la introducción de Kramer La historia empieza en Sumer 1956.
Aquí voy a pecar de ingenuo, pero aunque este tipo de aplicaciones IA corren un fuerte riesgo de introducir sesgos (como dije, el conocimiento particular de quién hace el agrupamiento lo informa a su vez), sí veo también una oportunidad para confrontarlos. No en el sentido de que la IA vaya a dar la lectura (o periodización, en este caso), sino en el sentido de que la IA puede dar unas lecturas,
37
En lo personal, no creo que haya una lectura correcta de la situación, prefiriendo la aproximación pluralista y maximalista de, e.g., Sam Rose Interpreting Art 2022 discutida en Philosophy Tube Is Art Meaningless? 2022; a quién le parezca que estiro mucho la referencia, recuerdo que la Historia es una de las nueve musas y que, como dije a propósito de Ernesto Castro, tiene mucho de interpretativa.
nuevas y múltiples, a base de jugar con la configuración de pesos o importancia que se da a las distintas variables (aquí, por supuesto, el problema es definir cuales, vigilando qué se excluye y qué se incluye).
38
Como yo lo estoy pensando, la IA daría una clasificación por cada parametrización (o combinación de pesos) que diera clusters muy correlados, recorriendolas todas con un cierto paso epsilon (aunque tengo dudas sobre su viabilidad computacional y los umbrales), y haciendo un escaneado final para eliminar las clasificaciones similares entre sí, dejando sólo las más correladas de cada tipo.
PS. Mis enrevesadas especulaciones a parte, lo cierto es que ya existe literatura (de corte mucho más positivista) sobre el uso de DANNs para la periodización, cf. DeepMind Restoring and attributing ancient texts using deep neural networks 5/2022.

4.2 «Fashion changes, but style endures» Chanel

En vistas a Mina Le celebrities need to STOP creating beauty brands! 7/2022, profesiones como Fashion Store Assistant & Personal Shopper
39
Para una contextualización histórica, véase el apéndice.
y compañías como Chicisimo (2010)
40
Cf. Johanna De La Cruz RECREANDO LOOKS CON CHICISIMO 2017 y Donostia Tech Week Gabriel Aldamiz, Chicisimo 2018. Para un enfoque alternativo con IA clásica (e.g., para el arranque en frío), bastaría con determinar el color predominante de cada prenda y recomendar piezas con colores iguales, análogos, complementarios, triadicos, cuadrados, split-complementary o rectangulares respecto a la rueda de colores: creo que esto sólo ya sería de ayuda para personas daltónicas que quieran pasar desapercibidas y no hacer un Neil Harbisson.
, yo me pregunto: ¿para cuando una app de influencer's closets que funcionara como una suerte de transferencia de estilo?
41
Aunque no es como se vende Chicisimo, en la práctica es lo que ya está haciendo: cuando me lo planteé no la conocía.
E.g., que dada una cuenta de instagram, devolviera sus enlaces afiliados (de tenerlos, que sería lo esperable si es un canal dedicado a la moda)
42
Afiliación, sponsorship y endorsement no son lo mismo, pero menos es nada.
o, de no tenerlos, identificara sus prendas y devolviera enlaces para su compra; o que encontrara similitudes entre su guardarropas y el propio (recomendando las combinaciones homologas, a lo Chicisimo), o que estuviera directamente personalizado por (o entrenado con los looks de)
43
Looks que se podrían basar en su histórico, en sesiones de probador de una tienda que quisiese usar esto a modo de marketing, en una selección hecha a mano, etc.
la celebridad de turno (que lo vendiera como producto de marca personal).

4.2.1 Apéndice histórico: estilismo y sociedad de consumo

El oficio puede remontarse al menos hasta la marchante de moda Rose Bertin (modista de la reina Maria Antonieta, 1772-1791, marca el inicio de la alta costura), Beau Brummell (arbitro de la moda durante la regencia de George IV, 1798?-1815, y pionero del dandismo, suponiendo un cambio de paradigma en la escena: la moda ya no la dicta la aristocracia por nacimiento, como ejemplificaba la fascinación por la patina, sino una elite de estetas por su buen gusto),
44
Giro que me recuerda a Weber diciéndole a Marx que las condiciones materiales no lo son todo, sino que también hay unas condiciones culturales transversales (e.g., en su La ética protestante y el espíritu del capitalismo 1905).
Marshall Field's Personal Shopping Service (1852, que marca un tercer momento de moda democratizada)
45
Esta clasificación en tres momentos (o estilos, pues convivieron en el tiempo) bebe de Williams Dream Worlds: Mass Consumption in Late Nineteenth Century France 1982.
y Charles Frederick Worth (sastre y diseñador que asienta la alta costura moderna a través de su firma de 1858-95),
46
Entre sus innovaciones se encuentran los primeros desfiles de moda, cf. House of Worth: The Birth of Haute Couture 2017, Stark The Fashion Show: History, theory and practice 2018 y Leach Transformations in a Culture of Consumption: Women and Department Stores, 1890-1925 1984; a modo de referencia, la New York Fashion Week se inaugura en 1943. Con el cambio de siglo encontramos también las primeras revistas de moda modernas, como Myra's Journal of Dress and Fashion (1875), cf. Breward Femininity and Consumption: The Problem of the Late Nineteenth-Century Fashion Journal 1994.
Recogen el legado de Worth las casas de moda de Callot Soeurs, Patou fl. 1914-29, Paquin, Poiret, Vionnet, Fortuny, Lanvin, Chanel, Mainbocher, Schiaparelli, Balenciaga y Dior, haciendo estos dos últimos de protectores de Yves Saint Laurent, Pierre Cardin, André Courrèges, Ted Lapidus y Emanuel Ungaro durante los 1960, apareciendo en paralelo Hanae Mori, Armani (1975), Ray Petri (Buffalo Boys 1985, que mezcló alta costura con prendas deportivas sobre looks andróginos)... y, más importante para esta discusión, las primeras firmas de fast fashion, como H&M (1947), Zara (1963) o Primark (1969), cuya industria no explotaría hasta el cambio de siglo.
Y a nivel más institucional tenemos: Chambre syndicale de la haute couture (1868, Ralph Toledano), École de la chambre syndicale de la couture parisienne (1927, de la que surge, e.g., Valentino), Men's Dress Reform Party (1929, más enfocada a la higiene), Fashion Group International (1930, Edna Woolman Chase, redactora jefa de Vogue), Fashion Originators Guild of America (1932, denunciando la piratería), Incorporated Society of London Fashion Designers (1942), Camera Nazionale della Moda Italiana (1958), Corset and Brassiere Women's Club (1958), Council of Fashion Designers of America (1962, Eleanor Lambert), International Colour Authority (1968), Peclers (1970), Chambre syndicale du prêt-à-porter des couturiers et des créateurs de mode (1973, Bruno Pavlovsky)...
popularizándose con John T. Molloy Dress for Success 1975 (donde se acuña la expresión «image consulting» y «power dressing») o Judith Rasband (fundadora de Conselle: Institute of Image Management 1970), fundándose la Association of Image Consultants International en 1990.
47
En teoría, hasta entonces el estilismo (probablemente en forma de alta costura hecha a medida) era sólo común entre políticos, modelos, personalidades de la televisión y celebridades. Sin embargo, la existencia de revistas de moda como Harper's Bazaar (1867) y Vogue (1892), el comentario «it is by no means an uncommon occurrence, in an inclement climate, for people to go ill clad to appear well dressed» (Veblen The Theory of the Leisure Class 1899), la denuncia de la piratería de marcas por parte de Fashion Originators Guild of America (1932), o quizá incluso los slop shops del XVII, parecen contrariar esta narrativa de que no hubiera ya un interés por la moda por parte de las masas.
Más aún, Marshall Field's desafía la idea de que no hubiera también una profesionalización de su asesoramiento para las mismas, si bien es verdad que no he podido encontrar detalles al respecto, por lo que no sé cómo se compara Marshall con Molloy: tal vez debería pensar más en Marshall como un mecánico positivista que me da asesoramiento técnico sobre una reparación y a Molloy como un asesor posmoderno de tendencias para tunning, o, usando la jerga mucho más clarificadora de Hans-Georg Moeller, el segundo como un asesor para la construcción de la identidad bajo la tecnología del perfilamiento (aka profilicity), en términos de branding (Thompson c. 1900) y personal branding (Ries y Trout Positioning: The Battle for Your Mind 1981, Ch. 23. Positioning Yourself and Your Career), y el primero bajo la tecnología de la sinceridad (aka tradición) o autenticidad.
Sea como fuere, y en vistas a Kayleigh The 1960s-1970s: An Exploration of Androgyny in Men’s Fashion 2021 a propósito de la Beatlemanía, el glam rock, el movimiento hippie, Reagan..., aunque no soy capaz de trazar una continuidad entre Marshall y Molloy, creo que Molloy debe su fama meramente a la instrumentalización de la moda (y otro tanto con Rasband y AICI), y no a que popularizase el asesoramiento de imagen en sí. Para una problematización de estos dress code a propósito del pelo largo en hombres nativo americanos y otros, cf. For Harriet Gender is a Scam | The Embodiment of Masculinity 9/2022.
Y aunque me tienta decir que dicho auge se lo debemos a la consolidación de la sociedad de consumo tras las dos revoluciones industriales, lo cierto es que técnicamente esta es bastante anterior, remontándose a la burguesía de finales del XVII (entusiasmada con las exportaciones indias de calico y muselina durante los 1690 que marcan el inicio de la «comercialización de la moda»)
48
McKendrick 1982. Esta también es la época de los slop shop: second-hand clothing stores growing in popularity in the late 1600s and 1700s that acted in a similar way to modern thrift shops, cf. Linden An Analysis of the Fast Fashion Industry 2016.
descrita en la sátira Mandeville The Fable of The Bees: or, Private Vices, Publick Benefits 1705,
49
Cf. Peck Consuming Splendor: Society and Culture in Seventeenth-Century England 2005, si bien Mukerji From Graven Images: Patterns of Modern Materialism 1983 se retrotrae hasta finales del XIV a propósito de la imprenta (particularmente de mapas), afirmando que la cultura materialista causa al capitalismo industrial y no viceversa, en la línea de la trade-based theory de Sweezy y Wallerstein (aka «commercialisation model»), que traza el origen del capitalismo en el mercantilismo (aka merchant capitalism, que emerge con el Elizabethan System de medidos del XVI, empezando con ello a ganar poder político la burguesía), y que ha sido cuestionada por el modelo agrario en el llamado «Brenner debate» (The Transition from Feudalism to Capitalism 1976 y The Brenner Debate: Agrarian Class Structure and Economic Development in Pre-Industrial Europe 1985), que traza el origen del capitalismo en la conquista normanda de Inglaterra (1066), que da lugar a la abolición de la esclavitud y a un mercado de contratos de arrendamiento de tierras en el que los señores feudales pagan a los granjeros propietarios por su producción anual, y la crisis (de la primera mitad) del siglo XIV, con el colapso de la institución del señorío y el aumento de los granjeros propietarios.
y alcanzando una segunda fase vía la invención del marketing moderno con Josiah Wedgwood a mediados del XVIII,
50
Cf. McCracken Culture and Consumption: New Approaches to the Symbolic Character of Consumer Goods and Activities 1988 I.1 (quién señala como inicio de la primera fase la Inglaterra Isabelina de mediados del XVI, donde ya se daban los ciclos de moda anuales) y quarc Coming to live in a consumer society (link) para una síntesis de varios recuentos históricos.
y apareciendo en una tercera fase los primeros grandes almacenes modernos (posibilitados por la Primera Revolución Industrial, 1760-1848) como Harding Howell (1796-1820, UK), Au Bon Marché (fl. 1852, Paris) y Marshall Field's (1852, USA), que obligan a la práctica del branding para la diferenciación de los productos durante los 1880 (con Quaker man, Pears' soap, Campbell's soup, Coca-Cola, Juicy Fruit, Aunt Jemima...), dando lugar a las revista comerciales y la gestión de marca con James Walter Thompson fl. 1877-1900, y acuñándose la expresión «conspicuous consumption» en Veblen The Theory of the Leisure Class 1899.
Tampoco se lo puedo atribuir a la (cuarta fase de) producción en masa inaugurada con Ford 1908 y Taylor 1911, que terminó de democratizar el acceso a bienes de consumo distintos de las necesidades básicas,
51
A ello también contribuyó el auge coetáneo de los sistemas de crédito, cf. Calder Financing the American Dream 1999 ch. 5.
dando lugar (tras la Primera Guerra Mundial 1914-18, y con el asentamiento del mass-marketing de la radio vía slogans, mascots, jingles y soap operas) a los «felices años veinte» y las flappers, sino que el punto de inflexión parece estar (tras la Gran Depresión 1929-39 y la Segunda Guerra Mundial 1939-45) en la consolidación de la televisión durante los 1950, dando lugar (en palabras de Debord 1967)
52
Enmarcable en la New Left de los 1960 (inspirada en la teoría crítica de la primera generación de la Escuela de Frankfort 1923, con hitos como Dialéctica de la Ilustración 1947) que criticaba estos avances y que es aplastada por las políticas neoliberales de Reagan y Thatcher en los 1980, cuando (quizá no casualmente) también se desarrolla la noción de hiperrealidad en Baudrillard (que en cierto modo amplia el diagnóstico de Debord).
a la sociedad del espectáculo.
53
También podría argumentarse que esta es la conclusión última de la cuarta fase, cuya tardanza se debe a los años de guerra y crisis, aunque creo que la producción en masa y el auge de los medios de comunicación de masas audiovisuales (tan íntimamente relacionados con la imagen y la profilicity) constituyen dos estadios muy distintos.

4.3 Descript

A propósito de Introducing Descript 10/2020 (YouTube), descubierto a través de Kat Blaque My AI Voice Reads Classic Copypastas 4/2022.

4.3.1 Contexto

Fundada en 2017, por lo que veo en New in Descript: Transcription in 23 languages! 3/2022 y Overdub 101: Ultra-Realistic Voice Cloning 8/2022, la función de doblaje (Lyrebird, originalmente basada en Tacotron 2 de 2018) aún no tiene soporte en castellano. (Dot CSV MI CLON ARTIFICIAL y el FUTURO de la (DES)INFORMACIÓN 2/2022 utiliza los avatares personalizados de synthesia.io, que no incluyen el clonado de voz, lo cual se delega justamente a Descript; el coste de servicio es de mil euros por año.)
El servicio de clonado de voz en español sí se ofrece en FakeYou (por 70$, con resultados discutibles, cf. Comepizza CLONÉ LA VOZ DE DIAZ CANEL PARA FAKEYOU.COM Y GENERO EL CAOS 9/2022), Aflorithmic Labs (empleado en culemania, de cuestionable calidad), Resemble, Lovo Studio (a 150$/mes,
54
Frente a los 24$/mes de Descript, aunque es probable que la diferencia esté justificada a nivel de calidad.
parece el mejor, aunque no he encontrado demos en castellano)... (más alternativas), además de estar disponible a través de soluciones libres como Coqui TTS, TorToiSe TTS... (más alternativas).
Sin embargo, estas alternativas son generalmente poco naturales, al menos en comparación con el estado del arte en la industria, con ejemplos como Respeecher (mostrando unas capacidades impresionantes en la demo Speaking, whispering and singing in many voices 4/2021, a un coste de 200$/mes, aunque no parece tener opción en español), DeepDub (doblando de inglés a español el largometraje Robi Michael Every Time I Die a 12/2021, link) o Flawless AI (con su famosa demo de TrueSync del 5/2021).
55
Otro ejemplo en esta línea, pero con una trampa que lo hace no escalable, se discute en Seymour The Neural Rendering of The Champion 4/2022 a propósito del doblaje de polaco a inglés (pendiente de estreno a finales de año) de la película de Maciej Barczewski por parte de Adapt Entertainment.
Sea como fuere, y en vistas al servicio de TTS de Azure y MetaAI Generating chit-chat including laughs, yawns, 'ums,' & other nonverbal cues from raw audio 3/2022, creo que las soluciones dirigidas al consumidor promedio tienen margen de mejora: cualquier servicio de TTS ha pasado por el clonado de alguna voz, así que la personalización a la voz propia no debería ser un problema si se consigue automatizar y simplificar lo suficiente su implementación.

4.3.2 Comentario

La idea que se presenta en Introducing Descript, aunque sencilla, me ha parecido muy bien pensada y publicitada, construyendo una vertical de negocio que no parece presente en la competencia a base de amalgamar toda una serie de tecnologías más o menos maduras. Obviamente que en entornos profesionales no va a volver obsoletos los re-shoots ni el oficio de edición, pero en un mundo crecientemente vídeo-céntrico
56
El televisor se comercializa desde 1926 (aunque el boom no llegaría hasta los 1950), las cámaras de vídeo portátiles desde 1983 (de mano, en vez de hombro, desde 1985; HD para equipos profesionales a 1984, y para el consumidor promedio a 2003), las webcams desde 1993 (siendo Microsoft NetMeeting 1996 la primera aplicación de vídeochat mainstream), los móviles con cámara desde 1999 (de vídeo desde 2007, y con resolución HD a 2010, cuando se alcanzan los 2700 millones de usuarios).
quizá sí podría facilitar su entrada a personas fuera del circuito (como las descritas en el vídeo, ya sea por cuestión de tiempo, habilidad, tesón...), creando así un mercado donde no lo había y catalizando aún más esa tendencia vídeo-céntrica, dando lugar a un círculo virtuoso.

Nadie sabe nada

Una de mis pretensiones con esta serie de ensayos (empezando por Reflexiones IA entorno a la inteligencia) es dar una visión más multidisciplinar de la habitual sin perder en ello profundidad. Pues, aunque estoy muy agradecido a Dot CSV (2017, Carlos Santana), Software 2.0 (2019, Andrés Torrubia), Explicable (2022, Miguel Ángel Román), Two Minute Papers (2015, Károly Zsolnai), Edan Meyer (2017), Yannic Kilcher (2017), Lex Fridman Podcast (2018), @_akhaliq (2019)...,
57
Además de los blogs y conferencias de las Big Tech, como OpenAI (12/2015), NVIDIA (12/2015), DeepMind (2/2016), Microsoft (2017), Google (2018), MetaAI (2019), Amazon, Tesla, IBM, Apple, stability.ai...
siento que estos canales, o bien carecen del enfoque más transversal que estoy tratando de empujar aquí, o bien, cuando amplían su mirada, pierden en ello rigor. Y para objetivar esta queja, rescato dos comentarios que la ponen de manifiesto, ligeramente adaptados y ampliados.

5.1 Filosofía

A propósito de Software 2.0 Filosofía Computacional - Santiago Sánchez-Migallón 2/2021.
Aunque el tema y los contenidos me parecen interesantes, la ejecución superficial de la discusión me irritó un poco, quizá justo porque son cuestiones sobre las que ya he pensado y repensado.
58
Por este tipo de aparente contradicción alguna vez me han tildado de falso, de no estar entendiendo o de ser incomprensible (lo que, como traté de expresar en el poema Descríbeme de Introspección 2020, resulta bastante alienante). Sin embargo, y parafraseando un argumento de DayoScript cuya fuente no encuentro (aunque también me valen sus comparaciones con Los Soprano, Breaking Bad y Parks and Recreation en GTA V: el culmen del ombliguismo [Análisis] 2022, o la comparación con Rocky en Now You See It How Napoleon Dynamite Broke The Algorithm), una película puede abordar alguno de los grandes temas de la humanidad y no por ello hacerle justicia, o dos obras tratar el mismo motivo (o trama, para el caso) desde sensibilidades muy distintas, como puede verse en Wikipedia Categoría:Películas por temática o decine21 Las mejores películas sobre la familia; e.g., Lin Fast & Furious 5 (2011) y Ozu Cuentos de Tokio (1953) a propósito de la familia. Para una ejemplificación más elaborada de esto, junto a una discusión más meta, cf., e.g., Zoe Bee Willy Wonka: Capitalism for Kids! y Jacob Geller Every Zelda is the Darkest Zelda.
Pongo dos ejemplos como muestra (aunque podría pararme en cada frase) para que se juzgue si hablo desde la arrogancia y el desconocimiento o no:
  1. Aunque no se cita explícitamente, para la primera pregunta Santiago sigue muy de cerca C. P. Snow The Two Cultures 1959, que ya fue acusado en su día de crear un problema donde no lo había.
    59
    De hecho, el propio Snow daría un recuento más moderado en The Two Cultures: A Second Look 1963. Para una discusión histórica más amplia sobre el debate, cf. Gould The Hedgehog, the Fox, and the Magister's Pox 2003.
    Para no extenderme demasiado al respecto, diré sólo dos cosas:
    1. La epistemología naturalizada, que considera a la filosofía como un saber de segundo orden supeditado a la ciencia (en la línea de la «higiene semántica» de Crick que cita Santiago),
      60
      Higiene semántica que en realidad no parecía preocupar mucho a Crick, a juzgar por la anécdota relatada al respecto en el obituario Ramachandran The astonishing Francis Crick 2004.
      es una de las principales corrientes contemporáneas, con representantes como Quine y Penelope Maddy (BAs en matemáticas a 1930 y 1972 respectivamente, PhDs de filosofía en teoría de conjuntos a 1932 y 1979), Gustavo Bueno, Ernesto Castro...
    2. Santiago hace un cherry picking de Dawkins y Sokal (del que simplifica mucho la historia, para mi gusto)
      61
      Una introducción accesible y matizada puede encontrarse en este hilo de Ayme Roman a propósito de Beller The Sokal Hoax: At Whom Are We Laughing? 1998, donde se discute como «Heisenberg, Born, Bohr, Niels, Pauli o Pascual Jordan hicieron de forma reiterada y sin complejos extrapolaciones entre su campo de estudio y el psicoanálisis o la teología, y entre fenómenos estrictamente físicos y fenómenos culturales, sociales, e incluso de tinte místico» (lo que me recuerda a su vez a Holton et al. How a scientific discovery is made: a case history 1996 a propósito de la relación mística del físico nobel Müller con la perovskita, lo que a su vez me recuerda a Brookhaven Lab Lost in Math: How Beauty Leads Physics Astray ft. Sabine Hossenfelder 2019), en contra, de nuevo, a lo que sugiere Snow; como sostiene el antifundacionalismo holista de Quine, Rorty, Deleuze, Guattari..., ninguna disciplina humana se desarrolla aislada de las demás.
      Sea como fuere, en la raíz del escándalo se insinúa más bien un sistema editorial de revisión por pares bastante frágil, como se pone de manifiesto en Sabine Hossenfelder The Best Science Hoaxes, Spoofs, and Nerd Jokes (500k subs celebration) 2022, que me recuerda al experimento de Rosenhan (On being sane in insane places 1973, aunque aquí el problema es más bien metodológico) o, en las artes (donde la cuestión es más bien ontológica), a la novela Atlanta Nights (2004, contra la vanity press), el poemario de Ern Malley (1944, contra el modernismo surrealista de Angry Penguins, que seguía la estela de Yeats, Eliot y Auden), la vanguardia pictórica del disumbrationism (Paul Jordan-Smith, 1924-7), etc.; que tire la primera piedra quién esté libre de pecado. (En Apología al nonsense (o de la imposibilidad del lenguaje) 2011, que necesitaría de una buena reescritura, me expando más sobre el tema).
      con el fin de ejemplificar la división, así que voy a hacer lo mismo: Kant tiene trabajos en mecánica, geografía física y cosmología (siendo el primero en proponer la hipótesis nebular, dar una fecha geológica para la Tierra, etc., como no podía ser de otro modo en el máximo exponente de la ilustración), Husserl (padre de la fenomenología, una de las dos corrientes filosóficas más importantes de la primera mitad del XX) fue matemático antes que filósofo, y toda la tradición analítica y pragmática (la otra gran corriente del XX) está repleta de perfiles STEM (Peirce, Frege, Russell, Wittgenstein, Quine, Duhem, Kuhn, Lakatos, Putnam... y sólo estoy citando algunos de los autores por los que cualquiera que se gradúe en filosofía tiene que pasar),
      62
      Para una discusión más amplia, me remito a mi adenda ¿Stephen Hawking es filósofo? de mi Lonergan y Zambrano: un falso lazo 2021.
      sin olvidar proyectos tan esotéricos (en tanto que combinan ambas tradiciones) como Lawvere Some Thoughts on the Future of Category Theory 1991 y passim a propósito de Hegel Science of Logic 1813 (discutido en nLab).
      63
      Lo suyo sería determinar estadísticamente si realmente hay dos culturas, pero yo creo que es más habitual que la gente no sepa ni de ciencias ni de letras que qué sepa de ninguna de las dos. Y aquí necesito aclarar que uno puede pasar por una carrera de cualquiera de las dos y no adquirir la madurez asociada, sino sólo sus herramientas, o sólo saber de su especialidad.
  2. Para no extenderme más, diré simplemente que me sorprendió mucho la cautela ante el término «emergencia»,
    64
    Me sorprendió sobretodo porque Santiago critica los paralelismos entre neuronas biológicas y artificiales desde la irreducibilidad de la química, y normalmente esa clase de críticas se amparan precisamente en la emergencia, como ejemplifica el físico nobel de 1979 P. W. Anderson en su clásico More is different 1972, que justo discute la irreducibilidad de la química a la física con un caso de estudio (hecho descrito en QuantumFracture Los Físicos NO Entienden el Vacío como «independencia de fenómenos»). Como se elabora en la entrevista de Juan José Gómez Cadenas a Pedro Echenique para JotDown 2016:
    «Soy reduccionista, como creo que somos todos los científicos, en el sentido de creer que el funcionamiento de la materia, de toda la materia, animada e inanimada, está controlado por un conjunto de leyes fundamentales, leyes que, excepto en condiciones extremas, conocemos bien. Es un reduccionismo fenomenológico pero no un reduccionismo epistemológico. Lo que quiero decir es que creo, con Anderson, que la hipótesis reduccionista no implica, frente a lo que creía Einstein, una hipótesis construccionista [sic: constructivista]. La habilidad para reducir todo a leyes fundamentales no conlleva la capacidad de empezar de dichas leyes y reconstruir el universo como mera deducción. El todo es más que la suma de las partes. Cuando hay billones de partículas en interacción formando un sistema complejo aparecen nuevos tipos de «leyes». La rigidez de una piedra no tiene equivalente a escala atómica. Los organismos tienen propiedades que no tienen ni siquiera significado en células. La química es mucho más que física aplicada. Se puede reducir la química a la física, pero a costa de perder casi todo lo interesante de la química. En palabras de Anderson, hay muchos más niveles, hay más distancia cognitiva del ADN a la ética que del ADN a las partículas elementales. A lo largo de este siglo hemos aprendido que el conocimiento se estructura en niveles, con sus propias leyes, consistentes con el nivel anterior pero no deducibles de él. Reduccionismo y emergencia son complementarios, no deben enfrentarse. Hace falta un reduccionismo con emergencia.»
    aunque reconozco que en los medios se ha abusado del término hasta extenuarlo en un mero buzzword. Y si bien Torrubia cita a Conway (1970), yo creo que son más ilustrativos el algoritmo Boids (1986, Reynolds) o Mirollo y Strogatz Synchronization of Pulse-Coupled Biological Oscillators 1990
    65
    Para un estado del arte de este problema en específico, cf. Ramérez-Avila et al. Fireflies: a Paradigm in Synchronization 2017, y para una implementación interactiva y gráfica, ncase.me/fireflies.
    ¿Más ejemplos? «the pacemaker cells of the heart; networks of neurons in the circadian pacemaker and hippocampus; the insulin-secreting cells of the pancreas; crickets that chirp in unison; and groups of women whose menstrual periods become mutually synchronized...» Y en física, el modelo Kuramoto (Self-entrainment of a population of coupled non-linear oscillators 1975).
    Para un estado del arte de la disciplina, que se inicia con Winfree Biological rhythms and the behavior of populations of coupled oscillators 1967, cf. Strogatz Sync: The Emerging Science of Spontaneous Order 2003, y para una introducción divulgativa, Veritasium The Surprising Secret of Synchronization 2021.
    , que modelizan bien distintas realidades etológicas, o la teoría de la evolución biologica, discutida con gran elocuencia por Jon Perry
    66
    Cf., e.g., Jon Perry - Genetics & Evolution Stated Casually Origin of the Genetic Code: What we do and do not know y When Belief Dies Evolution and Theistic Misunderstandings with Jon Perry (donde, a propósito de Thomas Nagel What Is it Like to Be a Bat? 1974, reconoce las limitaciones actuales de la teoría para dar una explicación material satisfactoria a la aparición de la consciencia).
    . (Para más ejemplos, me remito a Wikipedia Emergence 4. Emergent structures in nature.)
PS. Aunque Nick Bostrom es un filósofo popular en la temática IA, Vincent C. Müller (editor de Philosophy and Theory of Artificial Intelligence 2012, 2017 y 2021, Fundamental Issues of Artificial Intelligence 2016, Oxford handbook of the philosophy of artificial intelligence 2022) parece ser la referencia en el campo, junto a los clásicos en filosofía de la mente (Searle, Fodor, Chalmers...).

5.2 Derecho de autor

A propósito de la discusión que hace Explicable IA Generativa, Sesgos y Armas Químicas 4/2022 de Rosati US Copyright Office refuses to register AI-generated work, finding that "human authorship is a prerequisite to copyright protection" 2/2022.
Aunque no tengo formación en Derecho, me gustaría hacer una serie de matizaciones sobre la primera noticia:
  1. Lo que se ha rechazado (tras la apelación a un primer rechazo a 2019, siendo la obra de 2016, cf. Artificial Intelligence – Visions (Art) of a Dying Synthetic Brain, urbasm) es el registro a nombre de la IA, no el registro en sí, como se explica en la fuente que citáis: «Registration was sought as a work-for-hire to the owner of the Creativity Machine.». En artificialinventor.com se expande sobre ello: «We are not advocating for an AI to own its own patents. We are advocating for the AI's owner to own patents on any AI-generated inventions. AI does not have legal personality and cannot own property». Así, la idea tras Artificial Inventor sería que al vender dicha IA a otra compañía se traspasarían también sus patentes asociadas, y la idea tras la resolución de la oficina de patentes (basada en unas directrices de 1966, como se nota en vuestra fuente) sería evitar las complicaciones legales de responsabilidad jurídica, cf. Leo Kelion AI system 'should be recognised as inventor' (BBC, 2019), donde se cita al abogado Ryan Abbott (doctorado en leyes con la tesis The Reasonable Robot: Artificial Intelligence and the Law 2020, autor también de I Think, Therefore I Invent 2016).
    67
    Como comenta Rosati, esto no es algo exclusivo de USA: «In the case of a literary, dramatic, musical or artistic work which is computer-generated, the author shall be taken to be the person by whom the arrangements necessary for the creation of the work are undertaken.» (UK Copyright)
    Aun más interesante: «Article 4(1) of the Database Directive admits the possibility that the author of a database can be, not just the natural person or group of natural persons who created the base, but also—where the legislation of the Member States so permits—the legal person designated as the rightholder by that legislation.»
    1. Hasta donde he podido ver, este caso concreto es particularmente complejo, pues Thaler (PhD en físicas a 1981), el autor de esta IA, es, por una parte, poco transparente en cuanto a sus métodos, y por otra, un tanto exagerado en cuanto a sus resultados. De hecho, en un par de entradas de 2019 (The first AI inventor - IPKat searches for the facts behind the hype y EPO refuses "AI inventor" applications in short order - AI Inventor team intend to appeal) Rosati ya insinuaba que Thaler pudiera ser un poco vende humos: aunque en artificialinventor.com declaran que «Ironically, the authorities accept that Dabus devised the inventions and that the inventions, per se, are patentable. The problem is Dabus (Device for the autonomous bootstrapping of unified Sentience) isn’t a ‘natural person’», lo cierto es que la EPO contestó a esa afirmación para al menos una de sus patentes notando sus similitudes con otra anterior: US 5803301 (1998).
    2. El arte generativo en general (que según Wikipedia se remonta al menos hasta 1965, con Georg Nees y Frieder Nake) creo que es un buen ejemplo de que no hay ningún problema en aplicar copyright a algo generado con IA (siempre y cuando sea lo suficiente distintivo y original), y que la resolución que estamos discutiendo responde únicamente a la negativa de la oficina de patentes a admitir como propietaria de la patente a la propia IA.
  2. La resolución no sienta precedente. De hecho, ya existe una patente a nombre de dicha IA en un tratado internacional: Patent Cooperation Treaty WO 2020/079499 A1. Irónicamente, la misma que la EPO rechazaba por falta de originalidad: el Derecho es un mundo extraño, así que no voy a fingir que lo entiendo.
  3. En el citado artículo del 5/2016 de urbasm no se detalla demasiado como se han generado dichas imágenes, pero mi impresión es que han entrenado un autoencoder con una librería de imágenes, han hecho una poda neuronal de la red, y han decodificado puntos aleatorios del espacio latente. Más que pinturas al óleo, yo diría que son fotografías distorsionadas.
    68
    Baso mi afirmación en la trayectoria de Thaler investigando simulaciones de Near-Death Experiences (NDE), cf. 5.2.1.
  4. Insisto en que mi formación no es en Derecho, pero dudo que este debate (en sentido amplio) se vaya a cerrar nunca. De hecho, es uno recurrente incluso en el ámbito del arte humano. E.g., en la industria musical me vienen a la mente dos casos recientes de acusación de plagio: Adam Neely Did Dua Lipa ACTUALLY Plagiarize Levitating? 3/2022
    69
    Pendiente de resolución por la jueza Katherine Polk Failla, cf. Dillon Dua Lipa Lawyer Blasts ‘Levitating’ Copyright Lawsuit: ‘Must be Dismissed’ 8/2022.
    y Did Olivia Rodrigo steal from Paramore? (analysis) 8/2021
    70
    Como se discute en Aswad Olivia Rodrigo Adds Paramore to Songwriting Credits on ‘Good 4 U’ 8/2021, Olivia terminó dando crédito retroactivamente a Hayley Williams y Josh Farro por Good 4 U y a Taylor Swift, Jack Antonoff y Annie Clark por una interpolación en Déjà vu, dividiendo sus derechos de regalías a medias. Otros casos de resolución similar son Sam Smith Stay With Me 2014 (cediendo en 2015 el 12.5% del crédito por Petty I Won't Back Down 1989) o Mark Ronson y Bruno Mars Uptown Funk 2014 (por Oops Up Side Your Head 1979 en 2015 y Young Girls 1983 en 2016). En cuanto a su dual, menos habitual, me remito a Aviles Led Zeppelin wins 'Stairway to Heaven' copyright dispute 2020 (a juicio desde 2014) y Maddaus Katy Perry Wins Reversal of ‘Dark Horse’ Copyright Verdict 2020. Para más ejemplos, cf. Wikipedia List of songs subject to plagiarism disputes.
    , que se podrían enmarcar en Kirby Ferguson Everything is a Remix 2014,
    71
    Todo lo cual me recuerda a los muchos absurdos de las leyes de propiedad intelectual; cf., e.g., Sergio Parra Una visión científica de los derechos de autor 2010, CGP Grey Copyright: Forever Less One Day 2011, Crash Course Intellectual Property 2015, Turkey Tom YouTube's Fight For Fair Use 2022 (describiendo el clima de la plataforma, motivado por Viacom v. YouTube 2007-3/2014, entre Youtube Copyright Disaster! Angry Rant 12/2013 y Where's The Fair Use? - Nostalgia Critic 2/2016, incluyendo una discusión del fiasco React World 2/2016), Zoe Bee How I Became a Minecraft Scam Artist 2022... (Absurdos que me llevaron en 2012 a escribir ¡Plágiame!)
    así como extenderse a los fenómenos de la criptomnesia,
    72
    Tipo de sesgo de memoria (que es a su vez un subtipo de sesgo cognitivo) de atribución errónea, por el cual un recuerdo es confundido con un pensamiento novedoso. El término se acuña por el medium Moses en 1874, y empieza a estudiarse en psiquiatría con Flournoy From India to the Planet Mars: A Case of Multiple Personality with Imaginary Languages 1901 y Jung On the Psychology and Pathology of So-Called Occult Phenomena 1902 (su tesis doctoral), dedicándole Jung un monográfico en 1905. El primer estudio empírico se da con Brown y Murphy Cryptomnesia: Delineating inadvertent plagiarism 1989, y el primer uso como alegato legal contra una acusación de plagio (siendo rechazado, y sentando precedente) con Bright Tunes Music v. Harrisongs Music 1976. Para más detalles y ejemplos, cf. Wikipedia Cryptomnesia.
    el fanfic,
    73
    Cf., e.g., verilybitchie Taking Back Harry Potter.
    el apropiacionismo cultural
    74
    Cf. PBS Origins What is Cultural Appropriation? 2019 (YouTube), Anna Akana When your friend is kinda racist 2021 (YouTube) citando Amandla Stenberg: Don't Cash Crop On My Cornrows 2015 (YouTube) y Annie Nova Blackfishing is NOT blackface but it's still problematic 2018 (YouTube), Salem Tovar The 'GRANDE' Problem With Ariana | An Analysis 2022 (YouTube) y The Dark Side of Wellness Culture | An In-Depth Analysis (YouTube), Tee Noir What's the Real Problem Here? Blackfishing? or Black Women's Jealousy? 2021 (YouTube), Sensei Aishitemasu On Bruno Mars 2016 (YouTube), Madisyn Brown why do black people love paramore? (+the history of rock n roll) 2022 (YouTube, a partir 4:17, trazando sus raíces en los race records, 1920-49, y Sister Rosetta Tharpe, con hits como Rock me 1938 o Strange Things Happening Every Day 1944), Broey Deschanel Elvis (2022) and the Utter Mediocrity of Biopics 2022 (YouTube, 25:00-33:47), Mina Le in defense of the boy band 2022 (YouTube, 8:07-10:22), Sideways Why "Spoken Word" Makes me Nervous 2018 (YouTube), James Somerton Disney's Gay Cultural Appropriation 2021 (YouTube), Kirby Ferguson The Rise and Fall of Cultural Appropriation 2022 (YouTube), DayoScript El videojuego como producto cultural [Opinión] 2015 (YouTube)...
    ...
    75
    Estoy pensando en los conceptos situacionistas de acción político-artística de détournement y recuperación, en la resignificación lingüística de insultos (y símbolos en general) en comunidades oprimidas (cf. Wikipedia Reappropriation), en la intertextualidad de homenajes, referencias, guiños, sátiras..., etc.
    A donde quiero llegar con todo esto, para no entrar a discutir cosas que sospecho pero ignoro (e.g., ¿no es la licencia de Photoshop una cesión de los derechos de explotación comercial de la herramienta?), es a que probablemente los claims de infracción de copyright (que es un problema equivalente a las negativas de admisión de copyright que enfrenta DABUS) se van a discutir siempre caso por caso (independientemente de si su origen es humano o máquina), y se van a limitar a dirigirse a obras famosas y/o exitosas para beber de su capital social y/o económico. No en balde, y hasta donde yo sé, todo este hostil ecosistema de continuas denuncias por plagio no ha hecho que se aumente la precaución a la hora de conceder derechos de copyright (como creo que constatan las cesiones retroactivas de crédito), por lo que dudo que ocurra ahora con la IA (si bien podríamos estar ante un trueque de cantidad en calidad).
    1. Tema aparte y más interesante es si la IA podría utilizarse en el proceso de registro de copyright para determinar si una obra es lo suficiente transformativa como para entrar en el registro a base de identificar similitudes con todo lo previamente registrado, que idealmente contendría la totalidad del canon humano.
      76
      Sin menospreciar el problema de los sesgos y la falta de explicabilidad (que creo que ejemplifica bien el sistema de content ID de YouTube antes criticado), diría que la verdadera dificultad de la propuesta consiste más bien en conseguir, almacenar y mantener semejante catálogo. No en balde, Shazam (Wang, 1999) y BMAT (Emilia Gómez, 2006) ya hacen la parte de identificación (BMAT desde 2012 con un modelo de negocio similar a Blinkfire Analytics 2004, cf. MTF Labs Òscar Paytuví, BMAT @ The Music Tech Fest 2012).
      Por supuesto, lo que aquí estoy pidiendo es un tanto más complejo que eso, pues no se trata simplemente de dar matchs exactos, sino puntos cercanos de algún espacio latente que represente adecuadamente nuestra idea de transformativo: si fuera tan fácil, la profesión de curador, bibliotecario, etc. ya habría desaparecido, en lugar de dar pie a las ciencias de la documentación (International Institute of Bibliography 1895) y la información (Vannevar Bush As We May Think 1945, A. I. Mikhailov Fundamentals of Scientific Information 1965). En efecto, el problema de la búsqueda y recuperación de información es de todo menos trivial, como refleja que Google haya llegado hasta LaMDA para solucionarlo, lo que no quita que esta sólo sea una de las patas de las ciencias de la información. De hecho, un sistema con semejantes capacidades probablemente sería más interesante para profundizar sobre un tema que como herramienta antiplagio.
      Esto no sólo se adelantaría a las posibles reclamaciones de plagio, sino que podría constituir en sí mismo un arbitro de tales denuncias, evitando los absurdos antes comentados.
  5. Sobre el uso de datos con derechos de autor, la United States 2nd Circuit Court ya se pronunció en 2015 (en un contexto algo distinto, pero que probablemente siga aplicando): es fair use, cf. Stewart The Most Important Court Decision For Data Science and Machine Learning 2019 (link). Para una discusión en otras partes del mundo, cf. Kublik EU/US Copyright Law and Implications on ML Training Data 2020 (link) y Park Copyright Issues for AI and Deep Learning Services: A Comparison of U.S., South Korean, and Japanese Law 2021 (link). Parece que la tendencia es bastante permisiva.

5.2.1 Algunas anotaciones sobre Thaler

Thaler funda Imagination Engines Incorporated (IEI) en 1995 (originalmente conocida como Dendrite Neurocomputing), siendo su primera experimentación con redes neuronales a 12/1988:
«Thaler teaches a large multilayer perceptron several popular Christmas carols
77
Técnicamente esto no llega ni a autoencoder, pues no hay una reducción de la dimensionalidad en las capas ocultas tratando de capturar lo esencial de los datos, pero creo que es útil referirse a la red como tal en la medida en la que su objetivo parece ser la de reconstruir el dato de entrada.
A modo de referencia, es entorno a 1987 que dicha arquitectura se consolida, cf. MiniQuark What is the origin of the autoencoder neural networks? 2016. De hecho, aunque el perceptrón mono-capa se introduce en Rosenblatt 1957 (discutiéndose sus limitaciones en Minsky y Papert 1969), no es hasta la popularización del algoritmo de retropropagación a mediados de los 1980 (e.g., con Rumelhart 1986, cf. Schmidhuber 2014) que se hace viable el entrenamiento del perceptrón multi-capa (aka feedforward ANN), y quizá de ahí la reedición de Minsky y Papert en 1987.
En cuanto a sus resultados, creo que habría que verlos a la luz de Frankle y Carbin The Lottery Ticket Hypothesis: Finding Sparse, Trainable Neural Networks 2018.
and then proceeds to destroy it through simulated neuron death [aka pruning]
78
Según Blalock What is the State of Neural Network Pruning? 2020, aunque la técnica se puso de moda en los 2010, sus inicios se remontan a finales de los 1980 (e.g., con Janowsky 1989). En este sentido, y aunque la intencionalidad de Thaler era meramente recreativa, no le quito el mérito de llegar a la técnica por su propia cuenta.
. During such near-death simulations, with all meaningful inputs denied the net, the perceptron's outputs are dominated not by nonsense, but meaningful new lyrics such as "in the end all men go to good earth in an eternal silent night."» (IEI History, link)
79
Allí se afirma además que en 1995 registró 11 mil canciones generadas con un método semejante, aunque a la única música suya a la que he podido acceder es a Song of the Neurons 2007 (apple music), que, si bien es bastante genérica, no deja de tener cierto mérito.
Thaler comienza a ganar notoriedad pública en el mundillo con el reportaje Philip Yam "Daisy, Daisy" Do computers have near-death experiences? 5/1993 (Scientific American, zlibrary),
80
Otros reportajes de la época, que encuentro fascinantes como cápsulas de tiempo (poniendo en perspectiva el boom actual), son: Holmes The creativity machine 1/1996 (NewScientist) y Noorderlicht Creative Computers 4/1996 (archive, con entrevistas en inglés). Ya más posterior es Hesman The machine that invents 1/2004 (Post) y In Its Image 2006 (documentarystorm), que he sido incapaz de ver del cringe que me ha dado.
del que IEI destaca:
«Thaler's nets had no applied inputs. The networks were hallucinating (or alternately, ideating) things that simply weren't there. In addition to offering a reductionist model of near-death experience, the simulation hinted at the generative aspects of internally damaged neural nets, simulated or biological.»
81
Mi lectura del artículo es bastante distinta, reforzando mi sentimiento de Thaler como vende humos. Sí, Yam afirma que «the near-death experiences commonly reported might have a mathematical basis» y «The net sometimes generated what Thaler terms «whimsical» states, that is, values that neither were trained into the net nor would appear in a healthy net», pero yo no veo que se discuta esto como método generativo (en el sentido de, e.g., una GAN, introducidas en Goodfellow 2014) ni la cuestión del no-input en inferencia (de nuevo, como una GAN, en la que técnicamente se toma como input ruido aleatorio), que no durante el entrenamiento.
Y aunque le concediéramos que su sistema presenta estas propiedades (se discutan o no), ello no se distanciaría mucho de corromper un fichero digital perturbando bits aleatorios de su codificación: lo revolucionario de las GAN (o los modelos de difusión) no son esas características, ni siquiera el poder dirigir o condicionar el resultado hacia un cierto target dado por el conjunto de datos de entrenamiento (lo que técnicamente también hace Thaler), sino el hacerlo de manera efectiva, habiendo extraído las características esenciales de dichos datos; algo que una simple FNN no parece lograr, a pesar de lo cual no le quito mérito al intento de Thaler con su «Creativity Machine Paradigm».
Pese a todo, y siendo justos, estas críticas son tenidas en cuenta en su patente del 10/1994, donde: 1) en vez de podarse la red, se perturban sus pesos, sesgos, activaciones, entradas y valores internos, y 2) se usa una segunda red (la alert associative center, AAC) para seleccionar los resultados provechosos de la primera (la imagination engine, IE) y modificar su arquitectura (en su llamado «mode C»), empezándose a parecer un poco más a una GAN. Sin embargo, la red AAC que puntúa la utilidad de los resultados de la red IE se entrena de manera separada (en el sentido de que IE no tiene influencia sobre ella) y global (i.e., sobre un conjunto de datos representando los resultados finales que queremos obtener con la IE etiquetados con una puntuación, pues sería difícil etiquetar pasos intermedios de la generación de la IE), por lo que difícilmente sus modificaciones locales de la red IE vayan a converger en algo realmente provechoso; todo lo cual viene a poner en valor la astucia y sofisticación de la arquitectura GAN, sin quitarle por ello mérito a Thaler. (Su patente del 1/1996 sofistica su propuesta introduciendo una tercera red, pero tras ojear su texto me voy a abstener de discutirlo al no tener la impresión de que se trate de ningún avance en una dirección adecuada.)
Y a nivel académico y empresarial, con los papers y patentes:
  1. "Virtual Input" Phenomena Within the Death of a Simple Pattern Associator 1995 (recibido a 9/1993, sci-hub).
    82
    Para un listado de artículos, que se concentran entre 1996 y 1998, cf. IEI.
  2. Autonomous Ultrahard Materials Discovery via Spreadsheet-Implemented Neural Network Cascades 1997 (tms).
    83
    Otro ejemplo en la misma línea es The Warhead Design Creativity Machine 12/2001 (WSTIAC).
  3. Device for the Autonomous Generation of Useful Information 1997 (patente US5 659 666, presentada a 10/1994 y discutida en MSN News).
  4. Non-Algorithmically implemented artificial neural networks and components thereof 1998 (aka STANNO: Self-Training Artificial Neural Network Object, patente US5 845 271, presentada a 1/1996)

Ambulance chasing is good, actually?

Basado en una conversación con Torrubia, a quién agradezco sus críticas.
Como ya discutí anteriormente, Google ha sido demandado por (y declarado culpable de) difamación en varias ocasiones,
84
Ejemplo: Stefan Niggemeier Autocompleting Bettina Wulff: Can a Google Function Be Libelous? 2012.
lo que podría motivar una búsqueda activa de tales infracciones (dadas por los habituales sesgos de la IA) con el mero fin de hacer caja, siguiendo la filosofía del «ambulance chasing».
85
La expresión suele usarse para referirse a las denuncias de Personal Injury, si bien los correspondientes especialistas han atacado la expresión arguyendo que se trata de un mito perpetuado por las aseguradoras para su propio beneficio.
Y en efecto, Confronting the rise in ADA website accessibility lawsuits against businesses 2021 (mobar) parece insinuar dicha vía de acción.
Sin embargo, yo no haría una lectura tan frívola de la situación. Recordando la experiencia de una estudiante de leyes ciega y sordomuda que recurre a la denuncia como última opción,
86
Why I work to remove access barriers for students with disabilities | Haben Girma | TEDxBaltimore (YouTube)
creo que la automatización de estas reclamaciones puede acelerar la transición a un mundo más accesible evitando por el camino las ansiedades y traumas asociados para quienes llevan a cabo el proceso manual.
De hecho, ello no me parece muy distinto al hacking ético (aka de sombrero blanco) o a los cheques de Knuth por encontrar errores en sus publicaciones: teniendo en cuenta que el problema de los sesgos (cognitivos, metrológicos, de IA...) es precisamente que no somos conscientes de ellos, yo creo que cualquier reporte es de agradecer, aunque supongo que aquí hablo más desde la mentalidad de desarrollador y usuario que no de empresario.
Sea como fuere, reconozco que es problemático que dicho reporte se haga con la hostilidad de una denuncia, exigiendo unos plazos y directrices para el bugfix que pueden no ser razonables (la burocracia y la realidad van a ritmos distintos, por lo que es habitual que las leyes se queden obsoletas), además de venir con una factura bajo el brazo (a pesar de que el beneficio del bugfix es mutuo), sin entrar en el debate de ley vs moral
87
«Under a government which imprisons any unjustly, the true place for a just man is also a prison... the only house in a slave State in which a free man can abide with honor.» Thoreau Civil Disobedience 1849.
.
Por otra parte, la automatización con IA de sesgos de IA caería a su vez en sesgos, haciéndolo aún más problemático. Más en concreto, mientras que el proceso manual (de rellenar y enviar formularios, comprobar infracciones...) establece una fricción (económica, mental...) suficiente como para sólo llevar adelante casos muy claros y sangrantes, su automatización reduce el coste del fallo hasta tal punto que se puede abusar del sistema legal inundándolo de denuncias potencialmente ilegítimas, como se describe en Turkey Tom YouTube's Fight For Fair Use 2022. Así, la escalabilidad posibilitada por la automatización (ayudada en parte por la IA) daría lugar a un trueque de cantidad en calidad (aka cambio de régimen o estado) que cambiaría las reglas del juego, perdiendo el equilibrio y simetría entre sus participantes. (Una posible medida de mercado para solucionar esto sería aumentar el coste del fallo a base de cobrarle al litigador sus errores, promoviendo así algoritmos con mayor especificidad en vez de mayor sensibilidad con tal de evitar el gatillo fácil.)
88
Otro ejemplo muy gráfico de lo problemático de este desequilibrio se da en The Royal Institution Why does human intelligence beat AI? – with Gerd Gigerenzer (YouTube, min. 34-38) respecto de Projekt zur Gesichtserkennung erfolgreich 2018.

Comentarios

Entradas populares de este blog

¿Por qué ya no nos vemos?

Apuntes matemáticas (UB)

Hoy el mar está imposible…