Reflexiones IA: límites y oportunidades
1 On PaLM's dataset size, and Gato's hope
Reojeando el paper de PaLM
1
en relación a ChinchillaPaLM: Scaling Language Modeling with Pathways 5/4/2022
2
por los resultados de FlamingoTraining Compute-Optimal Large Language Models 29/3/2022
3
, me ha sorprendido lo siguiente: «Although there is a large amount of very high-quality textual data available on the web, there is not an infinite amount. For the corpus mixing proportions chosen for PaLM, data begins to repeat in some of our subcorpora after 780B tokens, which is why we chose that as the endpoint of training. It is unclear how the “value” of repeated data compares to unseen data for large-scale language model training.» A modo de referencia, Chinchilla tiene 1.4T tokens y 70B parámetros,Flamingo: a Visual Language Model for Few-Shot Learning 29/4/2022
4
frente a los 0.78T tokens y 540B parámetros de PaLM: «Chinchilla moderately outperforms PaLM’s interpolated scaling curve on BIG-bench, and slightly underperforms the scaling curve on the 9 English NLP tasks.»T de trillion (trillón americano), , B de billion, .
Esto me deja pensando si, aunque la hipótesis de escalabilidad fuera cierta,
5
lo que nos va a limitar no es la capacidad de cómputo, sino el tamaño de los datasets: Google estimó en 2010 que hay 130 millones de libros distintos en el mundoCf. Gwern The Scaling Hypothesis 5/2020 a propósito de GPT-3.
6
y Google Books llegó a los 40 millones a 10/2019Leonid Taycher Books of the world, stand up and be counted! All 129,864,880 of you. 8/2010. Nótese que el conteo incluye reediciones, por lo que hay cierto grado indeterminado de solape aun sin considerar la intertextualidad inherente al corpus, objetivada, e.g., en la repetición de citas textuales y tropos, la reexposición de un mismo hecho histórico, científico... (incluso dentro de una misma escuela de pensamiento, nivel de tecnicismo y profundidad...), etc.
7
, mientras que yo he estimado burdamente que los 780B tokens equivalen a 6.5 millones.Haimin Lee 15 years of Google Books 10/2019. A modo de referencia, Project Gutenberg (1971) contiene 60 mil libros, Internet Archive (1996) contiene 35 millones de textos, Open Library (2006) contiene 2 millones de libros y Z-Library (2009) contiene 11 millones.
En cuanto a bibliotecas físicas, la British Library (1973, antiguamente contenida en el British Museum, 1753, fundado con los dos mil manuscritos de la Old Royal Library, iniciada por Edward IV 1442-1483, los mil de la Cotton Library, 1571–1631, los 7 600 de la Harley Library, 1661-1724, y los 47 mil de la Sloane Library, 1660-1753, ampliándose con los 65 mil volúmenes de la King's Library, 1762-1820, y el derecho a una copia de cada libro publicado en el país desde 1823) y la Library of Congress (1800, desde cero, aunque Jefferson contribuye con 6 500 ejemplares a 1815, adquiriendo de facto la categoría de librería nacional con Spofford 1865–1897, alcanzando los 840 mil volúmenes) contienen más de 170 millones, siendo el tercer lugar para Shanghai (1847, 56 millones), cf. Wikipedia List of largest libraries.
Y en cuanto a la escala temporal, la primera gran biblioteca universal y sistemática (salvando quizá los hitita Archive-Library Systems of Boğazköy, 1900-1190 aC, de 25 mil tabletas, cf. Karasu Cem 1996) puede trazarse hasta el palacio de Nínive, capital del imperio neo-asirio del 705 al 612 aC y posible origen (según Stephanie Dalley) de una de las siete maravillas del mundo antiguo (Los Jardines Colgantes de Babilonia), bajo el reinado de Ashurbanipal (669-631 aC), siendo quizá mantenida (o recuperada) durante el reinado de Nabucodonosor II (605-562) del imperio neo-babilónico, llegando en su pico a las 100 mil tabletas (principalmente en acadio, la lengua oficial, pero también en sumerio, lengua de cultura del 2500 al 100 aC), de las cuales se conservan 30 mil. La segunda sería la Biblioteca de Alejandría, que pudo llegar a contener 400 mil rollos, y que constituyó el centro intelectual por excelencia del 285 al 145 aC (purga de Ptolomeo VIII), decreciendo con el incendio de J. Cesár del 48 aC (del que se repone absorbiendo parte de la Biblioteca de Pérgamo, su competencia directa junto a Antioch 221 aC-363 dC y Celsus 135 dC-262 dC) y desapareciendo con el cese de financiación, asedios y terremotos de los siglos II y III (para algunas notas sobre su importancia editorial, véase mi Overview histórico de la filosofía clásica). Estas bibliotecas no serían rivalizadas hasta la Biblioteca Imperial de Constantinopla (337-473, 100 mil volúmenes) y el hospital universitario de Gundeshapur (fl. 531-579, con Khosrau I, estimándose 400 mil títulos), cf. Wikipedia List of libraries in the ancient world, cuyo legado sería continuado por la Casa de la Sabiduría (fl. 813-847, de la que Nasir al-Din al-Tusi rescataría del asedio mongol de 1258 unos 400 mil manuscritos al observatorio de Maragheh, que terminaría corriendo la misma suerte) y, a su vez, por el alcázar de Qurtubah (aka Córdoba, fl. 915-976, con Al-Hakam II, alcanzando los 500 mil ejemplares) y, tras este, la Escuela de Traductores de Toledo (bajo Raimundo de Toledo 1126 y Alfonso X el Sabio 1252) y la madrasa Al-Qarawiyyin (859, 32 mil volúmenes a 1613, fl. XIII-XIV), que es, junto al monasterio de Santa Catalina del Monte Sinaí (565, 3 300 manuscritos), la biblioteca más antigua aún activa, siendo Villa dei Papiri (c. 79 dC, 2 mil rollos) la más antigua conservada íntegramente.
8
Si ya estamos manejando corpus de estas escalas, y recordando La biblioteca de Babel de Borges, avg words per book (aunque hay cierta variabilidad entre géneros, el orden de magnitud, descontando extremos, parece consistente)
tokens
avg words per token (estima para el encoder de GPT-3 para textos en inglés, con un rango de a , cf. Piotr Grudzień GPT-3 tokens explained - what they are and how they work)
libros
9
yo me empiezo a preguntar si no estaremos cerca de copar el número combinatorio de textos humanos significativamente diferentes entre sí de una cierta longitud (pues la atención de los Transformers tampoco es infinita)El jardín de senderos que se bifurcan 1941.
10
. Quiero decir, aún queda mucho margen para crecer (hay mucho texto que no se publica en libros, y mucho texto por publicar o sintetizable), pero ese comentario en PaLM me ha hecho pensar que: 1) los avances en LM pueden empezar a ralentizarse si no hay algún cambio de paradigma, 2) el cuello de botella puede no estar en el cómputo y el número de parámetros sino en el tamaño del conjunto de entrenamiento, y 3) los transformers puede que no sean una arquitectura de aprendizaje lo suficiente eficiente como para seguir creciendo los logros obtenidos.Como elaboro en 1.1, mi comparación con Babel es un tanto equívoca, aunque creo que la preocupación sigue siendo legítima.
11
De ahí quizá, en vistas a este posible próximo estancamiento, el auge de investigaciones interdisciplinares y exploratorias como MetaAI Studying the brain to build AI that processes language as people do 4/2022 o DeepMind In conversation with Artificial Intelligence: aligning language models with human values 9/2022, que buscan inspiración en la neurociencia y la lingüística pragmática respectivamente, así como la retirada al refugio del corwdsourcing en OpenAI Training language models to follow instructions with human feedback 3/2022.
No en balde, y ojeando el Logbook de OPT175B de MetaAI (github), con comentarios como «AKA: Help! I’m oncall, it’s 3am, and everything is on fire!» y «Loss kinda exploded. Trying weight decay next», da la impresión de que el campo se desarrolla como pollo sin cabeza por ensayo y error, y que necesita un soplo de aire fresco. Que sí, que la cutrez se puede atribuir más a la despreocupación de hacer un export automático de alguna plataforma tipo Redmine, Jira, GitLab... y call it a day, y que las entrañas de cualquier proyecto (con o sin IA) no acostumbran a ser tan glamurosas como su fachada de resultados, pero lo cierto es que da una imagen bastante desoladora.
Aunque, siendo justos, y como pone de manifiesto el dadaísmo epistemológico de Feyerabend Against Method 1993, si bien la ciencia y su historia suelen presentarse arregladitas y limpias, lo cierto es que contienen varios momentos igual de disparatados e irracionales, como se nota en la conferencia de Echenique y Echeverría Ciencia, Belleza y Educación 17/10/2018 (1:38:30-1:42) respecto de Holton et al. How a scientific discovery is made: a case history 1996 a propósito del descubrimiento de la superconductividad a alta temperatura por Müller a 1986 en base a un sueño (al más puro estilo Ramanujan) y premiado con el Nobel de 1987. Otro caso notable es el descubrimiento del grafeno en 2004, premiado con el Nobel de 2010 (para más inri, por la única persona que además ostenta un Ig Nobel, del 2000): «Geim has said that his predominant research strategy is to use whatever research facilities are available to him and try to do something new with the equipment at hand. He calls this his “Lego doctrine”: “You have all these different pieces and you have to build something based strictly on the pieces you’ve got.”» (APS News This Month in Physics History: October 22, 2004: Discovery of Graphene 2009), «Andre and Kostya frequently held 'Friday night experiments' - sessions where they would try out experimental science that wasn’t necessarily linked to their day jobs. [...] This playful approach is fundamental to how both Andre and Kostya work. It is seen as both a useful way of maintaining interest as well as a means of generating new ideas.» (graphene.manchester.ac.uk Discovery of graphene), que a su vez me recuerda al siguiente comentario de Rota en Indiscrete thoughts 1997: «The comforts of an easy daily routine in a rigidly circumscribed environment, encouraged by the indulgent scrutiny of benign superiors, foster the life of the mind». S. D. Tucker Forgotten Science: Strange Ideas from the Scrapheap of History 2016 también parece ir en la misma dirección que Feyerabend.
Cambio de paradigma que podría venir de la mano de Gato,
12
expandiendo el pool de tokens a otras modalidades: A Generalist Agent 12/5/2022.
«Gato performs over 450 out of 604 tasks at over a 50% expert score threshold.In ALE Atari (Bellemare et al., 2013) Gato achieves the average human (or better) scores for 23 Atari games, achieving over twice human score for 11 games. While the single-task online RL agents which generated the data still outperform Gato, this may be overcome by adding capacity or using offline RL training rather than purely supervised»
A fin de cuentas, tiene sentido que la capacidad de generalización del modelo se reduzca a medida que exigimos un expert score más alto (i.e., que el modelo no sea 100% experto en todas sus tareas sino sólo en un cluster suyo, en especial si son tareas muy distintas), pues es fácil ser medianamente bueno en muchas cosas desarrollando habilidades generalistas, pero por necesidad la especialización que requiere la expertitud va a comprometer (en una suerte de trade-off) la cantidad de tareas en las que se es experto, y de ahí el decrecimiento en el gráfico Figure 5. Y ello sin entrar en que estamos hablando de un modelo de 1.2B de parámetros entrenado en 1.5T de tokens de control (cf. Figure 8 y Table 1; de texto e imagen no especifican, aunque sólo suponen un 15% del modelo, si lo entiendo bien), y que, como dejan claro en el paper, se trata meramente de una prueba de concepto, que podría enriquecerse de investigaciones complementarias como Multi-Game Decision Transformers 30/5/2022.
13
Para más opiniones al respecto, cf. Two Minute Papers DeepMind Takes A Step Towards General AI!, Edan Meyer Is Gato Really the Future of AI? y Dot CSV GATO: La nueva IA de DeepMind que lo aprende TODO.
1.1 Apéndice: Babel y el buscador matemático
1.1.1 LMs as the new Babel: the unfruitful search
Solar Sands The Canvas of Babel 2022 a propósito de libraryofbabel.info pone mi comparación en perspectiva: hay (ó ) páginas de texto (entorno a 500 palabras) posibles, frente a las meras publicadas (posiblemente con repeticiones), por lo que pareciera que el margen para crecer que nos queda es enorme.
No obstante, también es cierto que la práctica totalidad de Babel está compuesta de ruido,
14
y que no es claro como reducir dicho número al de textos legibles: incluso si forzamos a que el 90% de las palabras estén contenidas en algún diccionario (permitiendo el 10% restante para la introducción de neologismos), y nos restringimos a las construcciones gramaticales y semánticas correctas vía lingüística computacional, y a las descripciones verosímiles con nuestro universo e historia, etc. (todo lo cual es más fácil de decir que de hacer, tanto a nivel de cómputo como de programación), es probable que el resultado siga siendo bastante dadá, como creo que dejan constancia los actuales modelos del lenguaje,En el mismo sentido, si se me permite la licencia, en el que casi todos los números reales son trasncendentes o, en otras palabras, el conjunto de números trascendentes es denso en la recta numérica .
15
y de ahí su apodo de loros estocásticos. Es más, por la tercera ley de Clarke (1973, «Cualquier tecnología lo suficientemente avanzada es indistinguible de la magia») y la tesis fenomenológica «la identidad precede a la existencia» (Rota, 1996), ¿no serían leídas en el siglo de Pericles como sinsentidos sin interés nuestras obras literarias, científicas... contemporáneas, en especial si se examinaran a partir de páginas de texto aleatorias y sin ninguna contextualización que cubra el abismo que nos separa de Platón, no explicando referencias que ni existían entonces, como «La biblioteca de Babel de Borges»? Por simetría, aunque Babel (o PaLM) contuviese (o pudiera generar) la solución a nuestros problemas, es probable que ni la supiéramos reconocer como tal con facilidad.O, incluso, los más tradicionales generadores de texto estocásticos; cf., e.g., E. Blong Fun With Markov Chains 2000 a propósito de un experimento de 1991.
16
Creo que lo siguiente refleja bien esta tesitura: ««Physics is becoming so unbelievably complex that it is taking longer and longer to train a physicist. It is taking so long, in fact, to train a physicist to the place where he understands the nature of physical problems that he is already too old to solve them.» Eugene Wigner [Nobel 1963] as quoted by Colin Pittendrigh (1971)». Beakley & Chilton Introduction to Engineering Design and Graphics 1972.
Por ser más concreto, la autoproclamada demostración de Mochizuki de la conjetura abc a 8/2012 no fue descartada por el grueso de la comunidad matemática hasta Scholze Why abc is still a conjecture 9/2018. Por otra parte, Wiles presenta su primer intento de demostración del último teorema de Fermat a 6/1993, logrando su corrección (cuando ya estaba a punto de rendirse, como relata Simon Singh 1997) a 10/1994, publicándose (tras la revisión por pares) a 5/1995. A lo que yo me pregunto, ¿daríamos a una IA semejante beneficio de la duda, aun a costa de caer en una falacia del coste hundido?
Es más, y recordando la discusión de Thomas Royen y la desigualdad de correlación gaussiana en Rittberg et al. Epistemic Injustice in Mathematics 2018 (conjeturada en 1955 y 1972 con distintos niveles de generalidad, demostrada en 2014, y sólo reconocida globalmente a 2017), incluso demostraciones sencillas podrían pasarse por alto por el simple hecho de que la IA carece a día de hoy de las virtudes epistémicas que sí están presentes en Mochizuki y Wiles, y por las cuales sus intentos fueron tomados en serio y estudiados con cuidado, siguiendo el principio de caridad filosófica. (Otro ejemplo notorio puede verse en Stand-up Maths Superpermutations: the maths problem solved by 4chan 1/2019, a propósito de un post del 9/2011, y New Superpermutations Discovered! 3/2019, a propósito de un comentario en el vídeo anterior, que no entran en la literatura oficial, vía The American Mathematical Monthly, hasta Engen y Vatter Containing All Permutations 1/2021, donde se incluye una discusión de toda la situación; sobre la identidad del anon, cf. Robin Houston Formal proof (in Coq) of the lower bound, link.)
En última instancia, mi analogía con Babel (en cuanto a los límites de los conjuntos de entrenamiento significativos) es estéril, pues no es posible acotar que porcentaje representa lo ya escrito sobre la totalidad de escritos humanos posibles (sin entrar en cómo definirlos) ni saber cuán lejos estamos de alcanzarla. Ahora bien, en lo que sí creo que es fructífera la comparación es en problematizar el tomar a estos modelos del lenguaje como proveedores de respuestas en sí mismos, en la línea de Elena Esposito Artificial Communication: How Algorithms Produce Social Intelligence 2022 o el «adapt-to-AI principle» de Gerd Gigerenzer How to Stay Smart in a Smart World: Why Human Intelligence Still Beats Algorithms 2022.
1.1.2 De la pseudo-infinitud de Babel: esperando al Virgilio de Dante
Como ponen de manifiesto los términos gúgol y gúgolplex,
17
la psicología humana no está preparada para dar sentido a cantidades tan desorbitadas como esas, y respectivamente, acuñados en Mathematics and the Imagination 1940.
18
siendo fenomenologicamente casi indistinguibles del innavegable infinito,Para una breve exposición divulgativa desde la perspectiva de las neurociencias, cf. Numberphile How do brains count? ft. Brian Butterworth 2020, sobre la que elaboro en mi Analítico vs sintético a propósito de Kant, Frege y Dedekind.
19
y constituyendo así una suerte de pseudo-infinito. De hecho, ya es un número de páginas difícil de gestionar, y quizá de ahí que, en cierta medida, la historia tienda a repetirse a sí misma,Aunque creo que desde un punto de vista fenomenológico son indistinguibles a priori, es obvio que a posteriori no, ora mediante el estudio matemático (i.e., desarrollando una fenomenología matemática dada por su práctica, y no atendiendo a una percepción directa de los objetos matemáticos), ora por las propiedades distintivas (y sus consecuencias) que separan a los conjuntos finitos arbitrariamente grandes de los conjuntos infinitos. Y si bien dicho estudio matemático, incluyendo la aritmética transfinita de Cantor, las supertareas de Thomson (1954), etc., hacen al infinito en parte navegable, creo que este «en parte» resulta negligible cuando tratamos con conjuntos de alta entropía (en el sentido de Shannon), como lo sería un Babel de longitud no acotada.
20
como constata Polti The Thirty-Six Dramatic Situations 1895«Progress, far from consisting in change, depends on retentiveness. When change is absolute there remains no being to improve and no direction is set for possible improvement: and when experience is not retained, as among savages, infancy is perpetual. Those who cannot remember the past are condemned to repeat it. In the first stage of life the mind is frivolous and easily distracted; it misses progress by failing in consecutiveness and persistence. This is the condition of children and barbarians, in whom instinct has learned nothing from experience. In a second stage men are docile to events, plastic to new habits and suggestions, yet able to graft them on original instincts, which they thus bring to fuller satisfaction. This is the plane of manhood and true progress. Last comes a stage when retentiveness is exhausted and all that happens is at once forgotten; a vain, because unpractical, repetition of the past takes the place of plasticity and fertile readaptation. In a moving world readaptation is the price of longevity. The hard shell, far from protecting the vital principle, condemns it to die down slowly and be gradually chilled; immortality in such a case must have been secured earlier, by giving birth to a generation plastic to the contemporary world and able to retain its lessons. Thus old age is as forgetful as youth, and more incorrigible; it displays the same inattentiveness to conditions; its memory becomes self-repeating and degenerates into an instinctive reaction, like a bird’s chirp.» George Santayana The Life of Reason: The Phases of Human Progress 1905, Vol. I, Ch. XII, Continuity necessary to progress.
21
en conjunción con el principio del palomar de Leurechon-Dirichlet (1624, 1834)Y Propp Morphology of the tale 1928, Campbell The Hero with a Thousand Faces 1949, Foster-Harris The Basic Patterns of Plot 1959, Rodari La grammatica della fantasia 1973, Voggler The Writer's Journey 1992, Tobias 20 Master Plots 1993, McKee Story 1997, Gotham Writers' Workshop Writing Fiction 2003, Booker The Seven Basic Plots 2004, Snyder Save the Cat! 2005, Truby The Anatomy of Story 2007, etc. Para una introducción al diseño narrativo, cf. Escuela de Cine y TV de Madrid Septima Ars Masterclass: Gamificación y el viaje del héroe aplicado al guión ft. Jacobo Feijóo (fundador del Instituto de Diseño Narrativo), del que recomiendo además sus conferencias y reseñas en Toolkits.eu.
En cuanto a la historia con mayúsculas, me remito a: Mia Mulder The Russian Conspiracy Theory That History Isn't Real 2022 a propósito de la nueva cronología de Fomenko, Brittanica Cyclic view of time in the philosophy of history, Wikipedia Social cycle theory (citando a Polybius Histories c. 146 aC, Sima Qian Records of the Grand Historian c. 91 aC, Ibn Khaldun Muqaddimah 1377, Giambattista Vico Scienza Nuova 1725, Thomas Carlyle Thoughts on History 1830 y siguientes, Nikolai Danilewski Rossiia i Evropa 1869, Vilfredo Pareto Trattato di Sociologia Generale 1916, Oswald Spengler Der Untergang des Abendlandes 1918, Nikolai Kondratiev The Major Economic Cycles 1925, Pitirim A. Sorokin Social and Cultural Dynamics 1937, Alexandre Deulofeu La Matemática de la Historia 1951, George Modelski Long Cycles in World Politics 1987, Joshua S. Goldstein Long Cycles: Prosperity and War in the Modern Age 1988, Strauss & Howe The Fourth Turning 1997, Turchin Historical Dynamics: Why States Rise and Fall 2003, Sarkar, etc.), el «world history travels from East to West» de Hegel Lectures on the philosophy of world history. Introduction: Reason in History 1822, Nietzsche Vom Nutzen und Nachteil der Historie für das Leben 1874, Wikipedia Cyclic model (discutiendo los modelos cosmológicos de Bojowald 1999, Steinhardt–Turok 2001-2005, Penrose-Gurzadyan 2006-2010 y Baum–Frampton 2007), etc. Pues aunque varias de estas historiografías hayan sido tildadas de pseudocientíficas, mi punto sigue siendo valido: la historia contiene suficiente regularidad y repetición como para que se hayan planteado semejante cantidad de modelos cíclicos de la historia distintos, cada cual cocientando por la relación de equivalencia que mejor le ha parecido.
22
, la ridícula reivindicación de Agustín (354-430) como precedente a la relatividad,O el teorema de recurrencia de Poincaré-Carathéodory (1890,1919), la ley fuerte de los números pequeños de Gardner-Guy (1980, 1988), etc.
23
el «The safest general characterization of the European philosophical tradition is that it consists of a series of footnotes to Plato» de Whitehead,Carlos Alfieri El universo según Penrose 2007. Ridícula en la medida en la que ignora la profundidad de las ecuaciones del campo de Einstein (1915), que materializan y concretizan dicha intuición, y cuyo lenguaje era completamente ajeno a Agustín. Y otro tanto con la equiparación entre «Polvo eres y en polvo te convertirás» (Génesis 3:19) y «our bodies are made of star-stuff» (Albert Durrant Watson Astronomy: A Cultural Avocation 1918, popularizada por Carl Sagan en Cosmos 1980, cf. QI) de Pedro Miguel Etxenike La sublime utilidad de la ciencia inútil. (Por supuesto, la ridiculez viene de tomar estas comparaciones demasiado en serio y de manera literal, cf. Ter Un concepto que me ha cambiado la vida: la "PERFORMANCE" 2018, pues obviamente Penrose y Echenique saben mucha más física que yo; en Dos gratas sorpresas 2021 ya me debatía sobre esta tensión entre divulgación y rigurosidad.)
24
el «Nihil tam absurde dici potest, quod non dicatur ab aliquo philosophorum» de Cicerón,Process and Reality: An Essay in Cosmology 1929, parte II, capítulo 1, sección 1. Y en tanto que segura y general, como decía respecto de Gato, también totalmente carente de los matices de la expertitud.
25
el «Lo que ya ha acontecido, volverá a acontecer; lo que ya se ha hecho, se volverá a hacer: no hay nada nuevo bajo el sol. A veces la gente dice: «¡Esto es algo nuevo!», pero la verdad es que no lo es: nada es completamente nuevo.» de Eclesiastés 1:9-10 (450-180 aC), etc. Porque —en cierta medida, insisto— el diablo está en los detalles.De Divinatione 44 aC, libro II, capítulo LVIII, sección 119. De nuevo, el punto no es decir, sino desarrollar.
En efecto, no es sino el contexto y framework particular en el que se genera una obra lo que le da sentido (y la condición de posibilidad para su entendimiento)
26
, y de ahí los casos de ciencia adelantada a su tiempo y olvidada por la historiaCf., e.g., Lakatos Cauchy and the continuum: the significance of nonstandard analysis for the history and philosophy of mathematics 1966, que reexamina la veracidad de un teorema de convergencia uniforme de 1821 que no empieza a cuestionarse hasta Seidel 1847 y Heine 1870, y que vuelve a reivindicarse como correctamente formulado con Robinson 1966. Obra que así mismo inspira Luis Cornelio Recalde La lógica de los números infinitos: un acercamiento histórico 2004, donde se examina la evolución del concepto de número (la cual constituye en sí, aunque de manera más vaga, otro buen e interesante ejemplo de la importancia del contexto histórico y de trabajo), que también yo he examinado en otras ocasiones (cf., e.g., Algunas impresiones sobre historia de las matemáticas 2013 y De la matemática en Platón 2020).
27
, la ley de la eponimia de StiglerCf., e.g., César Tomé La convicción filosófica del investigador: el caso de Mijail Lomonósov 2012, J. M. Parra Serra L'Àlgebra vectorial. Una història que ens cal reescriure 1995, Dyson Missed opportunities 1972.
28
, o el fenómeno del descubrimiento múltipleCf., e.g., Debakcsy The Many Triumphs And Long Fall Of Nuclear Physicist Harriet Brooks (1876-1933) 2019 o Gemma Tarlach The Unsung Heroes of Science 2017, que rescata otros ejemplos notables como Mary Anning (1799-1847), Chien-Shiung Wu (1912-1997) o Alhazen (965-1040). (Aunque no diría que el desconocimiento de Wu es equiparable al de Brooks, su fama tampoco alcanza a la de Marie Curie a pesar de no tener nada que envidiarle, y en este sentido me recuerda a Noether: a pesar de su grandeza, no parecen formar parte del inconsciente colectivo, ora porque su legado fue cargado por su alumnado, ora por la complejidad técnica de sus contribuciones.)
29
, que me recuerda a la siguiente denuncia de Rota Indiscrete thoughts 1997: Cf. Merton Resistance to the Systematic Study of Multiple Discoveries in Science 1963 y Wikipedia List of multiple discoveries.
«whenever a forgotten branch of mathematics comes back into fashion after a period of neglect only the main outlines of the theory are remembered, those you would find in the works of the Great Men. The bulk of the theory is likely to be rediscovered from scratch by smart young mathematicians who have realized that their future careers depend on publishing research papers rather than on rummaging through dusty old journals.In all mathematics, it would be hard to find a more blatant instance of this regrettable state of affairs than the theory of symmetric functions.30Each generation rediscovers them and presents them in the latest jargon. Today it is -theory, yesterday it was categories and functors, and the day before, group representations.»Investigando la literatura, asumí en un primer momento que se estaría refiriendo a Carl Kostka Tafeln und Formen für symmetrische Funktionen 1907 y Schlußformel zur Hauptaufgabe der symmetrischen Funktionen 1918 (disponibles en eudml), pero en vistas a su The invariant theory of binary forms 1984 (entre otros), me parece mucho más probable que lo esté pensando en los términos más abstractos de la teoría de invariantes clásica en general, asentada en Cayley (1821-1895), Hilbert (1862-1943) y Young (1873-1940), de quienes cita sus Collected papers sin titubear.«It is a task for the present generation to recreate the lost life of invariant theory. Whether this task will be accomplished by rereading and reinterpreting the classics or whether it will be reinvented, as some physicists are now doing, will be one of the dramas of the coming years»
Y en este sentido, en vistas a Dyer et al. Minerva: Solving Quantitative Reasoning Problems with Language Models 6/2022,
31
creo que la IA puede ofrecer una solución a la problemática discutida en Terry Tao (Ingrid Daubechies) Planning for the World Digital Mathematical Library 2013 y ejemplificada en el estudio histórico de una identidad redescubierta y reivindicada en Tao et al. Eigenvectors from eigenvalues: A survey of a basic identity in linear algebra 2/2021: Y Cobbe et al. Solving Math Word Problems 10/2021, Drori et al. A Neural Network Solves, Explains, and Generates University Math Problems by Program Synthesis and Few-Shot Learning at Human Level 12/2021 y Polu et al. Solving (Some) Formal Math Olympiad Problems 2/2022. Para una discusión resumida, cf. Two Minute Papers Is OpenAI’s AI As Smart As A University Student? y Is Google’s New AI As Smart As A Human?
«In many cases, the identity was not highlighted as a relation between eigenvectors and eigenvalues, but was instead introduced in passing as a tool to establish some other application; also, the form of the identity and the notation used varied widely from appearance to appearance, making it difficult to search for occurrences of the identity by standard search engines.»
Contra el escepticismo de Marcus du Sautoy en Numberphile Google's 'DeepMind' does Mathematics 12/2021 a propósito de Advancing mathematics by guiding human intuition with AI 12/2021 o The Royal Institution Why does maths give humans the edge over machines? - with Junaid Mubeen 7/2022 a propósito de GPT-3, creo que la IA puede enriquecer enormemente a los motores de búsqueda y facilitar con ello el descubrimiento,
32
ni que sea recordando que cierto teorema más o menos técnico u olvidado aplica a una cierta situación.A mi entender, LaMDA: Language Models for Dialog Applications 2/2022 (anunciado en la I/O del 5/2021) y Join us in the AI Test Kitchen 25/8/2022 (anunciado en la I/O del 5/2022) persiguen, en esencia, justo este objetivo (de construir una suerte de motor de búsqueda en esteroides), aunque no en específico para el contexto matemático.
33
A título personal, eso es lo que me ha pasado con el problema 4 descrito en Polu 2022, solucionado por la IA mediante la desigualdad de Schur (publicada en Hardy, Littlewood y Pólya Inequalities 1934, p. 64, y demostrada en Barnard y Child Higher Algebra 1936, p. 217), sobre la cual no había escuchado hablar hasta entonces.
Otro ejemplo anecdótico lo encuentro en el siguiente comentario pasajero de Numberphile Primes and Primitive Sets (an Erdős Conjecture is cracked) 2022 a propósito de J. D. Lichtman A proof of the Erdős primitive set conjecture 2/2022 sobre una conjetura de 1988: «the ideas that Erdős really developed back in the 1930s turned out to be quite relevant to proving the full conjecture. I should say that the later work that Erdős did was in a very different direction so it was not at all clear that these ideas were relevant. But what I was doing was essentially looking at the proposal that Erdős had, a beautiful argument that kind of reinterpreted what this series is in a more probabilistic way [...]: there are a few key ingredients in this argument that are a little bit inefficient, and by identifying these steps and kind of tuning them up and tightening the screws and putting some oil it turns out that Erdős' ideas could really be continued a lot further than initially thought. [...] I also had been thinking about other ideas that he had gone off and done, so I really came to his original argument much later and it was a quite surprising to me that these sort of ideas could be relevant.» Lo que me lleva a reincidir en lo dicho respecto a Mochizuki y Wiles: ¿nos permitiríamos buscar inspiración de esta manera tan sincera y genuina en los intentos de demostración de una IA, extrayendo de ellos conceptos y técnicas interesantes y productivas? (Aunque no voy a entrar en ello aquí, quiero recalcar que son a menudo estas ideas subyacentes, y no la demostración en sí, lo relevante de la misma, como ejemplifican los números de Gödel, el forcing de Cohen o el propio concepto de conjunto primitivo, como se comenta en el abstract de Lichtman.)
2 Predicción de series temporales: propuesta rechazada
Ligera adaptación de una sugerencia hecha en la empresa en la que trabajo.
2.1 Del uso de transformers
«The results in Table 5 above underline the competitiveness of the rolling forecast-configured GBRT
34
, but also show that considerably stronger transformer-based models, such as the TFTGradient Boosting Regression Tree, implementable en el framework CatBoost (2017) de Yandex.
35
, rightfully surpass the boosted regression tree performance. Nevertheless, as an exception, the TFT makes up the only DNN model that consistently outperforms GBRT in this study, while probabilistic models like DeepAR and DeepState are outperformed on these uni-variate datasets» Elsayed et al. Do We Really Need Deep Learning Models for Time Series Forecasting? 1/2021Temporal Fusion Transformer, 12/2019
Los datos contra los que comparan la calidad de los modelos vienen de The UCI Electricity Load Diagrams Dataset, «containing the electricity consumption of 370 customers – aggregated on an hourly level» (serie temporal de 6000 horas en resolución horaria)
36
. El dataset es univariante («aims at predicting a single target variable in the future, based on the historical input of this target variable only»), lo que es una limitación importante.También lo confrontan con un segundo dataset relativo al tráfico, conteniendo sólo 4000 horas (i.e., ~5.5 meses).
37
Sin embargo, también hay literatura (y código) para el caso multivariante, como Grigsby et al. Long-Range Transformers for Dynamic Spatiotemporal Forecasting 9/2021Además de su propio histórico, la demanda energética depende de otras variables como la temperatura (en tanto que afecta al uso de aires acondicionados y radiadores), que para más inri es una variable sin memoria.
38
y Zhou et al. Informer: Beyond Efficient Transformer for Long Sequence Time-Series Forecasting 12/2020.Como inconveniente, estos sistemas requieren de una inversión no desdeñable, aunque sí asumible: «train our model in a few hours on one node with 10GB GPUs» (una NVIDIA GeForce RTX 3090 Ti 24 GB tiene un precio de 1 500 €).
39
Siendo justos, mi sensación es que esta aproximación aún está un poco verde y es todo muy experimental, pero también creo que es bastante prometedora.
PS. Un ejemplo más reciente y maduro de aplicación, anunciado en la GTC del 3/2022, es Pathak FourCastNet: A Global Data-driven High-resolution Weather Model using Adaptive Fourier Neural Operators 2/2022, basado en la plataforma de Nvidia Digital Twin Platform for Scientific Computing: «FourCastNet matches the forecasting accuracy of the ECMWF Integrated Forecasting System (IFS), a state-of-the-art Numerical Weather Prediction (NWP) model, at short lead times for large-scale variables, while outperforming IFS for variables with complex fine-scale structure, including precipitation.». La resolución es de sólo 0.25º (frente a los 0.1º de ECMWF) y el viento lo dan a 10 m de altitud, pero aun así me parece interesante, ora como prueba de concepto, ora como posible entrada para un sistema de predicción de producción de aerogeneradores. De hecho, Google parece estar justo detrás de esto desde DeepMind Machine learning can boost the value of wind energy 2/2019, materializándose sus esfuerzos en ENGIE and Google Cloud join forces to accelerate wind energy development with advanced data management and artificial intelligence 6/2022.
2.2 Filtrado automático por y/o para detección de anomalías
Este último problema de predecir la producción de renovables es tratado en DSC Energy Analytics Seminario Aprendizaje Automático (Machine Learning) en Energías Renovables 7/2020 (a partir de 25:35), donde se discute un curioso EDA (Análisis Exploratorios de Datos, 34:15-59:50) y, en lo personal más fascinante, un filtrado (aka etiquetado o anotación) de datos a partir de una función de densidad de probabilidad multidimensional sobre la curva de potencia, asignando a cada par potencia-viento una probabilidad y eliminando el percentil 5 de los datos menos probables. En un principio no entendí porque elimina un cierto percentil en vez de las predicciones por debajo de un cierto umbral de probabilidad, pero por lo que he podido saber, lo que luego hacen es evaluar la función de densidad en otra ventana temporal (o en otra serie a la que se asume un comportamiento similar, como una turbina vecina) y, si la cantidad de datos poco probables aumenta y pasa del perc5 al perc10, concluir que ha habido un problema en el input (e.g., debido a sensores disfuncionales).
En la misma línea, otra idea que me pareció interesante de la ponencia es la de avisar (o incluso prevenir) al cliente de averías gracias a la popularización del tiempo real (imagino, por el auge del IoT
40
), o el mantener una documentación de la literatura sobre el tema (Anomaly Detection of Wind Turbine Time Series using Variational Recurrent Autoencoders 12/2021, Wind Turbine Anomaly Detection Based on SCADA Data Mining 7/2020, Performance Analysis and Anomaly Detection in Wind Turbines based on Neural Networks and Principal Component Analysis 2019, etc.).Internet of Things.
41
Otro enfoque más ingenuo para la automatización del filtrado sería el uso de los filtros manuales preexistentes (la industria precede por mucho a estas nuevas aproximaciones) como conjunto de datos de entrenamiento etiquetado para una DANN, aunque en ello se heredaría la falibilidad, subjetividad y variabilidad del etiquetado humano y se perdería la capacidad de adaptación a nuevos criterios de etiquetado (motivados, e.g., por cambios en los sistemas de predicción o su entendimiento).
2.3 Filtrado automático multimodal con modelos tipo BLIP y Flamingo
Supongo que lo anterior ya habrá sonado muy especulativo (sino incluso una completa pérdida de tiempo), así que no voy a entrar a discutir este punto en detalle (que aún lo es más). Pero a mi parecer, el problema de fondo con cualquier sistema de filtrado automático basado en ML
42
(en este dominio de negocio u otro) es la explicabilidad, y de ahí que el estándar HITLMachine Learning.
43
(sirviendo la IA como mera asistencia) sea una práctica común. Human-In-The-Loop.
Y por explicabilidad me refiero a la falta de comentarios sobre el filtrado en la salida de la IA, y a la imposibilidad de dárselos a modo de guía en la entrada. Pues, e.g., dada una serie de producción de un parque eólico de dos turbinas que nunca produce por encima de la mitad de su potencia instalada dentro de una cierta ventana temporal, la IA no debería invalidar esos datos directamente, sino preguntar si una de las turbinas no estuvo disponible en ese periodo (y por ende, asumiendo comportamiento similar entre turbinas, reescalar esos datos), o si por el contrario hubo un corte de red (siendo inválidos los datos que saturan, al menos dentro de una tolerancia, pero correctos tal y como están el resto), etc.
No obstante, creo que con el advenimiento del NLP
44
y los PLMsNatural Language Processing.
45
, con hitos como GPT-3Pre-trained Language Models.
46
, una posible solución a futuro a esta clase de problemas podría ser la IA multimodalGenerative Pre-trained Transformer, OpenAI Language Models are Few-Shot Learners 28/5/2020.
47
, que sería alimentada no sólo con los datos y filtros preexistentes del parque dado (en forma de dato tabular), sino también con la documentación (en texto e imagen) de filtrados pasados del mismo, generando a la salida dichos comentarios en los casos dudosos para su reporte (automático o con HITL) al cliente.Con hitos de OpenAI como CLIP y DALL-E a 1/2021 o Video PreTraining (VPT): Learning to Act by Watching Unlabeled Online Videos 23/6/2022 (anexo I Text Conditioning, también explorado en NVIDIA MineDojo: Building Open-Ended Embodied Agents with Internet-Scale Knowledge 17/6/2022), así como los citados BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation 1/2022, Flamingo 4/2022, Gato 5/2022, PaLM-SayCan 8/2022...
2.4 Asistentes de código para migraciones, y secreto corporativo
En la traducción suele haber perdidas (ora de fluidez, ora de precisión), por lo que me parece muy prometedora la llegada de sistemas como OpenAI Codex, GitHub Copilot, Amazon CodeWhisperer, TabNine..., que podrían facilitar la programación (que no deja de ser una traducción humano-máquina) a perfiles no especializados en ella (en el caso de la modelización de la producción de renovables, por seguir con el ejemplo anterior, personas orientadas a la física, la ingeniería o la matemática)
48
. Dada la alta demanda y baja oferta de programadores (e ingenieros informáticos en general) en el contexto de Andreessen Why Software Is Eating the World 8/2011, se ha normalizado que el resto de perfiles STEM asuman también estos puestos, pero yo veo en ello cierto intrusismo laboral, y quizá de ahí la prevalencia del síndrome del impostor en el sector.
Con ello no pretendo decir que las tecnológicas no debieran tener equipos más interdisciplinares (incluyendo humanidades), a no confundir con equipos de polímatas (en los que todos saben un poco de todo pero nadie es especialista en nada), o que los graduados sean monolitos que no puedan aprender nuevas habilidades, sino problematizar la (creo) común práctica de contratar a programadores sin experiencia (laboral, académica o personal, cual si se tratase de un trabajo no cualificado), en tanto que la formación que puedan dar las empresas in situ va a estar más orientada a la práctica (y sus prácticas particulares) que no a dar unos fundamentos teóricos y transversales, a los resultados que no a las metodologías (y quizá de ahí el auge del spaghetti code, el cowboy coding, el kludge, el copy-and-paste programming, el código inflado..., con la deuda técnica que ello implica).
A título personal, e.g., en mi carrera de matemáticas hice dos asignaturas de C y dos de métodos numéricos, además de algún que otro programa en Mathematica y C++ para otras dos asignaturas, enfocado todo a la programación científica (que, diría, no es lo que suelen demandar las empresas), pero no vi nada de patrones de diseño, principios de orientación a objetos, versionado de código...
Más aún, creo que puede acelerar los procesos de refactorización de código,
49
haciendo few-shot a partir de los ejemplos dados en la documentación del rediseño,E.g., si tras un estudio del código de una corporación se decide diseñar un nuevo módulo genérico para encapsular una serie de funciones usuales y relacionadas con el fin de mejorar su trazabilidad, usabilidad, mantenimiento, etc., es entonces necesario readaptar todos los scripts que estuviesen utilizando esas funcionalidades para que pasen a beber del nuevo módulo. Y lo mismo aplica si se trata de un rediseño o reimplementación de un módulo, o incluso de la migración de un lenguaje de programación a otro o el onbording de personas familiarizadas con lenguajes distintos a los internos.
50
supervisando y corrigiendo (vía HITL) sus resultados (de ser necesarios, lo que es bastante probable durante las primeras iteraciones, al arranque, en especial si en frío), y, siguiendo el paradigma de aprendizaje activo, añadiendo estos como datos etiquetados (ora en un few-shot prompt, ora reentrenando las últimas capas del modeloEn caso de migración de lenguaje, podría iniciarse incluso con zero-shot, aunque es probable que la IA no fuera capaz de traducir una llamada a una librería externa a su homóloga (de haberla) en el nuevo lenguaje (o en caso de haber varias, escoger la que queramos), o identificar que cierto bloque de código puede externalizarse en una librería estándar (e.g., si era inexistente en el lenguaje antiguo pero pasa a estar disponible en el nuevo), mucho menos seguir mágicamente estándares internos de código (e.g., convenios de nombrado y documentación o preferencias de patrones de diseño).
51
).Aka aprendizaje por transferencia, e.g., por ajuste fino (fine-tuning).
52
Microsoft Jigsaw: Large Language Models meet Program Synthesis 12/2021 describe una pipeline con una filosofía similar.
Y cuando digo acelerar, no estamos hablando de una mera reducción de tiempos (llegando antes las mejoras de producto
53
o las optimizaciones de rendimientoEvitando tener que implementar parches para clientes particulares porque la solución global aún no está lista, por ejemplo.
54
) y su coste de oportunidadCon su consecuente reducción de coste de máquina.
55
y en salarios asociado, sino también en la carga mental (o burnout) que supone para la plantilla laboral (pues, según la escala y tipo de refactor, puede tratarse de una tarea repetitiva y aburrida). Resignándose a vivir con el código inflado y la deuda técnica por priorizar otros proyectos.
Sin embargo, eludir la paradoja de la privacidad e implementar estas soluciones en local aún tiene hoy un alto coste (monetario o de rendimiento): GPT-NeoX-20B, de código abierto, requiere de 45 GB de GPU, además de fine-tunning; Code-LMs, de VHellendoorn, sólo 6 GB a base de acotar su alcance; BLOOM, de Big Science, al menos 352 GB.
3 Profesión: computadora
A propósito de Alba Vigaray Las galeras de Google: cientos de personas transcriben en este edificio lo que le dices a tu móvil 5/2022, que a su vez versa sobre Sigma Technologies SL (2008).
3.1 Una pincelada de historia
Como dicen en el artículo, esto no viene de ahora: Amazon Mechanical Turk (AMT) se lanzó en 2005 (patente en 2001), y en 2019 VRT NWS ya filtró un millar de estas transcripciones. Y no sólo son los audios: en 2018 ya hubo un escándalo similar con Gmail (a raíz de una investigación de The Wall Street Journal), y se hablaba de «granjas de “bots humanos”». En el artículo usan el término HIT (Human Intelligence Task), pero también se suele referir a esto como microwork. (Quizá lo esté recordando mal, pero me suena que una compañera de secundaria se ganaba así la semanada, c. 2008. Y definitivamente recuerdo que me llegara spam por la época de «gane dinero online escribiendo reseñas, valorando productos, transcribiendo, etc.»)
Sea como fuere, esto es algo que precede por mucho a la IA, como deja patente la ley H.R.1396 (Hidden Figures Congressional Gold Medal Act, propuesta a 2/2019, y aprobada a 11/2019): «In recognition of all the women who served as computers, mathematicians, and engineers at the National Advisory Committee for Aeronautics and the National Aeronautics and Space Administration (NASA) between the 1930s and the 1970s."».
56
(De hecho, una profesora de secundaria me comentó en su día que cuando estudió la carrera de matemáticas aún existía un departamento de calculadoras humanas. Y por supuesto, quién dice calculadora, dice cualquier otra cosa similar, cf. Wikipedia Human-based computation.También hubo medallas para las tres mujeres afroamericanas retratadas en Hidden Figures 1/2017; apostaría a que las medallas vinieron motivadas por la conciencia social que trajo la película.
A modo de referencia, «In 1962, as NASA prepared for the orbital mission of John Glenn, Johnson was called upon to do the work that she would become most known for. The complexity of the orbital flight had required the construction of a worldwide communications network, linking tracking stations around the world to IBM computers in Washington, Cape Canaveral in Florida, and Bermuda. The computers had been programmed with the orbital equations that would control the trajectory of the capsule in Glenn’s Friendship 7 mission from liftoff to splashdown, but the astronauts were wary of putting their lives in the care of the electronic calculating machines, which were prone to hiccups and blackouts. As a part of the preflight checklist, Glenn asked engineers to “get the girl”—Johnson—to run the same numbers through the same equations that had been programmed into the computer, but by hand, on her desktop mechanical calculating machine. “If she says they’re good,” Katherine Johnson remembers the astronaut saying, “then I’m ready to go.” Glenn’s flight was a success, and marked a turning point in the competition between the United States and the Soviet Union in space.» (NASA Katherine Johnson Biography). Para un ejemplo de 1971, cf. Together TV Mathematical Genius That Saved Apollo 13 After Explosion Onboard | GameChangers: Katherine Johnson 2021. Y para una disección de la transición, cf. Marie Hicks Programmed Inequality: How Britain Discarded Women Technologists and Lost Its Edge in Computing 2017.
57
)Para uno de los trabajos fundacionales en el campo, cf. Dawid & Skene Maximum Likelihood Estimation of Observer Error-Rates Using the EM Algorithm 1979.
3.2 Pero como nota más político-ética...
...el comentario «Si lo haces durante ocho horas al día te vuelves loco. Dos horas al día es aburrido, pero te pones y lo haces» me ha recordado a la idea de Marx (para lidiar con los trabajos alienantes pero necesarios)
58
de hacer a éstos rotativos:Aunque el concepto de «trabajo alienante» parece un producto de la modernidad, su origen puede trazarse hasta la poiesis de Aristóteles (trabajo productivo, en el sentido de traer algo a la existencia, que se acomete como medio para un fin, el producto resultante), que se contraponía a su noción de praxis (acción no productiva sino edificante, que se hace por su propio interés). De hecho, su Ética exhuma un elitismo muy evidente (sin necesidad de entrar en estos matices bizantinos) ya desde el capítulo 1 con su jerarquización de profesiones y la idea de que algunas le son más propias que otras al ser humano (y su antonomásica racionalidad, dirá).
59
Wikipedia Job rotation cita algunas experiencias aisladas, como Lohr How job rotation works for Japanese 1982. Para un caso aún más antiguo, me remito a la London Co-operative Society (1920).
Por otra parte, cabe aclarar que la idea no es original de Marx: «Fourier [1772-1837] believed that no occupation should be pursued for more than two hours at a time. Necessary dangerous work, as in chemical plants and glass works, would be rotated so that one person might spend only two or three hours a week in those places. But no matter how enticing, all work would be done in short sessions. This would have the additional advantage of promoting equality and solidarity, as those who were leaders in one field would be novices in another.» Roelofs Charles fourier: Proto-red green 1993.
Sin embargo, creo que es justo considerar a Marx uno de sus primeros y principales proponentes, ni que sea por influencia de Fourier: «For as soon as the distribution of labour comes into being, each man has a particular, exclusive sphere of activity, which is forced upon him and from which he cannot escape. He is a hunter, a fisherman, a herdsman, or a critical critic, and must remain so if he does not want to lose his means of livelihood; while in communist society, where nobody has one exclusive sphere of activity but each can become accomplished in any branch he wishes, society regulates the general production and thus makes it possible for me to do one thing today and another tomorrow, to hunt in the morning, fish in the afternoon, rear cattle in the evening, criticise after dinner, just as I have a mind, without ever becoming hunter, fisherman, herdsman or critic.» Marx The German Ideology 1846.
«To abolish division of labor is to eliminate job specialization. Within a plant this could be accomplished by rotating all workers through all the jobs performed in the plant. If this were done in all shops there would remain variations in tasks performed by workers in different shops and in different lines of industry, so a thoroughgoing abolition would presumably require rotating the entire labor force through all the (significantly) different kinds of work in the economy.» (Richard J. Arneson Meaningful Work and Market Socialism 1987)
Y la cita continua con la siguiente ironía: «A closely related aspiration is to increase the aggregate amount of interesting work by altering production methods (e.g., by replacing a simple repetitive task with a machine and a skilled machine tender job).», citando como referencia para esta línea de pensamiento Robert Blauner Alienation and Freedom:The Factory Worker and His Industry 1964.
Ironía, digo, porque, dado los problemas de robustez de la IA actual ante los datos OOD, no es evidente que este nuevo oficio del etiquetado de datos (al que podríamos incluir a los HITL durante el proceso de inferencia) vaya a ser algo provisional,
60
o que su presencia no vaya a seguir creciendo linealmente a medida que se generaliza el uso de la IA, haciendo un tanto ingenuas tanto las exposiciones de CGP Grey Humans need not apply 2014 como Davenport y Kirby Only Humans Need Apply: Winners and Losers in the Age of Smart Machines 2016 (que calla sobre AMT).El etiquetado programático puede automatizar parte del proceso, pero difícilmente su totalidad, cf. Braden Hancock Making Automated Data Labeling a Reality in Modern AI 2022. Por otra parte, es posible que el aprendizaje no supervisado resuelva este problema de raíz, o que al menos el aprendizaje por transferencia lo mitigue, pero me atrevería a decir que sigue siendo vigente la tesis de Andrew Ng: «today, supervised learning is creating 99% of this recent wave of economic value» (AIDC 5/2018), como se reafirma en David Bombal The truth about AI and why you should learn it - Computerphile explains ft. Dr Michael Pound 7/2022.
Sí, es posible que OpenAI marque un punto de inflexión, pero la gran mejora que supuso InstructGPT (sin faltar al salto de GPT-3 en sí) vino de la contratación de 40 etiquetadores, cf. Training language models to follow instructions with human feedback 3/2022, por lo que es fácil que esa termine siendo la solución cuando copemos el tamaño de los modelos y datasets (especialmente si empezamos ya a depender de estas tecnologías de IA).
Y aunque papers como Goyal et al Vision Models Are More Robust And Fair When Pretrained On Uncurated Images Without Supervision 2/2022 son muy prometedores, aún requieren del fine-tunning final (con ImageNet, COCO o datasets aún más personalizados) para cualquier aplicación práctica, sin olvidar que dicho fine-tunning viene con fecha de caducidad incluida debido al problema del data drift (como ejemplifica que ImageNet entienda por móvil uno pre-smartphone), por lo que necesita de una periódica actualización. (Para un giro ético sobre el problema de la deriva, cf. Hannah Davis A Dataset is a Worldview 2020. Sobre el arma de doble filo que supone la dependencia a estos datasets, cf. Casado y Lauten The Empty Promise of Data Moats y Casado y Bornstein The New Business of AI (and How It’s Different From Traditional Software) 2020).
De hecho, a pesar de la dudosa moralidad de esta externalización, examinada por Caroline Sinders en su proyecto TRK (derivado de su macro-proyecto Feminist Data Set, y acompañado del ensayo “Technically” Responsible: The essential, precarious workforce that powers A.I. 2020),
61
este es un hecho citado sin complejos por la industria, como puede verse en varias declaraciones de Fei-Fei Li,Véase también Maximilian GAHNTZ The invisible workers of the AI era 12/2018.
62
o en Cassie Kozyrkov MFML 2021, o en la broma interna «In Data Science, 80% of time spent prepare data, 20% of time spent complain about need for prepare data.» (que se remonta al menos hasta @BigDataBorat 2/2013). Desde su paper original (en el que se modeliza el rendimiento de turcos mecánicos), ImageNet: a Large-Scale Hierarchical Image Database 2009, hasta su TED talk How we teach computers to understand pictures 2015, pasando por Gershgorn The data that transformed AI research—and possibly the world 2017.
3.3 Y a título más personal...
«Estudié matemáticas pero trabajo como programador» es una frase recurrente cuando me presento por primera vez, y la respuesta usual (si la persona no tiene perfil STEM) es «debes de ser muy inteligente». Sin embargo, yo no percibo tal correlación (y de hecho la he discutido varias veces),
63
hasta el punto de pensar (desde que estoy en el oficio) que el programador es el obrero del siglo XXI,Aquí me voy a centrar en lo relativo al trabajo de programador, pero sobre los estudios de matemáticas, recomiendo la fascinante entrevista Numberphile Podcast An Educated Adult - with Tadashi Tokieda 7/2022.
64
como creo que refleja la expresión «cárnicas del software» (aka «consultoras tecnológicas cárnicas», autodenominadas «empresa multiservicio» o «empresa de externalización de servicios»).Puede que la curva de aprendizaje del primero sea mayor, pero una vez subida, y en el día a día, no deja de ser una manipulación mecánica y repetitiva en piloto automático de cajas negras (al menos hasta que algo se rompe o se sale de lo común y hay que abrirlas), siguiendo para más inri una dirección a menudo absurda (o ajena y enajenante) dada por los caprichos del cliente de turno (o el sistema al que está conectado, pues en verdad dudo de la existencia de culpables individuales), las limitaciones de la infraestructura interna propia (debida a decisiones de negocio, de diseño, de implementación... mantenimiento de sistemas legacy, con casos tan llamativos como Lee Wanted urgently: People who know a half century-old computer language so states can process unemployment claims 4/2020 a propósito de COBOL, etc.), etc.
Por supuesto, yo sólo puedo hablar desde mi pequeña muestra experiencial, pero me tienta decir que es algo generalizado, cf. Michael Lin Why I Quit a $450k Engineering Job at Netflix 2/2022, DThompsonDev Why I quit a 6 Figure Job in FAANG 12/2021, Clément Mihailescu Why Do Software Engineers Leave FAANG? 2/2022, Y Combinator Why You Should Leave Your FAANG Job 4/2022, etc.
65
En realidad el nombre hace referencia a cómo se gestiona el empleo y no a su naturaleza, como dejan claro en Laboro, pero aun así a mí la metáfora me sigue pareciendo apropiada (por lo antes dicho) para todo el sector. Aunque siendo honesto, creo probable que hubiese llegado a la misma conclusión con independencia del trabajo al que me hubiese dedicado, siendo pues mi queja enmarcable en el movimiento de rechazo y abolición del trabajo en general (recordemos, la etimología de «trabajo» se deriva de un instrumento de tortura), ora por la inevitable instrumentalización por la que pasa un conocimiento, habilidad, etc. para convertirse en profesión y servicio en una sociedad de consumo, ora por mi completo desalineamiento con respecto a los cuatro atributos del Ikigai (en parte, quizá, por tener conceptos y valores distintos respecto de lo que se suele entender por capacidad, necesidad, beneficio e interés).
Pero para no perderme en vaguedades, citare ejemplos más concretos y personales de ese carácter de multifunción y de enajenación de la figura del programador-obrero:
- Me resultó muy chocante ver como un equipo de programadores se ponía a traducir de idioma los contenidos de una web de un organismo gubernamental porque el cliente dejó de pasarnos esa información, que aun así exigía.66Supongo que no fue algo unilateral y que el director de proyecto tuvo que renegociar y aceptar eso, pero me sigue pareciendo sacrílego, por el aprecio que le tengo a las lenguas: ser poliglota no te convierte en interprete.
- O programar en banca con un software de drag and drop (quizá para hacerlo más accesible a economistas que no habían programado en su vida) como TIBCO Designer,67en el que ni siquiera parecía poderse hacer un for tradicional, sino sólo un foreach.Lo más parecido que conocía era Scratch, que entiendo como mera propedéutica. Que sí, que Blender y Unity técnicamente también son visual programming languages, pero al ser de por sí orientados al multimedia no me parecen comparables.68Esta limitación la descubrí (y discutí en mi equipo) al intentar calcular (como se me pedía), para cualquier valor float, su tanto por mil (o algo parecido) por string, desplazando la coma decimal. La solución paso por crear un objeto con el número de elementos igual al número de iteraciones que se querían hacer. Lo ridículo tanto del problema como de la solución creo que da buena cuenta de mi sentimiento de hoja al viento, títere de los avatares del azar.
- O intentar integrar una solución, código, API... externa para no reinventar la rueda, y descubrir al final que el último paso (la más frívola pijotada, el detalle de personalización más insignificante y aun así requerido) no es posible (por una carencia de flexibilidad en los fundamentos mismos de la aproximación),69o que cierran su soporte,IIRC, Raymond The Cathedral and the Bazaar 1997 discute una tal situación, aunque diría que este punto es en realidad universal, siendo mi ejemplo predilecto: «Hardly anything more unfortunate can befall a scientific writer than to have one of the foundations of his edifice shaken after the work is finished. This was the position I was placed in by a letter of Mr. Bertrand Russell, just when the printing of this volume was nearing its completion.» Frege The Basic Laws of Arithmetic, Volumen 2, Apéndice, 1903.70etc.El inevitable y rápido panta rei (cambio y movimiento continuo) del sector que obliga a constantes refactorizaciones (para lidiar con el problema del código inflado), migraciones (para ganar funcionalidades, eludir vulnerabilidades, etc.), etc.
- O, para amoldarse a las demandas de los distintos clientes, replicar y readaptar una y otra vez los mismos scripts y procedimientos dentro de las limitaciones de ciertas dependencias y módulos genéricos gestionados por otros departamentos, que pueden cambiar unilateralmente.
Y en lo que al etiquetado de datos respecta, creo que no hace más que llevar estos absurdos a un nuevo nivel:
71
Para discusiones menos personales, véase el estado del arte Jennifer Wortman Vaughan Making Better Use of the Crowd: How Crowdsourcing Can Advance Machine Learning Research 2018, que incluye una sección sobre el comportamiento de los etiquetadores, y Daria Baidakova Authoritative Intelligence: How Data Labelling Increases the Accuracy of AI Models 2021, que da un repaso (del que he extraído varias fuentes) del giro del modelo al dato.
- Como se comenta en Snorkel AI Andrew Ng "The Data-Centric AI Approach" 3/2022, no es inusual que haya inconsistencias de etiquetado incluso entre los expertos de un dominio de conocimiento72(y huelga decir que los etiquetadores no suelen serlo)Kahneman et al. Noise: A Flaw in Human Judgment 2021 examina la variabilidad (o discrepancia) del juicio profesional en diagnósticos médicos, sentencias judiciales, presupuestos de compañías de seguro, lecturas de huellas dactilares... Para una reseña, cf. Roxana Kreimer ¿Qué HACEN los JUECES? DISCREPANCIA en los juicios PROFESIONALES 2022.Sobre cómo lidiar con esto, tanto Kahneman como Ng abogan por una estandarización del proceso. E.g., dice Ng, clarificando las instrucciones de manera reiterada, e ilustrándolas tanto con usuales ejemplos de falsos positivos/negativos como con sus contrapartes verdaderas de la matriz de confusión, enfatizando los casos ambiguos, límite o fáciles de equivocar (en la línea de Detecting and Preventing Confused Labels in Crowdsourced Data 9/2020), que habrán sido previamente trazados y documentados (fijando en ello una decisión sobre cómo gestionarlos, incluso si arbitraria) mediante el análisis de errores y la exploración de las diferencias en el nombrado, número, tamaño... de etiquetas de un mismo dato anotado por múltiples trabajadores (con el fin, insisto, de entender dónde y cómo se da la susodicha variabilidad, en la línea de la anotación descriptiva de Two Contrasting Data Annotation Paradigms for Subjective NLP Tasks 12/2021, pudiendo a posteriori estandarizarlo en una anotación prescriptiva). Y, también, eliminando de raíz datos corruptos (que son minoría, pero fuente probable de ambigüedad) y fijando umbrales en los criterios deterministas de etiquetado (como la longitud a partir de la cual un arañazo hace defectuoso un producto).Sin embargo, dicha uniformidad no sólo puede ser una causa de enajenación, sino incluso recibirse de plano con resistencia, como ejemplifica el Sentencing Reform Act de 1984, cuyas directrices pasan a ser sólo consultivas con United States v. Booker (2005), cf. Crystal Yang Free at Last? Judicial Discretion and Racial Disparities in Federal Sentencing 2013, Newman Remembering Marvin Frankel: Sentencing Reform But Not These Guidelines 2002.Sea como fuere, cabe recalcar que este problema relativo a la calidad del etiquetado es bien conocido en el gremio, por lo menos, desde que las DANN se cruzaron con el Big Data: «While users are instructed to make accurate judgment, we need to set up a quality control system to ensure this accuracy. There are two issues to consider. First, human users make mistakes and not all users follow the instructions. Second, users do not always agree with each other, especially for more subtle or confusing synsets» Fei-Fei Li et al ImageNet: a Large-Scale Hierarchical Image Database 6/2009.¿Su solución? En la línea de Surowiecki The Wisdom of Crowds 2004 y Howe The Rise of Crowdsourcing 2006 (que discute proyectos tan fascinantes como InnoCentive 2001 de la mano de Karim Lakhani), «to have multiple users independently label the same image. An image is considered positive only if it gets a convincing majority of the votes. We observe, however, that different categories require different levels of consensus among users. For example, while five users might be necessary for obtaining a good consensus on “Burmese cat” images, a much smaller number is needed for “cat” images.»No obstante, no tengo claro que su aproximación sea asequible (o no de una manera ética, como denuncia Caroline Sinders) fuera de las Big Tech y grandes universidades (aunque puede que aproximaciones como Aggregating Crowdsourced Labels in Subjective Domains 2018 o Objective Assessment of Subjective Tasks in Crowdsourcing Applications 2020 disminuyan el coste). Sin mencionar, respecto al problema de la enajenación, que si bien puede disminuir la presión laboral, también puede aumentar la sensación de insignificancia (o despersonalización y baja realización personal, factores de riesgo del síndrome de desgaste profesional, aka burnout).73, generando con ello un sentimiento de síndrome del impostor (o, cuanto menos, inseguridades, miedos y ansiedades respecto a la tarea de etiquetado)Con todos los problemas que esto conlleva, cf. Zheng DOCS: Domain-Aware Crowdsourcing System 201674. Y esto sin entrar en las inconsistencias debidas a error humano (e.g., por despiste, estado de ánimo alterado, etc.), a la dificultad de la tarea, a la subjetividad del dato, a las mermas de calidad del propio dato en crudoAtendiendo al efecto de Dunning-Kruger, y suponiendo que son conscientes de la carencia, como sería natural si se dedican a la misma tarea durante varios ciclos y reciben feedback experto a propósito de su etiquetado.75(e.g., por las dificultades de gestionar altos volúmenes de datos descentralizados), etc.I.e., pre-anotación.76Otro clásico es, en caso de empezar a recibir datos anómalos (respecto a su histórico) de un tiempo en adelante, decidir si se trata de un cambio de comportamiento en el mundo que describen (aka data drift) y por ende son datos legítimos que pasan a invalidar el histórico anterior y a constituir el nuevo target a predecir, o si por el contrario preferimos ignorarlos porque creemos que su carácter anómalo se debe a algún error (posiblemente silencioso, si ha llegado hasta la fase de etiquetado) o malfuncionamiento en la «cadena de montaje», que va desde la generación del dato en bruto (e.g., por parte de un sensor) hasta su visualización para filtrado (que puede estar afectada por algún bug de la plataforma correspondiente) pasando por los envíos entre intermediarios o las pipelines de ETL (Extract, Transform, Load) del procesamiento de los datos generados.Decisión que, al trabajar a menudo en entornos con información incompleta (en parte por toda la cadena de intermediarios sospechosos de culpa, en parte porque no podemos acceder al mundo en sí sino a través del dato generado, que podría estar corrupto), no va a tener un grado de justificación o legitimidad epistémica mayor que un lanzamiento de dados: cualquiera que sea nuestra racionalización o intuición particular, se podría dar un contrafactual igual de bueno.Por supuesto, y siendo pragmáticos, podría tentarnos negar ese «igual de bueno» acudiendo a la estadística y analizando los resultados de las decisiones de situaciones anteriores similares. Sin embargo, insisto, incluso a pasado seguiríamos teniendo el problema de la información incompleta (como dejan constancia las diferentes explicaciones de un mismo evento por parte de distintos historiadores, economistas, sociólogos, paleontólogos..., quizá por lo discutido en Veritasium The 4 things you need to be an expert 2022), por lo que nuestras estadísticas quedarían sesgadas, aun suponiendo que no nos dieran un inútil 50/50.Recapitulando, en la raíz de esta suerte de espada contra la pared, catch-22 o parálisis del análisis, por la cual cualquier elección es en potencia una muerte anunciada, está lo que en filosofía de la ciencia se conoce como el problema de la subdeterminación de las teorías por los datos (aka tesis de Duhem-Quine, sobre la que expandieron de manera clave Kuhn, Lakatos, Feyerabend y van Fraassen, acotando Laudan sus excesos en 1990-1), que como cualquier buen problema filosófico, es un problema abierto. Ante lo cual, y siguiendo una especie de principio de parsimonia, una buena opción y compromiso podría se simple y llanamente tomar el camino de menor resistencia siguiendo la ley del mínimo esfuerzo y no trabajar en balde.
- No por temer un eventual e inevitable accidente («quién tiene boca se equívoca») dejamos de pisar el asfalto,77sino que, siguiendo las mejores prácticas (a menudo autoritarias, mecánicas e instrumentalizantes,Recuerdo que los accidentes de tráfico son la primera causa de muerte no natural, generando del orden de un millón al año, cf. Global Burden of Disease Study 2010 o Our World in Data Causes of death 2018. (Aunque es la terminología estándar, en lo personal me desagrada bastante la expresión «muerte por causas naturales», pues se incluyen en ellas las evitables, que, como denuncia UNICEF, no tienen nada de naturales.)78encorsetandonos por el bien del margen de beneficios que guía esta sociedad de sobreproducción, mercantilización y capitalización neoliberal autodestructiva y sin sentido)Contra el «Labour is not a commodity» de la declaración de Filadelfia (1944, Organización Internacional del Trabajo bajo el marco de la Organización de las Naciones Unidas), ya presente en Tratado de Versalles (1919, parte XIII), y precedida por el Clayton Act (1914, sección 6).79, aprendemos a vivir con riesgos y seguimos adelante, superando así esta parálisis por análisis.Sobre la ambivalencia de mi actitud, que roza la disonancia cognitiva, me remito a Rota 1991 y bell hooks 1996: «The reality we live in is constituted by a myriad contradictions», «Contradiction is the stuff of revolutionary struggle. The point is not to deny the reality of contradiction but to utilize the space of contradiction to come to a greater understanding.»: a veces sólo quiero delegar la toma de decisiones para no acarrear con las consecuencias de la incertidumbre (al no verme capacitado para tomarlas), y a veces la indiferencia pragmática de quienes terminan tomando dichas decisiones chocan con mis valores y mi deformación profesional matemática y sólo quiero rebelarme; nadie dijo que los humanos fuéramos monolitos inamovibles y consistentes («Every being cries out in silence to be read differently.» Simone Weil Gravity and Grace 1947), o que no estuviéramos dispuestos a asumir y balancear ciertos trade-offs (de los cuales, con mi queja, sólo estoy presentando la parte negativa: si bien a día de hoy no creo que me compense escapar de esta situación irresoluble cambiando radicalmente de vida, como podría ser yéndome a la comuna y ecoaldea de Los Portales 1984, tampoco creo que esa exigencia sea justa o que no sea posible un compromiso intermedio construyendo una sociedad diferente).80Sin embargo, no por ello deja de pender sobre nuestras cabezas la espada de Damocles: no habrá recompensa por un buen trabajo, que se da por sentando,Ser consciente de lo extendido, sistémico e intrínseco del problema también es un alivio, al menos a título individual (lo que no es moco de pavo, dado el ciego auge neoliberal de la individualización y atomización de las responsabilidades, con ejemplos tan flagrantes como el concepto de la huella de carbono personal, acuñado por la petrolera BP en una campaña publicitaria de 2005, cf. Kurtis Baute My Carbon Footprint is Broken 2020 y Everything You Need To Know About Climate Change 2022).81sino que sólo rodaran cabezas en otro caso.Siendo justos, en las evaluaciones anuales me han halagado como atributo diferenciador, entre otras cosas, el equivocarme muy poco. Sin embargo, sigo encontrando chocante, irónico, limitante e incluso inquietante que a lo máximo a lo que pueda aspirar sea a una negación de una característica negativa más que a la afirmación de una positiva en sí misma.
- Para superar eventualmente este sesgo de negatividad inherente a la naturaleza de la tarea, podemos tratar de aprender (como las propias IAs)82a prever que acciones darán lugar a la guillotina a base de recordar cuándo ésta ha golpeado. Sin embargo, tomar (o incluso depender de) dicha retroalimentación como etiqueta es problemático debido a (usando la jerga de Veritasium The 4 things it takes to be an expert 2022) la tardanza en su llegadaIronías aparte, el peligro más obvio del condicionamiento pavloviano (1897) y la ley del efecto (Thorndike, 1898), que alcanzan su madurez (como teoría) con Hull The conflicting psychologies of learning—a way out 1935 y Skinner The behavior of organisms: An experimental analysis 1938, es caer en una caja de Skinner de intervalo variable (aka variable ratio schedule reinforcement, acusado de ser un factor de riesgo para la ludomanía, cf. Bleda et al. Impulsivity, intelligence, and discriminating reinforcement contingencies in a fixed-ratio 3 schedule 2012).83y a la falta de validez del entorno,Desde que se pone la primera etiqueta hasta que se entrena el modelo y se despliega en operativa como producto y se evalúan sus resultados puede pasar mucho tiempo, suponiendo que quién etiqueta llegue a saber siquiera si los resultados han superado el benchmark (problema, en esencia, también presente en un ciclo de software convencional). De hecho, y en última instancia, el feedback que se termine recibiendo va a estar compuesto sólo, en una suerte de sesgo del superviviente, por quienes se han tomado la molestia de dar el feedback, cuya demografía es a priori desconocida, por lo que sería precipitado sacar conclusiones a partir suyo, al no poder saber que importancia deberían de tener.Más aún, debido a la falta de explicabilidad de la IA, tampoco es posible determinar de manera exacta el peso relativo de las distintas etiquetas (al menos no sin una inversión extra de recursos, e.g., a base de testear el efecto de diferentes etiquetados, lo que puede resultar difícil y costoso, acometiéndose sólo cuando no se alcanzan los objetivos, si bien la intuición dada por la experiencia y el conocimiento del código puede darnos una aproximación), por lo que, en cualquier caso, el feedback seguiría siendo bastante vago (si malo, ¿cuál etiqueta ha sido la culpable?) y, por ende, inservible. (Por supuesto, ello no evita que a veces no se filtre siguiendo las pautas marcadas sino un objetivo de predicción concreto unido a la susodicha intuición sobre cómo se cree que interpreta el modelo distintos estilos de filtrado, anticipando así su comportamiento, en la línea del «adapt-to-AI principle» de Gerd Gigerenzer, y llegando con ello a violaciones bastante flagrantes de los criterios usuales. Sin embargo, y recordando la caja de Skinner, dicha intuición puede no ser más que una mera superstición.)84pudiendo llevar esta falta de transparencia (de la organización o el cliente) a una caja de Skinner de intervalo variable.No sólo por la naturaleza del dominio de aplicación de una IA concreta (como en los campos de la economía y la meteorología, caracterizados por una volatilidad difícil tanto de predecir como de describir, no estando claro cómo se habrían que etiquetar), sino también del modelo de negocio: si cada cliente o usuario tiene distintos estándares, puede que hayamos hecho un trabajo pésimo y no recibamos amonestación ninguna por ello (e.g., si un país obliga por ley a dar una previsión de producción de un parque eólico pero no penaliza las malas predicciones por costes de desvío), o viceversa.
- Ante esto, aún podríamos refugiarnos en el estoicismo, no preocupándonos por aquello que escapa a nuestro control, y acudiendo al mecanismo de defensa de la compartimentalización85. Pero en ello, como argüía Hegel, ¿no caeríamos de nuevo en una autoanimiquilación?Me remito de nuevo a Rota y bell hooks.
Comentarios
Publicar un comentario
El pudor es un estigma social: descuartizame, y mis manos resquebrajadas te aplaudirn.