DALL-E 2 vs Imagen: ¿Google ni lo intenta?
Fuente: https://imagen.research.google/
Log de impresiones:
I
Por lo que veo, han mejorado notablemente la comprensión y escritura de texto, pero creo que lo que más me ha chocado es una ausencia (te animo a ojear las imágenes del enlace inicial y de su paper antes de continuar para ver si es una extrañeza compartida). No sé, se me hace medio raro que a pesar del antropomorfismo animal, con expresiones faciales tan aparentemente humanas, no sea capaz de generar personas, ¿no? Lo más parecido que dan es una estatua, cuyo rostro (o ausencia de, más bien) parece sacado de un cuento de terror japones (y sí, eso es una referencia al yōkai Noppera-bō). De hecho, esta ausencia casi parece intencional...
II
Pensaba que la mejora de comprensión del lenguaje vendría de PaLM (arxiv, 5/4/2022), pero dicen que han usado T5... A modo de recordatorio, el preprint de T5 es del 10/2019 (arxiv). Hum, parece que ni siquiera se han molestado en sacar la maquinaria pesada.
PS. «Imagen trained with our largest text encoder, T5-XXL (4.6B parameters)». Ahora que lo pienso, PaLM es decoder-only. A priori, imagino, eso no significa que no se hubiera podido reciclar con algún truco inteligente y para nada trivial, pero reconozco que aquí he juzgado mal la situación.
III
Me da la impresión de que tampoco se han matado mucho con el dataset: «We train on a combination of internal datasets, with ≈ 460M image-text pairs, and the publicly available Laion dataset [61], with ≈ 400M image-text pairs», «Imagen’s training data was drawn from several pre-existing datasets of image and English alt-text pairs.»
Lo que me llama la atención del comentario es que han usado el open dataset LAION-400M en vez de LAION-5B. Es cierto que este último apenas salió a 31/3/2022 (release) y que, por ende, está menos estudiado, por lo que quizá simplemente Google no se haya querido pillar los dedos introduciéndose en territorio por explorar. O, también, que sencillamente no hayan querido invertir en coste y tiempo de máquina usando un dataset diez veces mayor (su tiempo de entrenamiento fue de 4 días). Pero aun así, y bajo la luz de la impresión anterior, me reafirmo en que Google parece que ni lo está intentado, sino meramente presentando un horneado rápido para salir del paso y decir que también puede. (Quizá sea un detalle menor, pero me he animado a publicar esto precisamente porque, haciendo una búsqueda rápida en Google, no he visto que nadie más haya notado el tema de LAION-5B.)
PS. Por contextualizar, DALL-E 2 de OpenAI sale a 13/4/2022 (arxiv, 250M pares imagen-texto, 12B parámetros), CogView2 de BAAI a 28/4/2022 (arxiv, 30M pares, 6B parámetros) e Imagen de Google a 23/5/2022 (arxiv, 860M pares, 3B parámetros sin contar los de T5). Visto así, supongo que mi evaluación es bastante injusta, ya que Google es quién usa el dataset más grande. Sin embargo, es probable que para cuando salió LAION-5B ya fuera demasiado tarde para usarlo por OpenAI, pero no para Google, sin mencionar que Google ni siquiera se ha molestado en hacer un proceso de curado de los datos (como enfatizan en su discusión de los sesgos).
Resumiendo, parece que Google podría haber hecho esto ya cuando salió el DALL-E original a 5/1/2021 (o antes, en 2018, usando BERT en vez de T5), pero que lo hace ahora aprovechando el tirón mediático, como si tuviera envidia de la atención que está recibiendo OpenAI. O a modo de reclamo, también, para a ver si consiguen que más gente estudie STEM, que deben andar escasos de personal.
IV
«Imagen exhibits serious limitations when generating images depicting people. Our human evaluations found Imagen obtains significantly higher preference rates when evaluated on images that do not portray people, indicating a degradation in image fidelity.»
«increasing the classifier-free guidance weight improves image-text alignment, but damages image fidelity producing highly saturated and unnatural images [27]. We find that this is due to a train-test mismatch arising from high guidance weights.»
Supongo que esto explica la ausencia que comentaba al principio.
También he de decir que, tras ver la comparativa con GLIDE, la comprensión de Imagen no es tan buena como creía. Aunque, por otra parte, es posible que el tema de la asociación del color sea un filón excepcional, por lo que me gustaría generar en GLIDE «A cloud in the shape of two bunnies playing with a ball. The ball is made of clouds too.» para contrastar: probablemente Imagen tenga una ventaja importante en textos así de largos, pero... (tomo este ejemplo porque DALL-E 2 no puede con ellos, como se vio en un directo de Ideami).
V
Tengo la impresión de que Google ha dejado medio de lado la parte más de diseño que tanto está empujando DALL-E 2, por mucho que digan «leave artistic content to the Appendix, since generating photorealistic images is more challenging from a technical point of view». Lo que supongo que tiene sentido, dado que no tienen intención de hacer de esto un producto.
Aun así, a mí no me parece tan evidente que su calidad estética sea mejor: las no foto-realistas dejan bastante que desear en comparación con DALL-E 2, y en las foto-realistas a veces se da un antropomorfismo un tanto inquietante. Lo que, por una parte, me lleva a apreciar el tremendo trabajo de ingeniería de datos que a mi entender ha debido hacer OpenAI, y por otra, a cuestionar el benchmark de Google: ¿cómo se ha fraseado la pregunta «¿qué imagen prefieres?», y que panel de personas la ha respondido? No en balde, la opinión entre público y critica suele diferir, y alguien fan de Michael Bay probablemente tendrá una sensibilidad y preferencia muy distinta a la de alguien fan de Ingmar Bergman. Sobre lo primero, el framing parece bastante neutral (aunque ambiguo): «Which set of images is of higher quality?, Which set of images better represents the text caption : {Text Caption}?». Sobre lo segundo: «We aggregate scores from 25 raters for each category (totalling to 25 × 11 = 275 raters). We do not perform any post filtering of the data to identify unreliable raters, both for expedience and because the task was straightforward to explain and execute.»
PS. Por citar un ejemplo más concreto de a qué me estoy refiriendo con «la parte más de diseño», véase Bakz T. Future Designing Websites with DALL-E 2 (youtube). Caso de uso que, en vistas a Microsoft Power Platform Turn a sketch into an app with express design in Power Apps (youtube), podría dar lugar a una pipeline completa de desarrollo web.
VI
«DrawBench Systematically test for: compositionality, cardinality, spatial relations, long-form text, rare words, and challenging prompts that push the limits of models’ ability to generate highly implausible scenes well beyond the scope of the training data.»
Me gusta que se esté trabajando en esta línea, en consonancia con Winoground: Probing Vision and Language Models for Visio-Linguistic Compositionality (arxiv, 7/4/2022).
También me llama la atención su: «Our key discovery is that [...] increasing the size of the language model in Imagen boosts both sample fidelity and image-text alignment much more than increasing the size of the image diffusion model.»
VII
A un nivel más técnico, me ha parecido interesante como combaten el train-test mismatch antes citado:
«We discover that static thresholding is essential to sampling with large guidance weights and prevents generation of blank images. Nonetheless, static thresholding still results in over-saturated and less detailed images as the guidance weight further increases.»
«Dynamic thresholding pushes saturated pixels (those near -1 and 1) inwards, thereby actively preventing pixels from saturation at each step. We find that dynamic thresholding results in significantly better photorealism as well as better image-text alignment, especially when using very large guidance weights.»
También me llama la atención el comentario final (en negrita) en su discusión de la superresolución:
«o upsample a 64 × 64 generated image into a 256 × 256 image, and then to 1024 × 1024 image. Cascaded diffusion models with noise conditioning augmentation [29] have been extremely effective in progressively generating high-fidelity images. Furthermore, making the super-resolution models aware of the amount of noise added, via noise level conditioning, significantly improves the sample quality and helps improving the robustness of the super-resolution models to handle artifacts generated by lower resolution models»
Comentarios
Publicar un comentario
El pudor es un estigma social: descuartizame, y mis manos resquebrajadas te aplaudirn.