Publicidad

Google Lanza Gemini Omni Flash – Generación de vídeo multimodal, edición conversacional y avatares digitales

Google Lanza Gemini Omni Flash - Generación de vídeo multimodal, edición conversacional y avatares digitales

Google ha presentado Gemini Omni Flash, el primer modelo de la nueva familia “Omni”, que convierte cualquier combinación de texto, imagen, audio y vídeo en un clip generado automáticamente y les permite a los usuarios refinar el resultado mediante edición en lenguaje natural. El modelo se lanza hoy para los suscriptores de Google AI Plus, Pro y Ultra a través de la app Gemini y Google Flow, y a partir de esta semana estará disponible de forma gratuita en YouTube Shorts y la app YouTube Create.

Anunciado en Google I/O por Koray Kavukcuoglu, CTO de Google DeepMind y arquitecto jefe de IA, Omni amplía la plataforma de generación de vídeo de la compañía, pasando del enfoque basado en texto e imagen de Veo a un flujo de trabajo multimodal donde se pueden combinar diferentes medios de referencia en una sola solicitud. Google describe el modelo como el punto donde “la capacidad de razonamiento de Gemini se une a la capacidad de creación”, y se prevé que las salidas de imagen y audio se incorporen posteriormente al vídeo.

Para quienes siguen esta categoría, Omni Flash se sitúa junto a Veo 3.1, que Google actualizó a principios de este año con la incorporación de formato vertical nativo, escalado a 4K y una mayor consistencia de caracteres, y la línea de imágenes Gemini más amplia que la compañía ha estado impulsando a través de sus lanzamientos de Nano Banana. Esta vez, la propuesta es diferente a la de las herramientas anteriores: en lugar de tratar la conversión de texto a vídeo y de imagen a vídeo como flujos de trabajo separados, Omni acepta entradas mixtas de forma nativa.

Entradas multimodales como propuesta central

Omni toma imágenes, texto, audio y vídeo como referencias y los combina en una única salida. El usuario puede proporcionar una fotografía fija, un breve clip de referencia para movimiento o iluminación, un archivo de audio para ritmo o ambiente y una descripción escrita, y Omni integrará todo en un mismo vídeo coherente. En su lanzamiento, la entrada de audio se limita a referencias de voz, pero Google aseguró que se añadirán otros tipos de entrada de audio próximamente.

Edición conversacional en múltiples turnos

El segundo pilar es la edición iterativa basada en el lenguaje. Una vez creado un clip, los usuarios pueden refinarlo mediante instrucciones sucesivas en lenguaje natural para cambiar el entorno, el ángulo de la cámara, el estilo o detalles específicos, y se supone que el modelo mantiene la continuidad entre las distintas versiones.

Los ejemplos de Google incluyen indicaciones como: «Cuando la persona toque el espejo, haz que este se ondule suavemente como un líquido, y que el brazo de la persona se convierta en un material reflectante», conservando los personajes y la física de la escena original en las ediciones posteriores. Este enfoque posiciona a Omni más como un compositor conversacional que como un generador de tomas únicas.

Mantener la coherencia entre múltiples ediciones ha sido uno de los puntos débiles persistentes en esta categoría, y Google afirma explícitamente haber avanzado en este aspecto. La promesa de editar vídeo mediante el diálogo con un modelo, con los personajes y la lógica de la escena intactos, resulta muy atractiva si funciona bien en la práctica.

Credit: Google
Crédito: Google

Física, conocimiento del mundo y contenido explicativo

Google también posiciona a Omni como un avance en la plausibilidad física, destacando una mejor gestión de la gravedad, la energía cinética y la dinámica de fluidos. Entre las demostraciones, se incluyen un violinista interpretando una pieza, una canica rodando por una pista de reacción en cadena y una explicación sobre el plegamiento de proteínas en stop-motion, al estilo de animación con plastilina.

El modelo también se apoya en la base de conocimientos más amplia de Gemini que, según Google, le permite generar vídeos explicativos con fundamentos fácticos en lugar de basarse únicamente en patrones. Para los cineastas de documentales y ámbitos educativos, esta es la afirmación más interesante, aunque es una capacidad que requiere un análisis detallado caso por caso. Las imágenes con un aspecto plausible pero con errores sutiles en los hechos, son peores que las imágenes obviamente sintéticas.

Avatares digitales y la cuestión del audio

Una incorporación interesante son los Avatares, que les permiten a los usuarios crear una versión digital de sí mismos que puede generar vídeos con su propia voz. Google afirma que aún está trabajando en cómo ofrecer a los usuarios capacidades más amplias de edición de audio y voz (específicamente, editar el audio dentro de un video existente) de manera responsable, y que estas funciones aún no están habilitadas.

Este enfoque contrasta con algunos competidores. La capacidad de alterar el diálogo en un clip existente es precisamente en donde las herramientas de video con IA se vuelven peligrosas en contextos editoriales y políticos, y la decisión de Google de no habilitar esta capacidad, al menos por ahora, refleja una comprensión del terreno al que la industria se ha visto obligada a enfrentarse.

SynthID by Google
SynthID de Google.

Marca de agua y procedencia

Cada video generado por Omni lleva una marca de agua digital SynthID, que Google ha estado integrando en toda su producción de medios generativos, incluyendo Veo y Lyria. La marca de agua se puede verificar a través de la aplicación Gemini, Gemini en Chrome y la Búsqueda de Google.

Las herramientas de procedencia son más importantes que nunca tras la reacción negativa generalizada en Hollywood a principios de este año contra Seedance 2.0 de ByteDance, después de que se crearan vídeos protagonizados por Tom Cruise, Brad Pitt y otros actores de primera línea que se viralizaron a las pocas horas del lanzamiento de ese modelo. SAG-AFTRA, la Motion Picture Association y Disney condenaron el modelo y las prácticas que permitía. Desde entonces, la presión sobre todos los proveedores para que incluyan marcas de agua verificables ha aumentado de forma drástica, y Google está claramente posicionando a Omni en el lado ético dentro de este debate.

¿Qué implica esto para los cineastas profesionales?

Para los profesionales, la cuestión no radica tanto en si Omni puede producir un vídeo impactante a partir de una idea creativa, sino en si se integra en un flujo de trabajo de producción real. Google Flow, el espacio de trabajo creativo más amplio de la compañía, basado en sus modelos de vídeo y utilizado en proyectos como la colaboración de Darren Aronofsky con DeepMind en Primordial Soup el año pasado, es el punto de integración para los suscriptores de pago. La estrategia de agrupar la generación de vídeo, la generación de imágenes y ahora la edición multimodal bajo un mismo modelo de pago es totalmente evidente.

Para los creadores de contenido breve en YouTube Shorts y la aplicación YouTube Create, el acceso gratuito cambia las reglas del juego y casi con seguridad generará un volumen sustancial de contenido creado con Omni en las próximas semanas. Para trabajos narrativos y comerciales, la prueba más importante es si el modelo de edición conversacional puede mantener la coherencia el tiempo suficiente para ser útil en previsualizaciones, referencias de ambiente o inserciones estilizadas, áreas donde las herramientas de vídeo con IA han comenzado a consolidarse.

También cabe destacar la posición de Google en el panorama competitivo. El ritmo se ha acelerado drásticamente; Kling 3.0 introdujo la resolución 4K nativa y la secuenciación de múltiples tomas en febrero, y Seedance 2.0 llegó al mercado ese mismo mes con resultados fotorrealistas que provocaron la reacción de Hollywood que hemos descrito. El manejo de entradas multimodales es uno de los pocos ejes diferenciadores que quedan en esta carrera, y ahí parece estar Google apostando por Omni.

¿Crees que las entradas multimodales cambiarán la forma en que trabajas con vídeo con IA, o se trata de otro ciclo de demostración impresionante? ¡Cuéntanos tu opinión en los comentarios!

Leave a reply

Filtro:
Todo
Ordenar por:
latest
Filtro:
Todo
Ordenar por:
latest