Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Temario del curso
Introducción a la Multimodalidad de Gemini 3
- Capacidades en texto, imágenes, audio y video
- Selección de modelos y resumen de endpoints
- Conceptos clave en razonamiento multimodal
Trabajo con Texto y Entradas Estructuradas
- Estrategias de prompting para generación de texto
- Metadatos, ventanas de contexto y embeddings
- Orquestación basada en texto de tareas multimodales
Comprensión de Imágenes y Flujos de Trabajo Visuales
- Análisis e interpretación de imágenes con Gemini 3
- Creación de herramientas de búsqueda visual y etiquetado
- Construcción de interacciones de imagen a texto y texto a imagen
Procesamiento de Entradas de Audio
- Flujos de trabajo de reconocimiento de voz y transcripción
- Detección e interpretación de eventos de audio
- Integración de audio con entradas de texto y visuales
Inteligencia de Video y Análisis de Escenas
- Razonamiento de video cuadro a cuadro y continuo
- Creación de herramientas de resumenes y extracción de momentos destacados
- Automatización y flujos de trabajo de contenido basados en video
Diseño de Arquitecturas de Aplicaciones Multimodales
- Combinación de múltiples tipos de entrada en un solo pipeline
- Consideraciones de latencia, costo y recursos computacionales
- Mejores prácticas para sistemas multimodales escalables
Prototipado de Aplicaciones Multimodales
- Creación práctica (hands-on) de prototipos multimodales
- Iteración rápida con ingeniería de prompts
- Pruebas y refinamiento de flujos de experiencia de usuario
Despliegue de Soluciones Multimodales
- Estrategias de despliegue y configuración del entorno
- Monitoreo del rendimiento en entornos reales
- Consideraciones de seguridad y cumplimiento normativo
Resumen y Próximos Pasos
Requerimientos
- Comprensión de los conceptos modernos de IA
- Experiencia con Python o JavaScript
- Familiaridad con APIs REST
Público Objetivo
- Diseñadores
- Creators de contenido
- Equipos técnicos de producto
14 Horas
Reseñas (1)
Flujo, vibra y tema en la presentación
Lukasz Kowalczyk - Allegro Sp. z o.o.
Curso - Google Gemini AI for Data Analysis
Traducción Automática