Dziękujemy za wysłanie zapytania! Jeden z członków naszego zespołu skontaktuje się z Państwem wkrótce.
Dziękujemy za wysłanie rezerwacji! Jeden z członków naszego zespołu skontaktuje się z Państwem wkrótce.
Plan Szkolenia
Wprowadzenie do multimodalności Gemini 3
- Możliwości w zakresie tekstu, obrazów, audio i wideo
- Wybór modelu i przegląd punktów końcowych
- Kluczowe koncepcje wnioskowania multimodalnego
Praca z tekstem i danymi wejściowymi ustrukturyzowanymi
- Strategie promptowania do generowania tekstu
- Metadane, okna kontekstowe i osadzenia
- Oparta na tekście orkiestracja zadań multimodalnych
Rozumienie obrazów i przepływy pracy wizualnej
- Analiza i interpretacja obrazów z Gemini 3
- Tworzenie narzędzi do wyszukiwania wizualnego i tagowania
- Budowanie interakcji obraz-tekst i tekst-obraz
Przetwarzanie danych wejściowych audio
- Przepływy pracy rozpoznawania mowy i transkrypcji
- Wykrywanie i interpretacja zdarzeń dźwiękowych
- Integracja audio z danymi wejściowymi tekstowymi i wizualnymi
Inteligencja wideo i analiza scen
- Wnioskowanie klatka po klatce i ciągłe wnioskowanie wideo
- Budowanie narzędzi do podsumowywania i wyodrębniania najważniejszych momentów
- Automatyzacja oparta na wideo i przepływy pracy z treścią
Projektowanie architektur aplikacji multimodalnych
- Łączenie wielu typów danych wejściowych w jednym potoku
- Zagadnienia opóźnień, kosztów i obliczeń
- Najlepsze praktyki dla skalowalnych systemów multimodalnych
Prototypowanie aplikacji multimodalnych
- Praktyczne tworzenie prototypów multimodalnych
- Szybkie iteracje z inżynierią promptów
- Testowanie i udoskonalanie przepływów doświadczeń użytkowników
Wdrażanie rozwiązań multimodalnych
- Strategie wdrażania i konfiguracja środowiska
- Monitorowanie wydajności w warunkach rzeczywistych
- Zagadnienia bezpieczeństwa i zgodności
Podsumowanie i kolejne kroki
Wymagania
- Zrozumienie nowoczesnych koncepcji AI
- Doświadczenie w Pythonie lub JavaScripcie
- Znajomość interfejsów API REST
Grupa docelowa
- Projektanci
- Twórcy treści
- Techniczne zespoły produktowe
14 godzin
Opinie uczestników (1)
Przepływ, energia i tematyka prezentacji
Lukasz Kowalczyk - Allegro Sp. z o.o.
Szkolenie - Google Gemini AI for Data Analysis
Przetłumaczone przez sztuczną inteligencję