Agenci multimodalni (wizja + głos + działanie)
Agenci, którzy widzą ekrany, słyszą mowę i działają w świecie fizycznym lub cyfrowym — kolejny przełomowy kierunek.
Agenci multimodalni (wizja + głos + działanie) to bezpłatna lekcja AI Agents na CoddyKit. To lekcja 3 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej AI Agents, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs AI Agents zawiera 4 lekcji w sumie.
Poza tekstem
Nowoczesni agenci coraz częściej są multimodalni:
- Wizja — widzenie ekranów, obrazów i filmów
- Głos — rozmowa ze słuchaniem użytkowników
- Działanie — sterowanie przeglądarkami, robotami i interfejsami graficznymi
Agenci wizyjni
Omówiliśmy to w Kursie 24. Podsumowanie:
- GPT-4o, Claude Sonnet 4.5 i Gemini do rozumienia ekranów
- Adnotacje SoM zapewniające niezawodną interakcję
- Computer Use do kompleksowego sterowania komputerem
Agenci głosowi
OpenAI Realtime API, Anthropic / Claude voice oraz ElevenLabs Conversational AI umożliwiają budowanie agentów obsługujących wejście i wyjście głosowe:
# OpenAI Realtime API (WebSocket)
import websockets, json
async def main():
async with websockets.connect('wss://api.openai.com/v1/realtime?model=gpt-4o-realtime-preview') as ws:
await ws.send(json.dumps({'type': 'response.create', 'response': {'modalities': ['audio'], 'instructions': 'Greet the user'}}))
async for msg in ws:
event = json.loads(msg)
if event['type'] == 'response.audio.delta':
play_audio(event['delta'])Docelowe opóźnienie głosu
Rozmowa głosowa wymaga odpowiedzi w czasie krótszym niż 500 ms, aby brzmieć naturalnie. Strategie:
- Strumieniowanie ASR + TTS
- Pomijanie modeli rozumujących
- Buforowanie często używanych fraz
- Używanie lekkich modeli
Głos + użycie narzędzi
Agenci głosowi również mogą korzystać z narzędzi — interfejsy Realtime API obsługują wywoływanie funkcji. Przykład: „Dodaj mleko do mojej listy zakupów” -> agent wywołuje add_to_list.
Działanie: przeglądarka / komputer
Omówiliśmy to już w Kursie 24. Computer Use firmy Anthropic, Operator firmy OpenAI oraz OpenInterpreter pozwalają agentom sterować prawdziwym komputerem.
Działanie: robotyka
Agenci ucieleśnieni to kolejna granica rozwoju. Google RT-2, Figure 02 i NVIDIA GR00T integrują VLM-y ze sterowaniem robotami. To wciąż głównie obszar badań; jak dotąd niewiele rozwiązań wdrożono produkcyjnie.
Rozumienie wideo
Gemini i GPT-4o przyjmują wideo jako dane wejściowe. Zastosowania:
- Podsumowania nagrań z monitoringu
- Wyodrębnianie przepisów z filmów kulinarnych
- Analiza sportowa
- Podsumowywanie spotkań na podstawie nagrań
Generowanie obrazów jako narzędzie
Modele dyfuzyjne (DALL-E 3, Imagen, Stable Diffusion) stają się narzędziami, które agent może wywoływać:
tools = [{'name': 'generate_image', 'description': 'Generate an image from a prompt', 'parameters': {'prompt': {'type': 'string'}}}]Rozumowanie między modalnościami
Agenci łączący różne modalności: „Obejrzyj ten wykres, przepisz te notatki i przygotuj podsumowanie w wiadomości e-mail”. Każda modalność pełni określoną rolę.
OpenAI Realtime Toolkit
OpenAI udostępnia open-source'owy Realtime Agent SDK wraz z przykładami. To dobry punkt wyjścia, jeśli celem jest tworzenie agentów głosowych.
Pipecat i LiveKit Agents
Open-source'owe frameworki do tworzenia agentów głosowych i wideo działających przez WebRTC. Korzysta z nich wiele startupów budujących asystentów w stylu Alexy.
Prywatność w systemach multimodalnych
Dźwięk i obraz zawierają bardzo dużo danych osobowych (PII). Należy szyfrować dane w spoczynku, usuwać dane wrażliwe z transkrypcji i udostępniać użytkownikom przyciski usuwania danych. Biometria głosu może wymagać zgody zgodnej z art. 9 RODO.
Modele zoptymalizowane pod kątem opóźnień
W przypadku agentów głosowych i wideo należy wybierać najszybsze modele (Groq Llama 3.1, GPT-4o-realtime, Gemini Flash) i pomijać modele rozumujące na ścieżce krytycznej.
Era inteligentnych okularów
Meta Ray-Ban, Apple Vision Pro i inne urządzenia ubieralne wprowadzają multimodalnych agentów działających zawsze w tle. To kolejna konsumencka kategoria rozwiązań opartych na ambient AI.
Opóźnienie głosowe
Jaki jest typowy docelowy poziom opóźnienia w konwersacyjnych agentach głosowych?
Podsumowanie
Wizja (ekrany, obrazy, wideo), głos (konwersacja), działanie (przeglądarki, komputery, roboty). Łączenie modalności pozwala tworzyć bogatszych agentów. Należy uwzględniać opóźnienia, prywatność i koszty.
Często zadawane pytania
Czy lekcja „Agenci multimodalni (wizja + głos + działanie)” jest bezpłatna?
Tak — pełny tekst „Agenci multimodalni (wizja + głos + działanie)” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu AI Agents, przejdź na CoddyKit PRO. Kurs AI Agents zawiera 4 lekcji w sumie.
Co nauczysz się w „Agenci multimodalni (wizja + głos + działanie)”?
Agenci, którzy widzą ekrany, słyszą mowę i działają w świecie fizycznym lub cyfrowym — kolejny przełomowy kierunek. Ćwiczysz AI Agents z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.
Czy potrzebuję doświadczenia, aby zacząć AI Agents?
Nie wymagamy żadnego doświadczenia. AI Agents w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 3 z 4.
Ile czasu zajmuje lekcja „Agenci multimodalni (wizja + głos + działanie)”?
Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.
Czy mogę pisać i uruchamiać kod w tej lekcji AI Agents?
Tak. Każda lekcja AI Agents zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.
Wszystkie lekcje w tym kursie
- Rozumowanie agentowe (o1, o3, modele rozumujące)
- Hybrydowi agenci symboliczno-neuronowi
- Agenci multimodalni (wizja + głos + działanie)
- Nierozwiązane problemy: odporność, zgodność, pamięć długoterminowa