0Pricing
AI Agents · Lekcja

Agenci multimodalni (wizja + głos + działanie)

Agenci, którzy widzą ekrany, słyszą mowę i działają w świecie fizycznym lub cyfrowym — kolejny przełomowy kierunek.

Agenci multimodalni (wizja + głos + działanie) to bezpłatna lekcja AI Agents na CoddyKit. To lekcja 3 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej AI Agents, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs AI Agents zawiera 4 lekcji w sumie.

Poza tekstem

Nowoczesni agenci coraz częściej są multimodalni:

  • Wizja — widzenie ekranów, obrazów i filmów
  • Głos — rozmowa ze słuchaniem użytkowników
  • Działanie — sterowanie przeglądarkami, robotami i interfejsami graficznymi

Agenci wizyjni

Omówiliśmy to w Kursie 24. Podsumowanie:

  • GPT-4o, Claude Sonnet 4.5 i Gemini do rozumienia ekranów
  • Adnotacje SoM zapewniające niezawodną interakcję
  • Computer Use do kompleksowego sterowania komputerem

Agenci głosowi

OpenAI Realtime API, Anthropic / Claude voice oraz ElevenLabs Conversational AI umożliwiają budowanie agentów obsługujących wejście i wyjście głosowe:

# OpenAI Realtime API (WebSocket)
import websockets, json

async def main():
    async with websockets.connect('wss://api.openai.com/v1/realtime?model=gpt-4o-realtime-preview') as ws:
        await ws.send(json.dumps({'type': 'response.create', 'response': {'modalities': ['audio'], 'instructions': 'Greet the user'}}))
        async for msg in ws:
            event = json.loads(msg)
            if event['type'] == 'response.audio.delta':
                play_audio(event['delta'])

Docelowe opóźnienie głosu

Rozmowa głosowa wymaga odpowiedzi w czasie krótszym niż 500 ms, aby brzmieć naturalnie. Strategie:

  • Strumieniowanie ASR + TTS
  • Pomijanie modeli rozumujących
  • Buforowanie często używanych fraz
  • Używanie lekkich modeli

Głos + użycie narzędzi

Agenci głosowi również mogą korzystać z narzędzi — interfejsy Realtime API obsługują wywoływanie funkcji. Przykład: „Dodaj mleko do mojej listy zakupów” -> agent wywołuje add_to_list.

Działanie: przeglądarka / komputer

Omówiliśmy to już w Kursie 24. Computer Use firmy Anthropic, Operator firmy OpenAI oraz OpenInterpreter pozwalają agentom sterować prawdziwym komputerem.

Działanie: robotyka

Agenci ucieleśnieni to kolejna granica rozwoju. Google RT-2, Figure 02 i NVIDIA GR00T integrują VLM-y ze sterowaniem robotami. To wciąż głównie obszar badań; jak dotąd niewiele rozwiązań wdrożono produkcyjnie.

Rozumienie wideo

Gemini i GPT-4o przyjmują wideo jako dane wejściowe. Zastosowania:

  • Podsumowania nagrań z monitoringu
  • Wyodrębnianie przepisów z filmów kulinarnych
  • Analiza sportowa
  • Podsumowywanie spotkań na podstawie nagrań

Generowanie obrazów jako narzędzie

Modele dyfuzyjne (DALL-E 3, Imagen, Stable Diffusion) stają się narzędziami, które agent może wywoływać:

tools = [{'name': 'generate_image', 'description': 'Generate an image from a prompt', 'parameters': {'prompt': {'type': 'string'}}}]

Rozumowanie między modalnościami

Agenci łączący różne modalności: „Obejrzyj ten wykres, przepisz te notatki i przygotuj podsumowanie w wiadomości e-mail”. Każda modalność pełni określoną rolę.

OpenAI Realtime Toolkit

OpenAI udostępnia open-source'owy Realtime Agent SDK wraz z przykładami. To dobry punkt wyjścia, jeśli celem jest tworzenie agentów głosowych.

Pipecat i LiveKit Agents

Open-source'owe frameworki do tworzenia agentów głosowych i wideo działających przez WebRTC. Korzysta z nich wiele startupów budujących asystentów w stylu Alexy.

Prywatność w systemach multimodalnych

Dźwięk i obraz zawierają bardzo dużo danych osobowych (PII). Należy szyfrować dane w spoczynku, usuwać dane wrażliwe z transkrypcji i udostępniać użytkownikom przyciski usuwania danych. Biometria głosu może wymagać zgody zgodnej z art. 9 RODO.

Modele zoptymalizowane pod kątem opóźnień

W przypadku agentów głosowych i wideo należy wybierać najszybsze modele (Groq Llama 3.1, GPT-4o-realtime, Gemini Flash) i pomijać modele rozumujące na ścieżce krytycznej.

Era inteligentnych okularów

Meta Ray-Ban, Apple Vision Pro i inne urządzenia ubieralne wprowadzają multimodalnych agentów działających zawsze w tle. To kolejna konsumencka kategoria rozwiązań opartych na ambient AI.

Opóźnienie głosowe

Jaki jest typowy docelowy poziom opóźnienia w konwersacyjnych agentach głosowych?

Podsumowanie

Wizja (ekrany, obrazy, wideo), głos (konwersacja), działanie (przeglądarki, komputery, roboty). Łączenie modalności pozwala tworzyć bogatszych agentów. Należy uwzględniać opóźnienia, prywatność i koszty.

Często zadawane pytania

Czy lekcja „Agenci multimodalni (wizja + głos + działanie)” jest bezpłatna?

Tak — pełny tekst „Agenci multimodalni (wizja + głos + działanie)” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu AI Agents, przejdź na CoddyKit PRO. Kurs AI Agents zawiera 4 lekcji w sumie.

Co nauczysz się w „Agenci multimodalni (wizja + głos + działanie)”?

Agenci, którzy widzą ekrany, słyszą mowę i działają w świecie fizycznym lub cyfrowym — kolejny przełomowy kierunek. Ćwiczysz AI Agents z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.

Czy potrzebuję doświadczenia, aby zacząć AI Agents?

Nie wymagamy żadnego doświadczenia. AI Agents w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 3 z 4.

Ile czasu zajmuje lekcja „Agenci multimodalni (wizja + głos + działanie)”?

Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.

Czy mogę pisać i uruchamiać kod w tej lekcji AI Agents?

Tak. Każda lekcja AI Agents zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.

Wszystkie lekcje w tym kursie

  1. Rozumowanie agentowe (o1, o3, modele rozumujące)
  2. Hybrydowi agenci symboliczno-neuronowi
  3. Agenci multimodalni (wizja + głos + działanie)
  4. Nierozwiązane problemy: odporność, zgodność, pamięć długoterminowa
← Powrót do AI Agents