Agen Multimodal (Visi + Suara + Tindakan)
Agen yang dapat melihat layar, mendengar ucapan, dan bertindak di dunia fisik atau digital — garda depan berikutnya.
Agen Multimodal (Visi + Suara + Tindakan) adalah pelajaran AI Agents gratis di CoddyKit. Ini adalah pelajaran 3 dari 4. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar AI Agents, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus AI Agents mencakup 4 pelajaran total.
Melampaui Teks
Agen modern semakin multimodal:
- Penglihatan — melihat layar, gambar, dan video
- Suara — berbicara dan mendengarkan pengguna
- Tindakan — mengendalikan peramban, robot, dan GUI
Agen Penglihatan
Kita telah membahasnya di Kursus 24. Ringkasannya:
- GPT-4o, Claude Sonnet 4.5, Gemini untuk memahami layar
- Anotasi SoM untuk interaksi yang andal
- Computer Use untuk mengendalikan komputer desktop secara menyeluruh
Agen Suara
OpenAI Realtime API, suara Anthropic / Claude, dan ElevenLabs Conversational AI memungkinkan Anda membangun agen dengan masukan dan keluaran suara:
# OpenAI Realtime API (WebSocket)
import websockets, json
async def main():
async with websockets.connect('wss://api.openai.com/v1/realtime?model=gpt-4o-realtime-preview') as ws:
await ws.send(json.dumps({'type': 'response.create', 'response': {'modalities': ['audio'], 'instructions': 'Greet the user'}}))
async for msg in ws:
event = json.loads(msg)
if event['type'] == 'response.audio.delta':
play_audio(event['delta'])Target Latensi Suara
Percakapan suara memerlukan respons di bawah 500 md agar terasa alami. Strateginya:
- Pengaliran ASR + TTS
- Lewati model yang melakukan penalaran
- Simpan frasa umum dalam cache
- Gunakan model ringan
Suara + Penggunaan Alat
Agen suara juga dapat menggunakan alat — API Realtime mendukung pemanggilan fungsi. Bayangkan: "Tambahkan susu ke daftar belanja saya" -> agen memanggil add_to_list.
Tindakan: Peramban / Penggunaan Komputer
Kita telah membahasnya di Kursus 24. Computer Use dari Anthropic, Operator dari OpenAI, dan OpenInterpreter memungkinkan agen mengendalikan mesin nyata.
Tindakan: Robotika
Agen berwujud adalah batas terdepan berikutnya. Google RT-2, Figure 02, dan NVIDIA GR00T mengintegrasikan model visi-bahasa dengan kendali robot. Saat ini masih terutama dalam tahap riset; baru sedikit yang diterapkan di produksi.
Pemahaman Video
Gemini dan GPT-4o menerima video. Kasus penggunaannya:
- Ringkasan pengawasan
- Ekstraksi resep dari video memasak
- Analitik olahraga
- Perangkumaan rapat dari rekaman
Pembuatan Gambar sebagai Alat
Model difusi (DALL-E 3, Imagen, Stable Diffusion) menjadi alat yang dapat dipanggil agen:
tools = [{'name': 'generate_image', 'description': 'Generate an image from a prompt', 'parameters': {'prompt': {'type': 'string'}}}]Penalaran Lintas Modalitas
Agen yang menggabungkan berbagai modalitas: "Lihat bagan ini, transkripsikan catatan tersebut, lalu buat draf ringkasan email." Setiap modalitas memiliki perannya sendiri.
Perangkat Pengembangan Waktu Nyata OpenAI
OpenAI menyediakan SDK Agen Waktu Nyata sumber terbuka beserta berbagai contoh. Ini merupakan titik awal yang baik jika tujuan Anda adalah membuat agen suara.
Agen Pipecat dan LiveKit
Kerangka kerja sumber terbuka untuk agen suara/video melalui WebRTC. Banyak perusahaan rintisan menggunakannya untuk membuat asisten bergaya Alexa.
Privasi dalam Sistem Multimodal
Audio dan video mengandung banyak PII. Enkripsikan saat tersimpan, hapus informasi sensitif dari transkrip, dan berikan pengguna tombol delete. Biometrik suara mungkin memerlukan persetujuan berdasarkan Pasal 9 GDPR.
Model Berdasarkan Tingkat Latensi
Untuk agen suara/video, pilih model yang paling cepat (Groq Llama 3.1, GPT-4o-realtime, Gemini Flash) dan jangan gunakan model penalaran pada jalur kritis.
Era Kacamata Pintar
Meta Ray-Ban, Apple Vision Pro, dan perangkat sandang lainnya menghadirkan agen multimodal yang selalu aktif. Inilah kategori konsumen berikutnya untuk AI ambient.
Latensi Suara
Berapa target latensi yang biasanya ditetapkan untuk agen suara percakapan?
Ringkasan
Penglihatan (layar, gambar, video), suara (percakapan), tindakan (peramban, komputer, robot). Gabungkan berbagai modalitas untuk menghasilkan agen yang lebih kaya. Perhatikan latensi, privasi, dan biaya.
Pertanyaan yang Sering Diajukan
Apakah pelajaran “Agen Multimodal (Visi + Suara + Tindakan)” gratis?
Ya — teks lengkap “Agen Multimodal (Visi + Suara + Tindakan)” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus AI Agents, upgrade ke CoddyKit PRO. Kursus AI Agents mencakup 4 pelajaran total.
Apa yang akan aku pelajari di “Agen Multimodal (Visi + Suara + Tindakan)”?
Agen yang dapat melihat layar, mendengar ucapan, dan bertindak di dunia fisik atau digital — garda depan berikutnya. Kamu berlatih AI Agents dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.
Apakah aku perlu pengalaman untuk memulai AI Agents?
Tidak diperlukan pengalaman sebelumnya. AI Agents di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 3 dari 4.
Berapa lama pelajaran “Agen Multimodal (Visi + Suara + Tindakan)” memakan waktu?
Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.
Bisakah aku menulis dan menjalankan kode dalam pelajaran AI Agents ini?
Ya. Setiap pelajaran AI Agents menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.
Semua pelajaran dalam kursus ini
- Penalaran Agentik (o1, o3, Model Penalaran)
- Agen Simbolis + Neural Hibrida
- Agen Multimodal (Visi + Suara + Tindakan)
- Masalah Terbuka: Ketangguhan, Keselarasan, Memori Jangka Panjang