Ejen AI · Pelajaran

Ejen Multimodal (Penglihatan + Suara + Tindakan)

Ejen yang melihat skrin, mendengar pertuturan dan bertindak dalam dunia fizikal atau digital — sempadan penerokaan seterusnya.

Pelajaran 3 daripada 417 langkah

Ejen Multimodal (Penglihatan + Suara + Tindakan) ialah pelajaran Ejen AI percuma di CoddyKit. Ini ialah pelajaran 3 daripada 4. Anda boleh membaca keseluruhan pelajaran di bawah secara percuma — kemudian berlatih secara praktikal dalam pelayar menggunakan penyunting kod terbina dalam dan tutor kecerdasan buatan 24/7. Pelajaran ini merupakan sebahagian daripada laluan pembelajaran Ejen AI, dan kemajuan anda disegerakkan merentas web serta aplikasi CoddyKit. Kursus Ejen AI merangkumi sejumlah 4 pelajaran.

Di Luar Teks

Ejen moden semakin multimodal:

  • Penglihatan — melihat skrin, imej, video
  • Suara — bercakap dengan pengguna dan mendengar mereka
  • Tindakan — mengawal pelayar, robot, GUI

Ejen Penglihatan

Kita telah membincangkan perkara ini dalam Kursus 24. Imbas kembali:

  • GPT-4o, Claude Sonnet 4.5, Gemini untuk memahami skrin
  • Anotasi SoM untuk interaksi yang boleh dipercayai
  • Computer Use untuk kawalan desktop hujung ke hujung

Ejen Suara

OpenAI Realtime API, suara Anthropic / Claude dan ElevenLabs Conversational AI membolehkan Anda membina ejen suara masuk/suara keluar:

# OpenAI Realtime API (WebSocket)
import websockets, json

async def main():
    async with websockets.connect('wss://api.openai.com/v1/realtime?model=gpt-4o-realtime-preview') as ws:
        await ws.send(json.dumps({'type': 'response.create', 'response': {'modalities': ['audio'], 'instructions': 'Greet the user'}}))
        async for msg in ws:
            event = json.loads(msg)
            if event['type'] == 'response.audio.delta':
                play_audio(event['delta'])

Sasaran Kependaman Suara

Suara perbualan memerlukan respons bawah 500ms, jika tidak, ia terasa tidak semula jadi. Strategi:

  • ASR + TTS secara penstriman
  • Langkau model pemikiran
  • Cache frasa yang biasa
  • Gunakan model ringan

Suara + Penggunaan Alat

Ejen suara juga boleh menggunakan alat — API masa nyata menyokong panggilan fungsi. Bayangkan: "Tambah susu ke senarai beli-belah saya" -> ejen memanggil tambah_ke_senarai.

Tindakan: Pelayar / Penggunaan Komputer

Perkara ini telah dibincangkan dalam Kursus 24. Computer Use Anthropic, Operator OpenAI dan OpenInterpreter semuanya membolehkan ejen mengawal mesin sebenar.

Tindakan: Robotik

Ejen berjasad ialah barisan hadapan seterusnya. Google RT-2, Figure 02 dan NVIDIA GR00T mengintegrasikan VLM dengan kawalan robot. Masih kebanyakannya dalam penyelidikan; hanya sedikit yang digunakan dalam pengeluaran setakat ini.

Pemahaman Video

Gemini dan GPT-4o menerima video. Kes penggunaan:

  • Ringkasan pengawasan
  • Pengekstrakan resipi daripada video memasak
  • Analitik sukan
  • Ringkasan mesyuarat daripada rakaman

Penjanaan Imej sebagai Alat

Model resapan (DALL-E 3, Imagen, Stable Diffusion) menjadi alat yang boleh dipanggil oleh ejen:

tools = [{'name': 'generate_image', 'description': 'Generate an image from a prompt', 'parameters': {'prompt': {'type': 'string'}}}]

Penaakulan Rentas Modaliti

Ejen yang menggabungkan pelbagai modaliti: "Lihat carta ini, transkripsikan nota ini, dan sediakan ringkasan e-mel." Setiap modaliti memainkan peranan.

Kit Alat Masa Nyata OpenAI

OpenAI menyediakan SDK Ejen Masa Nyata sumber terbuka berserta contoh. Ini merupakan titik permulaan yang baik jika matlamat anda ialah membina ejen suara.

Ejen Pipecat dan LiveKit

Rangka kerja sumber terbuka untuk ejen suara dan video melalui WebRTC. Banyak syarikat pemula menggunakannya untuk membina pembantu seperti Alexa.

Privasi dalam Sistem Pelbagai Mod

Audio dan video mengandungi banyak PII. Sulitkan data semasa disimpan, padamkan maklumat pengenalan daripada transkrip, dan sediakan butang delete kepada pengguna. Biometrik suara mungkin memerlukan persetujuan berdasarkan Artikel 9 GDPR.

Model Mengikut Tahap Kependaman

Untuk ejen suara dan video, utamakan model yang paling pantas (Groq Llama 3.1, GPT-4o-realtime, Gemini Flash) dan elakkan model penaakulan pada laluan kritikal.

Era Cermin Mata Pintar

Meta Ray-Ban, Apple Vision Pro dan peranti boleh pakai lain sedang membawa ejen pelbagai mod yang sentiasa aktif kepada pengguna. Ini ialah kategori pengguna seterusnya untuk AI persekitaran.

Kependaman Suara

Apakah sasaran kependaman biasa untuk ejen suara perbualan?

Rumusan

Penglihatan (skrin, imej, video), suara (perbualan), dan tindakan (pelayar, komputer, robot). Gabungkan modaliti untuk menghasilkan ejen yang lebih kaya. Beri perhatian kepada kependaman, privasi dan kos.

Percuma untuk bermula

Pelajari Ejen AI dengan tutor kecerdasan buatan — percuma

Tulis dan jalankan kod sebenar dalam pelayar anda, dapatkan bantuan segera daripada tutor kecerdasan buatan yang tersedia 24/7, dan sambung semula dari tempat anda berhenti di web atau dalam aplikasi.

Kursus
60
Pelajaran
239

Soalan Lazim

Adakah pelajaran “Ejen Multimodal (Penglihatan + Suara + Tindakan)” percuma?

Ya — teks penuh “Ejen Multimodal (Penglihatan + Suara + Tindakan)” boleh dibaca secara percuma di web ini. Untuk berlatih secara interaktif menggunakan penyunting kod terbina dalam dan tutor kecerdasan buatan 24/7, serta membuka kunci baki kursus Ejen AI, tingkat taraf kepada CoddyKit PRO. Kursus Ejen AI merangkumi sejumlah 4 pelajaran.

Apakah yang akan saya pelajari dalam “Ejen Multimodal (Penglihatan + Suara + Tindakan)”?

Ejen yang melihat skrin, mendengar pertuturan dan bertindak dalam dunia fizikal atau digital — sempadan penerokaan seterusnya. Anda berlatih Ejen AI menggunakan kod praktikal yang dijalankan terus dalam pelayar, manakala tutor kecerdasan buatan 24/7 menjawab soalan anda semasa anda mengikuti pelajaran.

Adakah saya memerlukan pengalaman untuk memulakan Ejen AI?

Tiada pengalaman terdahulu diperlukan. Pembelajaran Ejen AI di CoddyKit disusun untuk pelajar daripada peringkat pemula hingga lanjutan, jadi anda boleh bermula di sini atau dari awal dan belajar mengikut kadar anda sendiri. Ini ialah pelajaran 3 daripada 4.

Berapa lamakah pelajaran “Ejen Multimodal (Penglihatan + Suara + Tindakan)” diambil?

Kebanyakan pelajaran CoddyKit mengambil masa kira-kira 5–10 minit. Setiap pelajaran ringkas dan interaktif, jadi anda boleh membuat kemajuan secara berterusan dan menyambung tepat dari tempat anda berhenti di web atau aplikasi.

Bolehkah saya menulis dan menjalankan kod dalam pelajaran Ejen AI ini?

Ya. Setiap pelajaran Ejen AI menyertakan penyunting kod terbina dalam, jadi anda boleh menulis dan menjalankan kod sebenar terus dalam pelayar serta menerima maklum balas kecerdasan buatan serta-merta — tanpa memerlukan persediaan setempat.

Semua pelajaran dalam kursus ini

  1. Penaakulan Berasaskan Ejen (o1, o3, Model Penaakulan)
  2. Ejen Simbolik + Neural Hibrid
  3. Ejen Multimodal (Penglihatan + Suara + Tindakan)
  4. Masalah Terbuka: Keteguhan, Penjajaran, Memori Jangka Panjang
← Kembali ke Ejen AI