Kejuruteraan Gesaan & Pengoptimuman LLM untuk Pembangun · Pelajaran

Sistem Maklum Balas Manusia dalam Gelung

Reka bentuk dan laksanakan sistem yang menyepadukan maklum balas manusia untuk meningkatkan prestasi LLM secara berterusan serta membetulkan ralat.

Pelajaran 2 daripada 411 langkah

Sistem Maklum Balas Manusia dalam Gelung ialah pelajaran Kejuruteraan Gesaan & Pengoptimuman LLM untuk Pembangun percuma di CoddyKit. Ini ialah pelajaran 2 daripada 4. Anda boleh membaca keseluruhan pelajaran di bawah secara percuma — kemudian berlatih secara praktikal dalam pelayar menggunakan penyunting kod terbina dalam dan tutor kecerdasan buatan 24/7. Pelajaran ini merupakan sebahagian daripada laluan pembelajaran Kejuruteraan Gesaan & Pengoptimuman LLM untuk Pembangun, dan kemajuan anda disegerakkan merentas web serta aplikasi CoddyKit. Kursus Kejuruteraan Gesaan & Pengoptimuman LLM untuk Pembangun merangkumi sejumlah 4 pelajaran.

Apakah Maksud Manusia dalam Gelung?

Apabila bekerja dengan Model Bahasa Besar (LLM), kadangkala outputnya tidak begitu tepat. Di sinilah sistem Manusia dalam Gelung (HITL) digunakan.

HITL bermaksud manusia menyemak, membetulkan atau memberikan maklum balas secara aktif terhadap output LLM. Maklum balas ini kemudiannya membantu model belajar dan bertambah baik dari semasa ke semasa, menjadikannya lebih pintar dan boleh dipercayai.

Mengapa Manusia Membantu LLM

Malah LLM yang berkuasa mempunyai batasan. LLM boleh:

  • Mengalami halusinasi: Mereka-reka fakta.
  • Bersikap berat sebelah: Mencerminkan kecenderungan berat sebelah daripada data latihan.
  • Kekurangan maklumat terkini: Tidak mengetahui peristiwa semasa.
  • Salah memahami permintaan kompleks: Sukar mengikuti arahan yang bernuansa.

Penyeliaan manusia membantu mengesan dan membetulkan isu ini, sekali gus memastikan keluaran yang lebih berkualiti dan selamat.

Cara Sistem HITL Berfungsi

Sistem HITL biasa melibatkan beberapa bahagian utama:

  1. Penjanaan oleh LLM: Model menghasilkan keluaran.
  2. Semakan Manusia: Seseorang menilai keluaran tersebut.
  3. Pengumpulan Maklum Balas: Pertimbangan manusia direkodkan.
  4. Penambahbaikan Model: Maklum balas ini digunakan untuk memperhalus LLM, sama ada dengan melaraskan gesaan atau memperhalus model itu sendiri.

Ini ialah kitaran berterusan yang melibatkan penciptaan, penilaian dan pembelajaran.

Dua Cara Memberikan Maklum Balas

Maklum balas manusia secara umumnya boleh dikategorikan kepada dua jenis:

  • Maklum Balas Eksplisit: Penilaian atau pembetulan langsung daripada pengguna atau penganotasi. Contohnya, "ibu jari ke atas/bawah" atau menyunting teks yang dijana.
  • Maklum Balas Tersirat: Disimpulkan daripada tingkah laku pengguna tanpa input langsung. Contohnya, tempoh pengguna melihat sesuatu respons atau sama ada mereka mengklik pautan tertentu.

Kedua-dua jenis ini bernilai atas sebab yang berbeza!

Mendapatkan Maklum Balas Langsung

Maklum balas eksplisit adalah jelas dan disengajakan. Cara biasa untuk mengumpulkannya termasuk:

  • Ibu Jari Ke Atas/Bawah: Maklum balas binari yang ringkas tentang kualiti respons.
  • Penilaian Bintang: Skala yang lebih terperinci, contohnya 1–5 bintang.
  • Suntingan Langsung: Pengguna membetulkan atau menulis semula bahagian keluaran LLM.
  • Label Penganotasi: Penganotasi manusia yang pakar menandai isu tertentu seperti kesilapan fakta atau kandungan toksik.

Data ini memberitahu anda secara langsung perkara yang berkesan dan perkara yang tidak berkesan.

Belajar daripada Tingkah Laku Pengguna

Maklum balas tersirat kurang langsung tetapi masih berkuasa. Ia melibatkan pemerhatian terhadap cara pengguna berinteraksi dengan keluaran LLM:

  • Tempoh Sesi: Pengguna yang meluangkan lebih banyak masa pada sesuatu respons mungkin menunjukkan keterlibatan.
  • Kadar Klik: Jika LLM mencadangkan pautan, klik menunjukkan kerelevanan.
  • Penambahbaikan Carian: Jika pengguna segera mengungkapkan semula pertanyaan mereka, respons awal mungkin kurang baik.
  • Menyalin Teks: Pengguna yang menyalin keluaran mungkin mendapati keluaran itu berguna.

Menganalisis tingkah laku ini boleh mendedahkan keutamaan dan isu yang tersirat.

Merekodkan Maklum Balas dalam Kod

Mari kita bayangkan cara asas untuk merekodkan maklum balas eksplisit, seperti "ibu jari ke atas" atau "ibu jari ke bawah", selepas LLM menjana respons. Kod Python ringkas ini menunjukkan cara anda mungkin menyusun pengumpulan maklum balas.

Kod ini tidak memanggil LLM, sebaliknya memfokuskan pada bahagian maklum balas.

def collect_feedback(llm_output: str, user_rating: str):
    """
    Simulates collecting feedback for an LLM output.
    In a real system, this would store to a database.
    """
    feedback_data = {
        "output": llm_output,
        "rating": user_rating, # e.g., "good", "bad", "neutral"
        "timestamp": "2023-10-27T10:30:00Z" # For simplicity
    }
    print(f"Feedback recorded: {feedback_data}")
    # In a real app, you'd save this to a database or log file.

if __name__ == "__main__":
    generated_text = "The capital of France is Paris."
    print(f"LLM output: '{generated_text}'")

    # Simulate user giving feedback
    user_choice = input("Was this output good or bad? (good/bad): ")
    collect_feedback(generated_text, user_choice)

    generated_text_2 = "The sun revolves around the Earth."
    print(f"\nLLM output: '{generated_text_2}'")
    user_choice_2 = input("Was this output good or bad? (good/bad): ")
    collect_feedback(generated_text_2, user_choice_2)

Menukarkan Maklum Balas kepada Penambahbaikan

Setelah maklum balas dikumpulkan, maklum balas itu bukan sekadar disimpan; ia digunakan untuk menjadikan LLM lebih baik:

  • Penambahbaikan Gesaan: Jika ramai pengguna menilai keluaran sebagai "tidak baik" untuk gesaan tertentu, anda boleh melaraskan gesaan itu supaya lebih jelas atau khusus.
  • Data untuk Penalaan Halus: Data berkualiti tinggi yang dibetulkan manusia boleh digunakan untuk menala halus LLM, dengan mengajarnya secara langsung daripada contoh yang baik.
  • Pembelajaran Pengukuhan daripada Maklum Balas Manusia (RLHF): Maklum balas boleh digunakan untuk melatih model ganjaran, yang kemudiannya membimbing LLM menghasilkan keluaran yang lebih disukai.

Ini melengkapkan kitaran dan meningkatkan prestasi.

Cabaran dalam Gelung Manusia

Walaupun HITL berkuasa, ia disertai beberapa cabaran:

  • Kebolehskalaan: Menyemak setiap keluaran LLM secara manual untuk aplikasi besar adalah mustahil.
  • Kos: Penganotasi manusia atau mekanisme maklum balas pengguna boleh mahal untuk dibina dan disenggarakan.
  • Keberpihakan dalam Maklum Balas: Penyemak manusia juga boleh memperkenalkan keberpihakan mereka sendiri, yang kemudiannya mungkin diperkukuh dalam model.
  • Subjektiviti: Perkara yang dianggap sebagai respons "baik" oleh seseorang mungkin tidak dianggap demikian oleh orang lain.

Reka bentuk yang teliti diperlukan untuk mengatasi cabaran ini.

Memahami HITL

Anda telah mempelajari tentang sistem Gelung Manusia. Mari uji pemahaman anda!

Imbas Kembali: HITL untuk LLM yang Lebih Baik

Dalam pelajaran ini, kita meneroka sistem Gelung Manusia (HITL). Kita mempelajari bahawa HITL menggabungkan pertimbangan manusia untuk meningkatkan prestasi LLM secara berterusan dengan menangani batasan seperti halusinasi dan keberpihakan.

Kini anda memahami komponen sistem HITL, perbezaan antara maklum balas eksplisit dan tersirat, serta cara maklum balas ini mendorong penambahbaikan model. Anda juga telah melihat contoh kod ringkas untuk mengumpulkan maklum balas dan mengetahui cabaran yang terlibat.

Teruskan meneroka cara membina aplikasi LLM yang teguh!

Percuma untuk bermula

Pelajari Kejuruteraan Gesaan & Pengoptimuman LLM untuk Pembangun dengan tutor kecerdasan buatan — percuma

Tulis dan jalankan kod sebenar dalam pelayar anda, dapatkan bantuan segera daripada tutor kecerdasan buatan yang tersedia 24/7, dan sambung semula dari tempat anda berhenti di web atau dalam aplikasi.

Kursus
12
Pelajaran
48

Soalan Lazim

Adakah pelajaran “Sistem Maklum Balas Manusia dalam Gelung” percuma?

Ya — teks penuh “Sistem Maklum Balas Manusia dalam Gelung” boleh dibaca secara percuma di web ini. Untuk berlatih secara interaktif menggunakan penyunting kod terbina dalam dan tutor kecerdasan buatan 24/7, serta membuka kunci baki kursus Kejuruteraan Gesaan & Pengoptimuman LLM untuk Pembangun, tingkat taraf kepada CoddyKit PRO. Kursus Kejuruteraan Gesaan & Pengoptimuman LLM untuk Pembangun merangkumi sejumlah 4 pelajaran.

Apakah yang akan saya pelajari dalam “Sistem Maklum Balas Manusia dalam Gelung”?

Reka bentuk dan laksanakan sistem yang menyepadukan maklum balas manusia untuk meningkatkan prestasi LLM secara berterusan serta membetulkan ralat. Anda berlatih Kejuruteraan Gesaan & Pengoptimuman LLM untuk Pembangun menggunakan kod praktikal yang dijalankan terus dalam pelayar, manakala tutor kecerdasan buatan 24/7 menjawab soalan anda semasa anda mengikuti pelajaran.

Adakah saya memerlukan pengalaman untuk memulakan Kejuruteraan Gesaan & Pengoptimuman LLM untuk Pembangun?

Tiada pengalaman terdahulu diperlukan. Pembelajaran Kejuruteraan Gesaan & Pengoptimuman LLM untuk Pembangun di CoddyKit disusun untuk pelajar daripada peringkat pemula hingga lanjutan, jadi anda boleh bermula di sini atau dari awal dan belajar mengikut kadar anda sendiri. Ini ialah pelajaran 2 daripada 4.

Berapa lamakah pelajaran “Sistem Maklum Balas Manusia dalam Gelung” diambil?

Kebanyakan pelajaran CoddyKit mengambil masa kira-kira 5–10 minit. Setiap pelajaran ringkas dan interaktif, jadi anda boleh membuat kemajuan secara berterusan dan menyambung tepat dari tempat anda berhenti di web atau aplikasi.

Bolehkah saya menulis dan menjalankan kod dalam pelajaran Kejuruteraan Gesaan & Pengoptimuman LLM untuk Pembangun ini?

Ya. Setiap pelajaran Kejuruteraan Gesaan & Pengoptimuman LLM untuk Pembangun menyertakan penyunting kod terbina dalam, jadi anda boleh menulis dan menjalankan kod sebenar terus dalam pelayar serta menerima maklum balas kecerdasan buatan serta-merta — tanpa memerlukan persediaan setempat.

Semua pelajaran dalam kursus ini

  1. Metrik dan Penanda Aras Penilaian LLM
  2. Sistem Maklum Balas Manusia dalam Gelung
  3. Suntikan Gesaan dan Amalan Terbaik Keselamatan
  4. Mengesan dan Mengurangkan Halusinasi
← Kembali ke Kejuruteraan Gesaan & Pengoptimuman LLM untuk Pembangun