LangChain / RAG / Pangkalan Data Vektor · Pelajaran

Privasi Data dan Pengendalian PII

Fahami cara mengurus maklumat pengenalan peribadi (PII) dan data sensitif dengan selamat dalam saluran paip RAG anda.

Pelajaran 1 daripada 412 langkah

Privasi Data dan Pengendalian PII ialah pelajaran LangChain / RAG / Pangkalan Data Vektor percuma di CoddyKit. Ini ialah pelajaran 1 daripada 4. Anda boleh membaca keseluruhan pelajaran di bawah secara percuma — kemudian berlatih secara praktikal dalam pelayar menggunakan penyunting kod terbina dalam dan tutor kecerdasan buatan 24/7. Pelajaran ini merupakan sebahagian daripada laluan pembelajaran LangChain / RAG / Pangkalan Data Vektor, dan kemajuan anda disegerakkan merentas web serta aplikasi CoddyKit. Kursus LangChain / RAG / Pangkalan Data Vektor merangkumi sejumlah 4 pelajaran.

PII dan RAG: Asas

Selamat datang ke pelajaran tentang privasi data dan pengendalian Maklumat Pengenalan Peribadi (PII) dalam sistem RAG.

PII merujuk kepada apa-apa data yang boleh digunakan untuk mengenal pasti individu tertentu. Ini termasuk nama, alamat e-mel, nombor telefon, nombor keselamatan sosial dan juga alamat IP.

Mengapakah PII Penting dalam RAG?

Dalam sistem Retrieval Augmented Generation (RAG), Anda sering mengendalikan jumlah data yang besar dan pelbagai. Data ini boleh mengandungi PII sensitif dengan mudah.

Jika tidak dikendalikan dengan betul, sistem RAG Anda mungkin mendedahkan maklumat peribadi pengguna secara tidak sengaja, lalu menyebabkan pelanggaran privasi yang serius dan masalah undang-undang.

Risiko Pendedahan PII oleh RAG

Pertimbangkan sistem RAG yang dilatih menggunakan dokumen dalaman syarikat atau sembang sokongan pelanggan. Pengguna mungkin mengajukan soalan yang, apabila dijawab, secara tidak sengaja mendapatkan dan memaparkan dokumen yang mengandungi nama penuh, alamat atau sejarah perubatan seseorang.

Matlamatnya adalah untuk memberikan maklumat yang berguna tanpa mendedahkan data peribadi yang sensitif.

Mengenal Pasti PII dalam Dokumen

Sebelum Anda boleh melindungi PII, Anda perlu mencarinya. Ini melibatkan pengimbasan dokumen untuk mencari corak yang menunjukkan data peribadi.

Kaedah biasa termasuk menggunakan ungkapan nalar (regex), teknik pemprosesan bahasa tabii (NLP) atau pustaka pengesanan PII khusus.

Demonstrasi Pengenalpastian PII

Berikut ialah contoh Python ringkas yang menggunakan ungkapan nalar untuk mencari corak PII biasa seperti e-mel dan nombor telefon dalam dokumen teks.

import re

def find_pii(text):
    patterns = {
        "EMAIL": r"[a-zA-Z0-9._%+-]+@[a-zA-Z0-9.-]+\.[a-zA-Z]{2,}",
        "PHONE": r"\b(?:\d{3}[-.\s]?\d{3}[-.\s]?\d{4})\b",
        "NAME": r"\b(?:John Doe|Jane Smith)\b" # Simplified for demo
    }
    found_pii = {}
    for pii_type, pattern in patterns.items():
        matches = re.findall(pattern, text)
        if matches:
            found_pii[pii_type] = list(set(matches))
    return found_pii

document = "Contact John Doe at john.doe@example.com or call 555-123-4567."
print("Document:", document)
print("Found PII:", find_pii(document))

Strategi: Menyamarkan PII

Penyamaran ialah proses membuang atau mengaburkan PII supaya maklumat itu tidak dapat dibaca atau dikenal pasti. Ini ialah cara yang biasa dan berkesan untuk melindungi data sensitif.

Anda boleh menggantikan PII dengan ruang letak generik (contohnya, [EMAIL], [NAME]) atau tanda bintang (***).

Demonstrasi Penyamaran PII

Berdasarkan contoh sebelumnya, mari lihat cara menyamarkan PII yang dikenal pasti daripada dokumen menggunakan Python dan ungkapan nalar.

import re

def redact_pii(text):
    # Redact email addresses
    text = re.sub(r"[a-zA-Z0-9._%+-]+@[a-zA-Z0-9.-]+\.[a-zA-Z]{2,}", "[EMAIL_REDACTED]", text)
    # Redact phone numbers
    text = re.sub(r"\b(?:\d{3}[-.\s]?\d{3}[-.\s]?\d{4})\b", "[PHONE_REDACTED]", text)
    # Redact specific names (simplified)
    text = re.sub(r"\bJohn Doe\b", "[NAME_REDACTED]", text)
    text = re.sub(r"\bJane Smith\b", "[NAME_REDACTED]", text)
    return text

document = "Contact John Doe at john.doe@example.com or call 555-123-4567."
redacted_doc = redact_pii(document)
print("Original:", document)
print("Redacted:", redacted_doc)

Strategi: Pseudonimisasi

Pseudonimisasi menggantikan PII dengan pengecam buatan (pseudonim). Tidak seperti penyamaran, kaedah ini membolehkan identiti dikenal pasti semula jika perlu, tetapi hanya dengan akses kepada 'kunci' berasingan yang memadankan pseudonim dengan PII asal.

Ini berguna apabila anda perlu menganalisis data secara statistik tanpa mendedahkan identiti individu secara langsung.

Prinsip Pengurangan Data

Prinsip privasi teras ialah pengurangan data. Ini bermakna anda hanya patut mengumpul, memproses dan menyimpan jumlah minimum PII yang benar-benar diperlukan untuk sistem RAG anda berfungsi.

Lebih sedikit PII yang disimpan bermakna risiko yang lebih rendah sekiranya berlaku kebocoran data. Semak secara berkala data yang anda simpan.

Penyimpanan & Akses Selamat

Walaupun selepas diproses, sebarang PII yang masih terdapat dalam stor vektor atau dokumen sumber memerlukan perlindungan yang kukuh:

  • Penyulitan: Sulitkan data ketika disimpan dan ketika dipindahkan.
  • Kawalan Akses: Laksanakan akses berasaskan peranan yang ketat kepada pangkalan data dan komponen RAG anda. Hanya kakitangan yang dibenarkan patut mengakses data sensitif.
  • Persekitaran Terasing: Proses PII dalam persekitaran pengkomputeran yang selamat dan terasing untuk meminimumkan pendedahan.

Semakan Pengendalian PII

Manakah antara strategi berikut yang sah dan disyorkan untuk mengendalikan PII dalam sistem RAG?

Imbas Kembali: Keselamatan PII & RAG

Dalam pelajaran ini, kita meneroka kepentingan kritikal pengendalian PII dalam sistem RAG. Kita mempelajari cara mengenal pasti PII serta strategi utama seperti penyamaran dan pseudonimisasi.

Ingat prinsip pengurangan data serta keperluan untuk penyimpanan selamat dan kawalan akses bagi melindungi maklumat sensitif dan memastikan pematuhan terhadap peraturan privasi.

Percuma untuk bermula

Pelajari LangChain / RAG / Pangkalan Data Vektor dengan tutor kecerdasan buatan — percuma

Tulis dan jalankan kod sebenar dalam pelayar anda, dapatkan bantuan segera daripada tutor kecerdasan buatan yang tersedia 24/7, dan sambung semula dari tempat anda berhenti di web atau dalam aplikasi.

Kursus
12
Pelajaran
48

Soalan Lazim

Adakah pelajaran “Privasi Data dan Pengendalian PII” percuma?

Ya — teks penuh “Privasi Data dan Pengendalian PII” boleh dibaca secara percuma di web ini. Untuk berlatih secara interaktif menggunakan penyunting kod terbina dalam dan tutor kecerdasan buatan 24/7, serta membuka kunci baki kursus LangChain / RAG / Pangkalan Data Vektor, tingkat taraf kepada CoddyKit PRO. Kursus LangChain / RAG / Pangkalan Data Vektor merangkumi sejumlah 4 pelajaran.

Apakah yang akan saya pelajari dalam “Privasi Data dan Pengendalian PII”?

Fahami cara mengurus maklumat pengenalan peribadi (PII) dan data sensitif dengan selamat dalam saluran paip RAG anda. Anda berlatih LangChain / RAG / Pangkalan Data Vektor menggunakan kod praktikal yang dijalankan terus dalam pelayar, manakala tutor kecerdasan buatan 24/7 menjawab soalan anda semasa anda mengikuti pelajaran.

Adakah saya memerlukan pengalaman untuk memulakan LangChain / RAG / Pangkalan Data Vektor?

Tiada pengalaman terdahulu diperlukan. Pembelajaran LangChain / RAG / Pangkalan Data Vektor di CoddyKit disusun untuk pelajar daripada peringkat pemula hingga lanjutan, jadi anda boleh bermula di sini atau dari awal dan belajar mengikut kadar anda sendiri. Ini ialah pelajaran 1 daripada 4.

Berapa lamakah pelajaran “Privasi Data dan Pengendalian PII” diambil?

Kebanyakan pelajaran CoddyKit mengambil masa kira-kira 5–10 minit. Setiap pelajaran ringkas dan interaktif, jadi anda boleh membuat kemajuan secara berterusan dan menyambung tepat dari tempat anda berhenti di web atau aplikasi.

Bolehkah saya menulis dan menjalankan kod dalam pelajaran LangChain / RAG / Pangkalan Data Vektor ini?

Ya. Setiap pelajaran LangChain / RAG / Pangkalan Data Vektor menyertakan penyunting kod terbina dalam, jadi anda boleh menulis dan menjalankan kod sebenar terus dalam pelayar serta menerima maklum balas kecerdasan buatan serta-merta — tanpa memerlukan persediaan setempat.

Semua pelajaran dalam kursus ini

  1. Privasi Data dan Pengendalian PII
  2. Mengurangkan Halusinasi dan Bias
  3. Amalan Kecerdasan Buatan Bertanggungjawab untuk RAG
  4. Mempertahankan Sistem daripada Suntikan Arahan
← Kembali ke LangChain / RAG / Pangkalan Data Vektor