LangChain / RAG / vektordatabaser · Lektion

Databeskyttelse og håndtering af PII

Forstå, hvordan personhenførbare oplysninger (PII) og følsomme data håndteres sikkert i Deres RAG-pipelines.

Lektion 1 af 412 trin

Databeskyttelse og håndtering af PII er en gratis LangChain / RAG / vektordatabaser-lektion på CoddyKit. Dette er lektion 1 af 4. Du kan læse hele lektionen gratis nedenfor — og derefter øve dig praktisk i browseren med en indbygget kodeeditor og en AI-vejleder, der er tilgængelig døgnet rundt. Den er en del af læringsforløbet i LangChain / RAG / vektordatabaser, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. LangChain / RAG / vektordatabaser-kurset indeholder 4 lektioner i alt.

PII og RAG: Det grundlæggende

Velkommen til denne lektion om databeskyttelse og håndtering af personhenførbare oplysninger (PII) i RAG-systemer.

PII henviser til alle data, der kan bruges til at identificere en bestemt person. Det omfatter navne, e-mailadresser, telefonnumre, CPR-numre og endda IP-adresser.

Hvorfor PII er vigtigt i RAG

I Retrieval Augmented Generation-systemer (RAG) arbejder du ofte med store mængder forskelligartede data. Disse data kan nemt indeholde følsomme personhenførbare oplysninger.

Hvis de ikke håndteres korrekt, kan dit RAG-system utilsigtet afsløre private brugeroplysninger, hvilket kan føre til alvorlige brud på privatlivets fred og juridiske problemer.

Risikoen for PII-eksponering i RAG

Forestil dig et RAG-system, der er trænet på interne virksomhedsdokumenter eller chats med kundesupport. En bruger kan stille et spørgsmål, som ved besvarelsen ved et uheld henter og viser et dokument, der indeholder en persons fulde navn, adresse eller sygehistorie.

Målet er at levere nyttige oplysninger uden at afsløre følsomme persondata.

Identificering af PII i dokumenter

Før du kan beskytte PII, skal du finde oplysningerne. Det indebærer at gennemgå dine dokumenter for mønstre, der indikerer persondata.

Almindelige metoder omfatter regulære udtryk (regex), teknikker inden for behandling af naturligt sprog (NLP) eller specialiserede biblioteker til registrering af PII.

Demonstration af PII-identifikation

Her er et enkelt Python-eksempel, der bruger regulære udtryk til at finde almindelige PII-mønstre som e-mailadresser og telefonnumre i et tekstdokument.

import re

def find_pii(text):
    patterns = {
        "EMAIL": r"[a-zA-Z0-9._%+-]+@[a-zA-Z0-9.-]+\.[a-zA-Z]{2,}",
        "PHONE": r"\b(?:\d{3}[-.\s]?\d{3}[-.\s]?\d{4})\b",
        "NAME": r"\b(?:John Doe|Jane Smith)\b" # Simplified for demo
    }
    found_pii = {}
    for pii_type, pattern in patterns.items():
        matches = re.findall(pattern, text)
        if matches:
            found_pii[pii_type] = list(set(matches))
    return found_pii

document = "Contact John Doe at john.doe@example.com or call 555-123-4567."
print("Document:", document)
print("Found PII:", find_pii(document))

Strategi: Maskering af PII

Maskering er processen, hvor PII fjernes eller skjules, så oplysningerne ikke kan læses eller identificeres. Det er en almindelig og effektiv måde at beskytte følsomme data på.

Du kan erstatte PII med generiske pladsholdere (f.eks. [EMAIL], [NAME]) eller stjerner (***).

Demonstration af maskering af PII

Med udgangspunkt i vores tidligere eksempel kan vi se, hvordan vi kan maskere den identificerede PII fra et dokument ved hjælp af Python og regulære udtryk.

import re

def redact_pii(text):
    # Redact email addresses
    text = re.sub(r"[a-zA-Z0-9._%+-]+@[a-zA-Z0-9.-]+\.[a-zA-Z]{2,}", "[EMAIL_REDACTED]", text)
    # Redact phone numbers
    text = re.sub(r"\b(?:\d{3}[-.\s]?\d{3}[-.\s]?\d{4})\b", "[PHONE_REDACTED]", text)
    # Redact specific names (simplified)
    text = re.sub(r"\bJohn Doe\b", "[NAME_REDACTED]", text)
    text = re.sub(r"\bJane Smith\b", "[NAME_REDACTED]", text)
    return text

document = "Contact John Doe at john.doe@example.com or call 555-123-4567."
redacted_doc = redact_pii(document)
print("Original:", document)
print("Redacted:", redacted_doc)

Strategi: Pseudonymisering

Pseudonymisering erstatter PII med kunstige identifikatorer (pseudonymer). I modsætning til maskering gør det genidentifikation mulig, hvis det er nødvendigt, men kun med adgang til en separat "nøgle", der knytter pseudonymerne tilbage til den oprindelige PII.

Det er nyttigt, når du har brug for at analysere data statistisk uden direkte at afsløre enkeltpersoners identitet.

Princippet om dataminimering

Et grundlæggende princip for databeskyttelse er dataminimering. Det betyder, at du kun bør indsamle, behandle og gemme den absolut mindst mulige mængde PII, som er nødvendig for, at dit RAG-system fungerer.

Mindre gemt PII betyder mindre risiko i tilfælde af et databrud. Gennemgå regelmæssigt, hvilke data du opbevarer.

Sikker opbevaring og adgang

Selv efter behandlingen skal al resterende PII i dit vektorlager eller dine kildedokumenter beskyttes effektivt:

  • Kryptering: Krypter data både under opbevaring (i hvile) og under overførsel (i transit).
  • Adgangskontrol: Implementer streng rollebaseret adgang til dine databaser og RAG-komponenter. Kun autoriserede personer bør have adgang til følsomme data.
  • Isolerede miljøer: Behandl PII i sikre, isolerede computermiljøer for at minimere eksponeringen.

Kontrol af PII-håndtering

Hvilke af følgende strategier til håndtering af PII i et RAG-system er gyldige og anbefalelsesværdige?

Opsummering: PII- og RAG-sikkerhed

I denne lektion undersøgte vi, hvor vigtigt det er at håndtere PII korrekt i RAG-systemer. Vi lærte om identifikation af PII og om vigtige strategier som maskering og pseudonymisering.

Husk princippet om dataminimering samt behovet for sikker opbevaring og adgangskontrol for at beskytte følsomme oplysninger og sikre overholdelse af reglerne om databeskyttelse.

Gratis at komme i gang

Lær LangChain / RAG / vektordatabaser med en AI-underviser — gratis

Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.

Kurser
12
Lektioner
48

Ofte stillede spørgsmål

Er lektionen “Databeskyttelse og håndtering af PII” gratis?

Ja — hele teksten til “Databeskyttelse og håndtering af PII” kan læses gratis her på nettet. Hvis du vil øve dig interaktivt med en indbygget kodeeditor og en AI-vejleder døgnet rundt og få adgang til resten af LangChain / RAG / vektordatabaser-kurset, skal du opgradere til CoddyKit PRO. LangChain / RAG / vektordatabaser-kurset indeholder 4 lektioner i alt.

Hvad lærer jeg i “Databeskyttelse og håndtering af PII”?

Forstå, hvordan personhenførbare oplysninger (PII) og følsomme data håndteres sikkert i Deres RAG-pipelines. Du øver dig i LangChain / RAG / vektordatabaser med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.

Skal jeg have erfaring for at begynde på LangChain / RAG / vektordatabaser?

Der kræves ingen tidligere erfaring. LangChain / RAG / vektordatabaser på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 1 af 4.

Hvor lang tid tager lektionen “Databeskyttelse og håndtering af PII”?

De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.

Kan jeg skrive og køre kode i denne LangChain / RAG / vektordatabaser-lektion?

Ja. Alle LangChain / RAG / vektordatabaser-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.

Alle lektioner i dette kursus

  1. Databeskyttelse og håndtering af PII
  2. Begrænsning af hallucinationer og bias
  3. Ansvarlig AI-praksis for RAG
  4. Beskyttelse mod prompt injection
← Tilbage til LangChain / RAG / vektordatabaser