Använda embedding-API:er
Lär er att integrera och använda tjänster för generering av embeddingar från leverantörer som OpenAI och Hugging Face.
Använda embedding-API:er är en gratis lektion i Vektordatabaser: Pinecone, Weaviate och pgvector på CoddyKit. Detta är lektion 2 av 4. Du kan läsa vilka 3 lektioner som helst i den här lärvägen kostnadsfritt i sin helhet – därefter låser CoddyKit PRO upp alla lektioner, plus praktisk övning med en inbyggd kodredigerare och en AI-lärare dygnet runt. Den ingår i lärvägen för Vektordatabaser: Pinecone, Weaviate och pgvector, och Era framsteg synkroniseras mellan webben och CoddyKit-appen. Kursen i Vektordatabaser: Pinecone, Weaviate och pgvector innehåller totalt 4 lektioner.
Vad är embedding-API:er?
Embedding-API:er är tjänster som gör det enkelt att omvandla olika typer av data, till exempel text eller bilder, till vektorembeddings.
Se dem som färdiga verktyg. I stället för att bygga och träna egna komplexa modeller skickar ni era data till API:et, som returnerar den numeriska vektorrepresentationen.
Varför använda embedding-API:er?
Att använda ett API för embeddings ger betydande fördelar, särskilt för nybörjare eller för den som vill ha en snabb integration:
- Förtränade modeller: Tillgång till kraftfulla toppmoderna modeller utan behov av träning.
- Enkel användning: Enkel integrering i dina applikationer med bara några få kodrader.
- Skalbarhet: API-leverantören hanterar den underliggande infrastrukturen, så att din applikation enkelt kan skalas.
- Kostnadseffektivt: Ofta mer ekonomiskt än att underhålla egna modeller och egen hårdvara.
OpenAI: En ledande leverantör
OpenAI är en välkänd leverantör av AI-modeller, inklusive kraftfulla embedding-tjänster. Deras API gör det enkelt att generera embeddings av hög kvalitet.
En populär modell som de erbjuder är text-embedding-ada-002, som är känd för sin balans mellan prestanda, mångsidighet och kostnadseffektivitet inom många användningsområden.
OpenAI API: Första konfigurationen
För att komma igång med OpenAI:s embedding-API behöver du en API-nyckel från deras webbplats. Det är mycket viktigt att hålla denna nyckel konfidentiell!
Du behöver också installera det officiella Python-klientbiblioteket. Öppna terminalen och kör:
pip install openaiAv säkerhetsskäl ska du alltid lagra din API-nyckel i en miljövariabel i stället för direkt i koden.
Generera embeddings med OpenAI
Det här Python-programmet visar hur du genererar en embedding för en text med OpenAI API. Kom ihåg att ersätta "YOUR_OPENAI_API_KEY_HERE" med din faktiska nyckel.
import os
from openai import OpenAI
# Replace with your actual API key or set as environment variable
# client = OpenAI(api_key=os.environ.get("OPENAI_API_KEY"))
client = OpenAI(api_key="YOUR_OPENAI_API_KEY_HERE") # For demonstration
def get_openai_embedding(text, model="text-embedding-ada-002"):
# OpenAI recommends replacing newlines with spaces for best results
text = text.replace("\n", " ")
response = client.embeddings.create(input=[text], model=model)
return response.data[0].embedding
if __name__ == "__main__":
example_text = "CoddyKit makes learning to code easy and fun."
embedding = get_openai_embedding(example_text)
print(f"Text: '{example_text}'")
print(f"Embedding length: {len(embedding)}")
print(f"First 5 dimensions: {embedding[:5]}")Hugging Face: Modeller med öppen källkod
Hugging Face är välkänt för sitt omfattande nav med maskininlärningsmodeller med öppen källkod. De tillhandahåller även ett Inference API som låter dig använda många av dessa modeller utan en komplicerad lokal konfiguration.
Det här är utmärkt när du vill experimentera med olika modeller, särskilt olika sentence transformer-modeller som passar mycket bra för textembeddings.
Embeddings med Hugging Face API
Du kan använda Hugging Face Inference API med vanliga HTTP-förfrågningar. Du behöver en API-token från ditt Hugging Face-konto.
Här är ett Python-exempel som använder biblioteket requests för att hämta en embedding från en populär sentence transformer-modell.
import requests
import json
import os
# Replace with your Hugging Face API token or set as environment variable
# HF_API_TOKEN = os.environ.get("HF_API_TOKEN")
HF_API_TOKEN = "YOUR_HUGGINGFACE_API_TOKEN_HERE" # For demonstration
# Example model for sentence embeddings
API_URL = "https://api-inference.huggingface.co/models/sentence-transformers/all-MiniLM-L6-v2"
HEADERS = {"Authorization": f"Bearer {HF_API_TOKEN}"}
def query_hf_api(payload):
response = requests.post(API_URL, headers=HEADERS, json=payload)
return response.json()
if __name__ == "__main__":
text_to_embed = "Mobile learning platforms are convenient."
data = query_hf_api({"inputs": text_to_embed})
if isinstance(data, list) and len(data) > 0 and isinstance(data[0], list):
embedding = data[0]
print(f"Text: '{text_to_embed}'")
print(f"Embedding length: {len(embedding)}")
print(f"First 5 dimensions: {embedding[:5]}")
else:
print(f"Error or unexpected response: {data}")
print("Please check your API token and ensure the model is available.")Skydda dina API-nycklar!
API-nycklar fungerar som lösenord för dina tjänster. Hantera dem alltid med största försiktighet:
- Miljövariabler: Den säkraste metoden är att lagra nycklar som miljövariabler och aldrig hårdkoda dem.
- Versionshantering: Lägg aldrig in API-nycklar direkt i kodförrådet (t.ex. Git eller GitHub).
- Åtkomstkontroll: Begränsa vilka som har tillgång till dina API-nycklar och byt ut dem regelbundet om din leverantör tillåter det.
Kostnader och hastighetsbegränsningar
När du använder embedding-API:er bör du vara uppmärksam på följande:
- Prismodeller: De flesta API:er tar betalt per token eller per behandlat tecken. Kostnaderna kan variera betydligt mellan olika modeller och leverantörer. Kontrollera alltid deras prissidor.
- Hastighetsbegränsningar: API:er har ofta begränsningar för hur många förfrågningar du kan göra per minut eller sekund. Om du överskrider dessa gränser kan det leda till tillfälliga blockeringar eller fel.
- Modellval: Olika modeller innebär olika avvägningar mellan prestanda och kostnad. Välj en modell som passar din applikations krav och budget.
Kontroll av API-fördelar
Vilka av följande är viktiga fördelar med att använda ett Embedding API från tredje part (som OpenAI eller Hugging Face) jämfört med att träna en egen modell lokalt?
Sammanfattning: Använda embedding-API:er
I den här lektionen lärde du dig hur du använder tjänster för att generera embeddings från leverantörer som OpenAI och Hugging Face:
- Vi gick igenom fördelarna med att använda förtränade modeller via API:er för enkelhet och skalbarhet.
- Du såg praktiska Python-exempel på integrering med både OpenAI- och Hugging Face Inference API för att generera textembeddings.
- Vi diskuterade viktiga aspekter som API-nycklars säkerhet, kostnader och hastighetsbegränsningar.
Dessa API:er är kraftfulla verktyg för att snabbt integrera semantisk förståelse i dina applikationer, vilket möjliggör funktioner som semantisk sökning, rekommendationer med mera!
Lär dig Vektordatabaser: Pinecone, Weaviate och pgvector med en AI-lärare – gratis
Skriv och kör riktig kod i webbläsaren, få omedelbar hjälp av en AI-lärare dygnet runt och fortsätt där du slutade – på webben eller i appen.
- Kurser
- 12
- Lektioner
- 48
Vanliga frågor
Är lektionen ”Använda embedding-API:er” gratis?
Ja – du kan läsa vilka 3 lektioner som helst i lärvägen Vektordatabaser: Pinecone, Weaviate och pgvector, inklusive ”Använda embedding-API:er”, kostnadsfritt i sin helhet här på webben. Därefter låser CoddyKit PRO upp alla lektioner, plus interaktiv övning med en inbyggd kodredigerare och en AI-lärare dygnet runt. Kursen i Vektordatabaser: Pinecone, Weaviate och pgvector innehåller totalt 4 lektioner.
Vad lär jag mig i ”Använda embedding-API:er”?
Lär er att integrera och använda tjänster för generering av embeddingar från leverantörer som OpenAI och Hugging Face. Ni övar på Vektordatabaser: Pinecone, Weaviate och pgvector med praktisk kod som körs direkt i webbläsaren, medan en AI-handledare som är tillgänglig dygnet runt svarar på Era frågor under lektionen.
Behöver jag någon erfarenhet för att börja lära mig Vektordatabaser: Pinecone, Weaviate och pgvector?
Du behöver inga förkunskaper. Utbildningen i Vektordatabaser: Pinecone, Weaviate och pgvector på CoddyKit är upplagd för allt från nybörjare till avancerade elever, så att du kan börja här eller från början och gå fram i din egen takt. Detta är lektion 2 av 4.
Hur lång tid tar lektionen ”Använda embedding-API:er”?
De flesta CoddyKit-lektioner tar cirka 5–10 minuter. Varje lektion är kort och interaktiv, så att du gör stadiga framsteg och kan fortsätta precis där du slutade – på webben eller i appen.
Kan jag skriva och köra kod i den här Vektordatabaser: Pinecone, Weaviate och pgvector-lektionen?
Ja. Varje Vektordatabaser: Pinecone, Weaviate och pgvector-lektion innehåller en inbyggd kodredigerare, så att du kan skriva och köra riktig kod direkt i webbläsaren och få omedelbar AI-feedback – utan lokal installation.
Alla lektioner i den här kursen
- Modeller för textembedding
- Använda embedding-API:er
- Lagra och uppdatera embeddingar
- Dela upp text för bättre embeddings