0Pricing
AI Agents · Lektion

Re-Ranking mit Cross-Encodern

Rufen Sie mit kostengünstigen Embeddings die Top 50 ab und sortieren Sie anschließend die Top 5 mit einem langsameren Cross-Encoder für höhere Präzision neu.

Re-Ranking mit Cross-Encodern ist eine kostenlose AI Agents-Lektion auf CoddyKit. Dies ist Lektion 1 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des AI Agents-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.

Teile dieser Lektion wurden noch nicht übersetzt und werden auf Englisch angezeigt.

Warum Re-Ranking?

Die Ähnlichkeit von Embeddings ist ein schneller, grober erster Schritt. Dabei werden häufig Chunks gefunden, die zwar SCHLÜSSELWÖRTER aus der Anfrage enthalten, aber tatsächlich nicht für die FRAGE relevant sind.

Ein Re-Ranker nimmt (Anfrage, Chunk)-Paare entgegen und berechnet einen deutlich präziseren Relevanzwert.

Bi-Encoder vs. Cross-Encoder

Zwei Architekturen für Textähnlichkeit:

  • Bi-Encoder – bettet Anfrage und Chunk getrennt ein und berechnet den Kosinus. Schnell (einmal vektorisieren und wiederverwenden), aber weniger präzise.
  • Cross-Encoder – verarbeitet (Anfrage, Chunk) gemeinsam im Modell. Langsam (pro Paar), aber deutlich präziser.

Zweistufiger Abruf

Das kombinierende Muster:

  1. Der Bi-Encoder ruft schnell die 50 besten Kandidaten ab
  2. Der Cross-Encoder ordnet sie neu und wählt die 5 besten aus
  3. Die 5 besten gelangen in den LLM-Prompt

Sie erhalten die Geschwindigkeit des Bi-Encoders und die Präzision des Cross-Encoders.

Cohere Rerank verwenden

Der einfachste Cross-Encoder für den Produktiveinsatz:

import cohere
co = cohere.Client(COHERE_KEY)

results = co.rerank(
    model='rerank-multilingual-v3.0',
    query='What is the refund policy?',
    documents=top_50_chunks,
    top_n=5
)
for r in results.results:
    print(r.index, r.relevance_score, top_50_chunks[r.index])

Open-Source-Reranker

BGE Reranker ist die führende OSS-Option:

from sentence_transformers import CrossEncoder
model = CrossEncoder('BAAI/bge-reranker-base')

pairs = [(query, chunk) for chunk in candidates]
scores = model.predict(pairs)
ranked = [c for _, c in sorted(zip(scores, candidates), reverse=True)][:5]

Voyage Rerank

import voyageai
vo = voyageai.Client(api_key=VOYAGE_KEY)
res = vo.rerank(
    query=query,
    documents=candidates,
    model='rerank-2',
    top_k=5
)

Wann Re-Ranking hilft

  • Lange Kandidatenlisten (50–200)
  • Feine Unterschiede in der Relevanz
  • Anfragen mit Verneinungen oder Vergleichen
  • Mehrsprachige Fälle

Wann es nicht hilft

  • Bereits stark eingegrenzte Kandidatensätze (Top-5 des Bi-Encoders)
  • Latenzkritische Anfragen mit geringem Risiko

Kostenabwägung

Cross-Encoder führen für jedes Paar eine Inferenz aus. Das Re-Ranking von 50 Kandidaten bedeutet 50 Modellaufrufe (mit Cohere/Voyage kostengünstig, bei Selbsthosting langsamer).

Planen Sie 50–200 Kandidaten für das Re-Ranking ein. Mehr lohnt sich nur selten.

Integrating into LangChain

from langchain.retrievers import ContextualCompressionRetriever
from langchain.retrievers.document_compressors import CohereRerank

compressor = CohereRerank(top_n=5)
retriever = ContextualCompressionRetriever(
    base_compressor=compressor,
    base_retriever=vector_retriever
)

Integrating into LlamaIndex

from llama_index.postprocessor.cohere_rerank import CohereRerank

rerank = CohereRerank(top_n=5)
query_engine = index.as_query_engine(
    similarity_top_k=20,
    node_postprocessors=[rerank]
)

Diversitätsbewusstes Re-Ranking

Manchmal benötigen Sie vielfältige Ergebnisse statt nur der am höchsten bewerteten (die nahezu identisch sein können). MMR (Maximal Marginal Relevance) gleicht Bewertung und Vielfalt aus:

from langchain.vectorstores import Chroma
results = store.max_marginal_relevance_search(query, k=5, fetch_k=20, lambda_mult=0.5)

Zweistufiges Muster

Warum sollten Sie Bi-Encoder und Cross-Encoder statt nur eines von beiden verwenden?

Zusammenfassung

Der Bi-Encoder ruft 50 Ergebnisse ab, der Cross-Encoder ordnet sie neu und wählt 5 aus. Verwenden Sie in der Produktion Cohere oder Voyage und bei Selbsthosting BGE OSS. Sie erzielen eine deutliche Genauigkeitssteigerung bei moderaten Zusatzkosten.

Häufig gestellte Fragen

Ist die Lektion „Re-Ranking mit Cross-Encodern“ kostenlos?

Ja — der vollständige Text von „Re-Ranking mit Cross-Encodern“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des AI Agents-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der AI Agents-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „Re-Ranking mit Cross-Encodern“?

Rufen Sie mit kostengünstigen Embeddings die Top 50 ab und sortieren Sie anschließend die Top 5 mit einem langsameren Cross-Encoder für höhere Präzision neu. Du übst AI Agents mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um AI Agents zu starten?

Keine Vorkenntnisse erforderlich. AI Agents auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 1 von 4.

Wie lange dauert die Lektion „Re-Ranking mit Cross-Encodern“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser AI Agents-Lektion Code schreiben und ausführen?

Ja. Jede AI Agents-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Re-Ranking mit Cross-Encodern
  2. HyDE: hypothetische Dokument-Embeddings
  3. Multi-Vector-Retrieval (ColBERT)
  4. RAG-Evaluierung (RAGAS, Recall@K)
← Zurück zu AI Agents