Recherche hybride avec vecteurs creux et denses
Apprenez comment Pinecone combine des vecteurs sémantiques denses avec des vecteurs creux fondés sur les mots-clés pour fournir une recherche hybride qui prend en compte à la fois le sens et les termes exacts.
Recherche hybride avec vecteurs creux et denses est une leçon Vector Databases: Pinecone, Weaviate & pgvector gratuite sur CoddyKit. Ceci est la leçon 4 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage Vector Databases: Pinecone, Weaviate & pgvector, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours Vector Databases: Pinecone, Weaviate & pgvector comprend 4 leçons au total.
Certaines parties de cette leçon n'ont pas encore été traduites et s'affichent en anglais.
The Limits of Dense-Only Search
Dense vectors capture meaning but can miss exact terms like product codes, names, or rare keywords. A user searching 'error E4012' may get semantically related but wrong results.
Hybrid search fixes this by adding keyword matching.
Dense vs Sparse Vectors
Two vector kinds:
- Dense — a few hundred floats encoding semantic meaning
- Sparse — mostly zeros, with weights only for present terms (like keyword scores)
Sparse vectors behave like classic keyword search.
What Sparse Vectors Look Like
A sparse vector is stored as indices and values for the non-zero terms.
sparse = {'indices': [10, 42, 77], 'values': [0.8, 0.5, 0.3]}
print('non-zero terms:', len(sparse['indices']))Why Hybrid Wins
Hybrid search combines the strengths:
- Dense handles synonyms and intent
- Sparse guarantees exact-term matches
- Together they boost recall and precision
Pinecone Hybrid Indexes
To use hybrid search in Pinecone, create a dotproduct index and upsert each record with both a dense values array and a sparse_values field. Queries supply both representations of the query.
Upserting a Hybrid Record
A record carries dense and sparse parts together.
record = {
'id': 'doc1',
'values': [0.1, 0.2, 0.3],
'sparse_values': {'indices': [5, 9], 'values': [0.7, 0.4]},
'metadata': {'title': 'Setup guide'}
}
print(record['id'], 'has', len(record['values']), 'dense dims')The Alpha Weighting
Hybrid queries use an alpha parameter to weight dense vs sparse. alpha=1 is pure dense, alpha=0 is pure sparse. Tune it for your data.
def weight(dense_vec, sparse_vals, alpha):
d = [v*alpha for v in dense_vec]
s = [v*(1-alpha) for v in sparse_vals]
return d, s
print(weight([1.0], [1.0], 0.7))Generating Sparse Vectors
Sparse vectors come from keyword models like BM25 or learned sparse encoders (e.g. SPLADE). They map terms to weighted indices that Pinecone can match against stored records.
Tuning Alpha
The right alpha depends on your queries:
- Keyword-heavy domains (codes, IDs) -> lower alpha
- Natural-language questions -> higher alpha
Test on real queries and measure both recall and precision.
When to Use Hybrid
Reach for hybrid when exact terms matter: legal, medical, technical docs, or catalogs with SKUs. For purely conversational content, dense alone may be enough and simpler.
Bringing It Together
Hybrid search in Pinecone = a dotproduct index, records with dense and sparse values, queries supplying both, and a tuned alpha. It captures meaning and exact terms in one ranked result set.
Quick Check
Test your understanding of hybrid search.
Recap
You learned that hybrid search combines dense semantic vectors with sparse keyword vectors so Pinecone captures both meaning and exact terms. Use a dotproduct index, upsert both representations, and tune the alpha weighting to your query mix.
Questions Fréquemment Posées
La leçon « Recherche hybride avec vecteurs creux et denses » est-elle gratuite ?
Oui — le texte complet de « Recherche hybride avec vecteurs creux et denses » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours Vector Databases: Pinecone, Weaviate & pgvector, passe à CoddyKit PRO. Le cours Vector Databases: Pinecone, Weaviate & pgvector comprend 4 leçons au total.
Qu'est-ce que j'apprendrai dans « Recherche hybride avec vecteurs creux et denses » ?
Apprenez comment Pinecone combine des vecteurs sémantiques denses avec des vecteurs creux fondés sur les mots-clés pour fournir une recherche hybride qui prend en compte à la fois le sens et les term… Tu pratiques Vector Databases: Pinecone, Weaviate & pgvector avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.
Dois-je avoir de l'expérience pour commencer Vector Databases: Pinecone, Weaviate & pgvector ?
Aucune expérience préalable n'est requise. Vector Databases: Pinecone, Weaviate & pgvector sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 4 sur 4.
Combien de temps prend la leçon « Recherche hybride avec vecteurs creux et denses » ?
La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.
Peux-tu écrire et exécuter du code dans cette leçon Vector Databases: Pinecone, Weaviate & pgvector ?
Oui. Chaque leçon Vector Databases: Pinecone, Weaviate & pgvector inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.
Toutes les leçons de ce cours
- Filtrer avec les métadonnées
- Gérer les espaces de noms
- Mises à jour et suppressions en temps réel
- Recherche hybride avec vecteurs creux et denses