SS

Retrieval Pipeline Visualizer

Inspect multi-stage hybrid retrieval execution: Dense Vector Search ➔ BM25 Keyword ➔ RRF Merging ➔ Cross-Encoder Reranking.

Step 01

Query Embedding

Generates 1536-dim vector representation using text-embedding-3-small

Latency18 ms
Step 02

Vector Search (Qdrant)

HNSW graph traversal over 18,450 vectors looking for cosine nearest neighbors

Latency24 ms
Step 03

Keyword Search (BM25)

Inverted index term frequency match over PostgreSQL payload text

Latency12 ms
Step 04

Hybrid Merge (RRF)

Combines vector and keyword ranks using Reciprocal Rank Fusion (k=60)

Latency8 ms
Step 05

Reranker (Cohere)

Cross-encoder transformer rescores merged chunks against full query semantics

Latency45 ms

Step Execution Telemetry

Reranker (Cohere)
Reranker Modelbge-reranker-large
Final Top K5
Score Delta+14.2%
Input Candidates15
Output Candidates5

Final Reranked Context Chunks

5 Top Chunks
system_architecture_spec.mdRRF Score: 96.2%

Contextra retrieval pipeline: 1) Query normalization & entity extraction. 2) Concurrent Qdrant dense vector search & Postgres BM25 keyword search. 3) Reciprocal Rank Fusion (RRF k=60). 4) Cross-encoder neural reranking.

Collection: Core System DocsChunk Offset #4
memory_scoring_algorithm.pdfRRF Score: 89.4%

Memory importance scoring uses exponential recency decay coupled with frequency-weighted keyword overlap to maintain a dynamic 4KB conversation summary buffer.

Collection: AI Research PapersChunk Offset #12
gateway_api_reference.openapi.jsonRRF Score: 84.1%

POST /api/v1/conversations/{id}/messages/stream returns a Server-Sent Events (SSE) stream delivering token deltas, citation references, and final execution metrics.

Collection: API SpecificationsChunk Offset #28
system_architecture_spec.mdRRF Score: 78.8%

Context Assembler enforces a hard token limit by packing system prompt, long-term memory summary, and retrieved chunks into an optimized prompt tree.

Collection: Core System DocsChunk Offset #9