Topic 2: Rerankers
6 min read·21 Sept 2026
Topic 2: Rerankers
| Reranker | How it decides | Calls per query | Typical latency | Strength |
|---|---|---|---|---|
| Cross-encoder | One small model run per candidate, locally | 0 LLM calls | 10-200 ms for 25-50 candidates | Best accuracy per millisecond |
| LLM pointwise | Scores each passage | 1 per batch | Hundreds of ms per batch | Follows custom criteria |
| LLM listwise | Orders a window of passages | 1 per window | Hundreds of ms per window | Strong ordering; uses comparisons |
| LLM pairwise | “A or B?” | Many | Highest | Most accurate per comparison; rarely affordable |
| Hosted API | Someone else’s cross-encoder | 1 network call | 50-300 ms | No model to run; pay per search |