1. Why should the same embedding model be used for both indexing documents and encoding queries?
2. What does a cross-encoder reranker do that a bi-encoder retriever does not?
3. Why is vector normalization relevant when using cosine similarity?
4. How does increasing HNSW's 'ef_search' parameter affect retrieval?
5. What retrieval problem does adding chunk overlap primarily mitigate?
6. Why can a domain-specific fine-tuned embedding model outperform a general one for retrieval?
7. What is the main tradeoff when reducing embedding dimensionality (e.g., via Matryoshka truncation)?