diff --git a/qdrant-landing/content/documentation/tutorials-search-engineering/retrieval-quality-golden-set.md b/qdrant-landing/content/documentation/tutorials-search-engineering/retrieval-quality-golden-set.md index c96a0192c..3169aeda8 100644 --- a/qdrant-landing/content/documentation/tutorials-search-engineering/retrieval-quality-golden-set.md +++ b/qdrant-landing/content/documentation/tutorials-search-engineering/retrieval-quality-golden-set.md @@ -117,6 +117,7 @@ def retrieval_run(golden_set: list, collection: str, k: int = 10) -> Run: query=entry["query_vector"], limit=k, ).points + # p.id type must match the doc_id type in labels (ranx matches by equality). run[entry["query_id"]] = {p.id: p.score for p in results} return Run(run) diff --git a/qdrant-landing/content/documentation/tutorials-search-engineering/retrieval-quality-pipeline-output.md b/qdrant-landing/content/documentation/tutorials-search-engineering/retrieval-quality-pipeline-output.md index 82a4c8c6e..952d9bb17 100644 --- a/qdrant-landing/content/documentation/tutorials-search-engineering/retrieval-quality-pipeline-output.md +++ b/qdrant-landing/content/documentation/tutorials-search-engineering/retrieval-quality-pipeline-output.md @@ -119,12 +119,13 @@ Pass the eval samples into `evaluate()` with those three metrics: ```python from ragas import EvaluationDataset, evaluate -from ragas.metrics import faithfulness, answer_relevancy, context_precision +from ragas.metrics.collections import faithfulness, answer_relevancy, context_precision dataset = EvaluationDataset(samples=samples) scores = evaluate( dataset, metrics=[faithfulness, answer_relevancy, context_precision], + # For a non-OpenAI judge, pass llm= and embeddings= (see Ragas docs). ) ```