Находка одна, и речь идет не о графиках. Речь идет о том, как был получен результат, который вы цитируете. Для вопросов, ориентированных на широту смысла, сводки сообщества GraphRAG достигли полноты от 72 до 83 процентов и разнообразия от 62 до 82 процентов...
Находка одна, и речь идет не о графиках. Речь идет о том, как был получен результат, который вы цитируете.
Для вопросов, ориентированных на широту смысла, сводки сообщества GraphRAG достигли 72–83 процентов полноты и 62–82 процентов процента выигрыша по разнообразию, а сводки корневого уровня сокращают количество токенов ответов примерно на 97 процентов (arXiv: 2404.16130). Это цифры, которые цитирует категория.
They were produced by an LLM judge, with no gold answers.
Score the same kind of comparison against ground truth and it turns over. On ROUGE-2 against gold answers, GraphRAG loses to plain RAG: 6.99 against 10.08 on SQuALITY, and 3.23 against 6.32 on QMSum. The same paper reports that summary-ordering position bias can flip the LLM judge's preference on its own (arXiv:2502.11371).
Оба результата верны
Это та часть, с которой стоит сидеть. Neither number is wrong and neither paper is sloppy.
Один из показателей, который предпочитает модель. Другие меры совпадают с золотым ответом. Это разные вопросы, поэтому на них могут быть разные ответы, и сравнение, которое выглядит решающим, часто является лишь одним из двух громко заданных вопросов.
The same seam runs through the retrieval verdicts. На Гра