検証: jev-rerankerの「92%削減」を追試: 閾値0.2は日本語だと攻めすぎだった

00:01:19 ・ source: https://zenn.dev/mskbhd/articles/lab-723-jev-reranker-92

Transcript

hostenToday we verify jev-reranker's claim of 92% document reduction without losing search quality.
guestjajev-rerankerが、100件中92件の文書を捨てても検索品質が落ちないという主張を検証する記事ですね。
hostenRight, but the threshold 0.2 works well in English yet fails for Japanese with only 0.10 as the limit.
guestja英語では閾値0.32まで正解を落とさないのに対し、日本語では0.10が上限というわけです。
hostenThe root cause: Japanese translations lower correct document scores by 0.067 on average, while wrong documents score slightly higher.
guestja日本語では正解のスコアが平均0.067下がる一方、ノイズのスコアはむしろ0.012上がるため、マージンが縮まってしまうんです。
hostenThe solution: use relative thresholds like 'max score per query × 0.2' instead of absolute 0.2.
guestjaそこで、各クエリの最高スコアに対する比率(0.2倍など)で切ると、日英8条件すべてで正解保持90%以上を達成できました。
hostenRanking order stays accurate (AUROC 0.99), only the absolute score scale shifts between languages.
guestja興味深いことに、順位関係(AUROC 0.99)は正確に保たれていて、動いているのは絶対値のスケールだけなんです。