BioASQ Task 14B 2026 시스템을 다룬 이 프리프린트는, 첫 단계 검색이 약할 때 얼마나 적극적으로 다시 찾을지와 여러 언어모델 답변을 어떻게 묶을지를 함께 검토했다. 저자 소속은 PDF 첫 페이지에 University of Technology Sydney로 표시된다. 작업 전반은 두 개의 병렬 검색 경로를 합치는 구조다. 하나는 dense BGE, BM25, RRF를 묶은 하이브리드 첫 단계이고, 다른 하나는 PubMed·Europe PMC·iCite로 질문을 분해하는 에이전트 경로다. 여기에 BGE cross-encoder 품질 게이트를 붙여 약하게 지지된 질문만 선별적으로 재검색한다.
평가는 Task 12B 2024 validation, Task 13B 2025 held-out test, Task 14B 2026 preliminary leaderboard로 단계와 공개 상태를 구분해 진행됐다. 이와 별도로 BioASQ-13b historical archive retrieval slice에서는 하이브리드 첫 단계가 R@200 99.3%를 기록했다. 전체 초록을 쓴 검색은 snippet-only 방식의 약 82% 한계를 약 96%로 높였고, 같은 별도 분석에서 BM25-only와 semantic-only는 각각 80.6%와 약 83% R@200에서 정체됐다. 이 수치는 검색기 회수율 상한을 비교한 결과이며, 전체 시스템 성능을 뜻하지 않는다.

재검색 정책 비교에서는 비용을 아끼는 쪽이 성능도 해치지 않았다. Validation 340문항에서 비용-실용형 정책 B는 무차별 재검색 정책 A보다 재검색 비용을 약 12% 줄이면서 list F1 0.4733, list precision 0.4737을 기록했고, A의 0.4477과 0.4438보다 유의하게 높았다. list recall은 0.5192로 A의 0.5051보다 높았지만, 신뢰구간이 0을 넘나들어 우위가 아니라 비열등으로 해석됐다. yes/no accuracy는 둘 다 0.9216이었다.
답변 결합 쪽에서는 지표 구조가 핵심 변수로 제시된다. 선택이 중심인 yes/no나 multi-reference ROUGE는 LLM 판단으로도 충분할 수 있지만, factoid rank-1이나 synonym matching이 들어간 list recall처럼 재현율이 중요한 지표는 합집합식 결합기가 더 유리하다는 설명이다. 이 프리프린트는 실험 전에 이미 그런 분해를 예측했으며, 실제로 Task 13B 2025에서 synonym-union resolver는 list recall 0.6528로 가장 높은 값을 보였다. 같은 테스트에서 GPT-5.5 solo는 list F1 0.6518로 앞섰는데, resolver가 더 넓은 아이템 집합을 내면서 precision을 희생했기 때문이다.
리더보드 결과는 세부 셀마다 다르게 갈렸다. Task 14B 2026 preliminary leaderboard에서 팀은 8개(phase x batch) 리더보드 중 3개에서 combined-exact aggregate 1위를 했고, 4개 개별 질문 유형 셀을 가져갔다. Phase B b3 ideal에서는 crossmodel이 R-SU4 F1 0.255로 1위를 했지만 combined exact에서는 더 단순한 agent-only c1에 0.002 뒤졌다. 저널 심사 전 arXiv 프리프린트인 만큼, 이런 결과는 정식 동료검토가 아니라 워크숍 공개 평가와 사전 리더보드에 기반한 해석이다.
| 비교 대상 | 핵심 수치 | 근거 위치 |
|---|---|---|
| 하이브리드 첫 단계 검색 | BioASQ-13b historical archive에서 R@200 = 99.3% | p.1 | abstract |
| 비용-실용형 재검색 정책 B vs 무차별 재검색 정책 A | list F1 0.4733 vs 0.4477, list precision 0.4737 vs 0.4438, 재검색 비용 약 12% 감소 | p.6 | Table 2 |
| synonym-union resolver vs GPT-5.5 solo | Task 13B 2025에서 list recall 0.6528 vs 0.6440, list F1은 GPT-5.5 solo가 우위 | p.10 | Table 4 |
| Task 14B 2026 preliminary leaderboard | combined-exact aggregate 3/8 1위, 개별 질문 유형 셀 4개 1위, Phase B b3 ideal #1 | p.2 | abstract; p.13 | source_excerpt |
자료: STORIUM 정리
전체적으로 이 연구는 고정된 프롬프트와 모델 아래에서도 검색 쪽 개선 여지가 크고, 지표에 따라 선택과 결합의 유리함이 달라진다는 점을 보여준다. 동일 조건에서 val과 test 13B의 gold-input pool 사이 list F1 격차는 절대값 +0.132로 보고됐지만, 질문 집합이 달라 순수한 검색만의 효과로 단정할 수는 없다고 적었다. 요약하면, BGE 품질 게이트는 비용 효율적인 재검색을 돕고, 동의어 합집합 결합기는 재현율을 끌어올리지만 정밀도와의 교환관계를 만든다.
저작권자 © STORIUM 무단전재 및 재배포 금지













