← Mealplanning 페이지로
측정 방법과 뒤집힌 1차 판단정제한 실측 원본
출처 · AI 모델 이전 실측 벤치마크  |  시점 · 2026-07-28
지표 · 11모델 × 50케이스 = 550건 · 에러 0
이 근거로 내린 판단 · 코드 구조상 이관 가능하다는 초기 판단을 실제 측정으로 다시 검토함

1. 측정 방법 (재현 가능하게 전부 명시)

1.1 무엇을 몇 번 측정했나

항목
모델 수11개 (서울 4 · 도쿄 5 · 리전비교 1 · Google 1)
모델당 케이스50개 = 평문 챗 25 + 무말투 구조화 25
총 LLM 호출550건 (에러 0건)
추가 OCR 실측claude-3-haiku × 15장(실물 13 + 합성 2)
사전 OCR 실측Nova Lite/Pro × 15장, Gemini 기준선(문서 T4)
측정일2026-07-28

1.2 트랙 A — 평문(사람 말투 반영)

1.3 트랙 B — 무말투(구조화 추출)

1.4 채점의 정직한 한계


4.5 부수 발견 — 가드레일 오탐 (모델 이전과 독립된 개선건)

챗 실패 109건(11모델 합산)을 분해하면 대부분이 모델 결함이 아니다.

구분건수비율성격
질문-되풀이 오탐82건75%환각 아님 — 가드레일 결함
실제 결함(환각·이름누락)27건25%진짜 모델 문제

원인: check_output_grounded(answer, reference)template 출력만 근거로 삼고 유저 질문은 보지 않는다.

프로덕션 영향: 오판 시 refine 결과를 버리고 template으로 fallback → 유료 LLM 호출을 하고도 결과를 폐기(비용 낭비 + 자연스러운 문장 손실). 해당 패턴("재료 말하며 추천 요청", "예산 말하며 추천 요청")은 실사용 빈도가 높다.

수정안 — 근거에 질문을 합산(유저가 이미 말한 것의 되풀이는 환각이 아니다):

# services/chat/app/pipeline/generator/gemini.py 호출부
check_output_grounded(polished, base.text + "\n" + question.raw_text, self._ingredient_index)

추가로 한글 수사 정규화("8천원"→8000)를 넣으면 숫자 오탐도 해소된다.

⚠️ 이 수정은 모델 순위·이전 결론을 바꾸지 않는다 — 전 모델(현행 Gemini 포함) 점수가 함께 오르기 때문. 리더보드의 "변별 18케이스"는 이미 이 오탐을 제외한 값이다.