← Mealplanning 페이지로
가드레일 수정 효과 — 같은 275건 재측정정제한 실측 원본
출처 문서 · AI 품질 고도화 검증 — 실험 A  |  측정 시점 · 2026-07-28
지표 · 통과 건수 / 275 (pass count · 정확도 아님)
이 근거로 내린 판단 · 모델 교체나 LLM 호출 추가 없이 판정 로직 수정으로 통과 건수를 개선함
원본 문서에서 해당 구간만 추출해 공개용으로 정리한 사본입니다. 측정값은 원본과 같습니다.

실험 A — 가드레일 수정 효과 (추가 호출 0건)

가설: 실패 109건 중 75%는 환각이 아니라 유저 질문의 재료·예산을 되풀이한 것을 가드레일이 오판한 결과다. 근거에 질문 텍스트 + 금액 정규화를 합산하면 회수된다.

현행 판정수정으로 회수
gemini-flash-lite
19→25
glm-47-tokyo
19→25
nova-micro-tokyo
17→25
gemma-3-27b-tokyo
16→24
nova-micro-seoul
16→24
qwen3-235b-tokyo
16→24
deepseek-v32-tokyo
14→22
nova-pro-seoul
15→22
nova-lite-seoul
13→21
qwen3-32b-tokyo
11→18
claude-3-haiku-seoul
10→17

합계 166/275(60%) → 247/275(90%) · 81건 회수 · 추가 LLM 호출 없음. 근거 문자열 구성만 바꾼 변경이라 판정 로직 밖의 호출을 새로 만들지 않는다.

수정 후에도 남은 실패는 지식경계 창작(C04 김치찌개·C08 된장찌개·C15 불고기)에 집중 — 이것이 실험 B의 표적이 됐다.