첫 사건으로 파이프라인을 시험하고 난이도 기준 고치기
첫 사건을 만들며 사건이 계속 너무 쉽게 풀리는 원인을 찾고, 난이도 기준과 검사 도구를 고쳤습니다.

개요
어제 설계한 흐름으로 메이지 시대 도쿄의 저택을 배경으로 한 첫 사건을 만들었습니다. 목표 난이도는 중입니다. 사건 파일은 나왔지만 AI 풀이자와 사람 모두 너무 쉽게 풀어서, 원인을 찾고 기준을 고쳤습니다.
사건 파일을 만들고 규칙으로 검사하기
추리 설계 문서의 표를 읽어 사건 파일을 만드는 스크립트와, 앱이 사건을 열 때 확인하는 규칙과 형식 규칙을 검사하는 스크립트를 작성했습니다. 사람이 직접 풀어 보는 플레이 페이지도 만들었습니다. 앱과 같게 범인 40점, 동기 25점, 수법 25점, 결정적 증거 10점을 매기고, 틀리면 틀린 첫 항목의 힌트 하나만 보여 줍니다.
사건이 너무 쉬운 원인 찾기
단서 문장을 세 번 고쳤지만 AI 풀이자 세 명은 매번 힌트 없이 풀었고, 사람도 범인과 동기, 수법이 한 번에 보인다고 했습니다. 범인의 의심 점수는 처음부터 다른 용의자보다 훨씬 높았습니다. 원인이 문장보다 위에 있었습니다.
| 원인 | 내용 |
|---|---|
| 스토리 뼈대 | 범행 시각에 현장으로 불려 간 사람이 범인뿐 |
| 미끼 옆의 해독제 | 함정 단서 바로 옆에 그것을 푸는 단서가 있음 |
| 선택지 | 정답 선택지만 사건 개요와 같은 말을 씀 |
| 점검 과정 | 모순을 고치며 해명을 더 분명히 해 소거가 쉬워짐 |
해금과 의심 분산 기준 정하기
결정적 단서 일부를 잠가 두고, 정해진 다른 단서를 모두 확인해야 열리게 하는 해금 규칙을 만들었습니다. 잠그는 개수는 하 1개, 중 3개, 상 5개입니다. 빌드할 때 열리지 않는 잠금이나 순환이 없는지 검사합니다.
"unlocks": [
{ "evidenceID": "document.letter", "needCount": 3,
"from": ["evidence.dock", "person.maid", "document.receipt"] }
]
중요: 앱은 아직 해금을 지원하지 않습니다. 지금은 플레이 페이지에서만 시험합니다.
의심 정도에도 목표를 두었습니다. 처음 열린 단서를 다 읽었을 때 유력 용의자들이 비슷하게 의심받고 범인은 조금만 앞서야 합니다. 중이라면 범인 3540%, 다른 유력 용의자 2530%입니다. 다시 짠 스토리는 처음에 범인 60%로 쏠렸고, 열린 단서의 무게를 옮겨 37%로 맞췄습니다.
풀이자와 잣대 바꾸기
성능이 높은 모델은 대사를 빠짐없이 읽고 소거해서 잘 짜인 사건을 거의 다 풉니다. 그래서 일반 플레이어에 가까운 가벼운 모델로 풀이자를 바꾸고, 사람의 플레이 결과를 AI 판정보다 우선하기로 했습니다.
결과와 남은 과제
역할 카드에 해금, 혼동 요소, 의심 분산 기준을 넣고, 셀 수 있는 기준을 미리 걸러 주는 검사 도구와 함께 프롬프트 모음 저장소에 정리했습니다. 첫 사건의 스토리는 새 기준으로 다시 짜서 잠갔습니다.
남은 과제는 추리 설계를 새 기준으로 다시 만들고, 바뀐 풀이자로 검수한 뒤 사람이 직접 풀어 보는 일입니다.