
01 · THE QUESTION
Context window가 커졌다면 문서를 전부 넣어도 될까
긴 context는 더 많은 정보를 담을 수 있게 하지만, 어떤 정보를 보여줄지 결정해 주지는 않습니다. 관련 문서가 너무 늦게 배치되거나 비슷한 noise에 둘러싸이면 모델은 중요한 근거를 놓칠 수 있습니다. 비용과 latency도 입력 길이에 따라 함께 증가합니다.
02 · PIPELINE
Vanilla RAG를 펼치면 실패 위치가 보입니다
RETRIEVAL PIPELINE
question
→ query normalization
→ embedding / search
→ top-k candidates
→ reranking / filtering
→ context assembly
→ generation
→ citation validation최종 답이 틀렸다고 해서 항상 generation model이 문제인 것은 아닙니다. 질문이 검색용 query로 잘 바뀌지 않았을 수 있고, 필요한 chunk가 index에 없거나, 후보에는 있었지만 reranker가 떨어뜨렸거나, prompt 안에서 불리한 위치에 배치됐을 수 있습니다.
| Failure surface | 대표 증상 | 먼저 확인할 증거 |
|---|---|---|
| Indexing | 필요한 내용이 후보에 전혀 없음 | 문서 version, chunk boundary, metadata |
| Query | 표현이 다른 동의어·조건을 놓침 | 원 질문과 검색 query 비교 |
| Retrieval | 관련 문서 순위가 너무 낮음 | Recall@k, candidate ids |
| Reranking | 후보에는 있으나 최종 context에서 제거 | Pre/post-rerank 순위 |
| Placement | 근거가 context 중간 noise에 묻힘 | Prompt 내 위치와 주변 chunk |
| Generation | 근거가 있는데도 다른 결론을 생성 | Groundedness와 citation mapping |
03 · TOP-K
Top-k를 늘리면 recall과 noise가 함께 늘어납니다
더 많은 chunk를 넣으면 필요한 근거가 포함될 가능성은 커집니다. 동시에 irrelevant context와 중복 문장이 늘고, 모델이 근거를 고르는 부담도 커집니다. 따라서 k 하나를 전역 상수로 두기보다 질문 유형과 confidence, reranker 성능, token budget에 따라 조절해야 합니다.
Long context가 잘하는 일
이미 읽을 문서가 정확히 정해졌고 문서 내부의 여러 부분을 함께 비교해야 할 때 유용합니다. 반대로 corpus가 크고 어떤 문서를 읽어야 할지 모르는 상태에서는 retrieval을 대체하지 못합니다.
Lost in the middle을 배치 문제로 다루기
가장 중요한 근거를 처음이나 질문 가까이에 두고, 중복 chunk를 제거하며, section heading과 source boundary를 보존해야 합니다. Context assembly는 검색 결과를 단순히 이어 붙이는 단계가 아니라 정보 우선순위를 설계하는 단계입니다.
04 · CONTEXT
Contextual retrieval은 chunk에 잃어버린 배경을 돌려줍니다
작은 chunk는 검색에 유리하지만 원래 문서의 제목, 장, 시점, 대상 같은 배경을 잃기 쉽습니다. Chunk를 embedding하기 전에 짧은 문서 맥락을 붙이거나 metadata filter를 함께 사용하면, 같은 단어를 가진 다른 문서와 구분하는 데 도움이 됩니다.
| Context engineering 질문 | 설계 선택 |
|---|---|
| 무엇을 넣을까? | Relevant evidence와 필수 instruction만 선택 |
| 얼마나 넣을까? | Question complexity와 budget에 따라 동적 k |
| 어떤 순서로 넣을까? | 핵심 근거 우선, source boundary 보존 |
| 무엇을 버릴까? | 중복·stale·low-confidence context 제거 |
| 실패를 어떻게 알까? | 검색 confidence와 citation validator를 노출 |
05 · PRACTICE
실패를 눈으로 확인하는 작은 실험
- 정답 근거가 문서의 앞, 중간, 뒤에 있는 세 질문을 만듭니다.
- Full document, naive top-k, reranked top-k, contextual chunk 네 조건을 비교합니다.
- 후보 recall, 최종 context precision, groundedness, citation correctness를 따로 기록합니다.
- 정답 여부와 함께 token, time to first token, total latency를 비교합니다.
- 실패한 질문에서 근거가 어느 단계에서 사라졌는지 trace로 표시합니다.