LLM 컨텍스트 조립은 어디서 토큰 낭비를 만들까
LLM의 토큰 낭비는 모델 안에서만 생기는 문제가 아니라 요청을 만들기 전 컨텍스트 조립 단계에서 자주 시작된다. 시스템 지시, 사용자 질문, 대화 이력, 참고 문단이 하나의 요청으로 합쳐질 때 불필요한 내용이 섞일 수 있다. 낮은 관련도 문단과 중복 히스토리는 답 품질을 크게 높이지 못하면서 입력 토큰을 차지한다. 판단 기준은 “이 문맥이 현재 질문의 결론이나 근거를 바꾸는가”다. … 더 읽기