AI 에이전트의 비용을 관리하기 위한 전략과 방법론을 정리한 문서입니다.
기본 원칙
- LLM이 판단에 사용해야 할 내용만 넘기고 불필요한 내용은 지웁니다.
- LLM 보통 토큰 단위로 과금되고 Long context는 성능 저하로도 이루어지므로 기본입니다.
- Prompt Caching
- 여러 요청이 동일한 앞부분을 반복하면 Prefix의 계산 결과를 재사용 가능합니다. 주요 LLM Provider는 대부분 이 기능을 지원합니다.
- 안정된 System Instruction·Tool 정의·공통 문서를 앞에 둡니다.
- 실제로 Cache hit가 일어나고 비용과 TTFT 감소로 이루어지는지 확인합니다.
- 작업 난이도와 크기에 따라 모델을 나눕니다.
- 예를 들어, 단순 도구 호출이나 분류 작업은 가벼운 모델로도 충분합니다.
- 비용 최적화는 실제 평가와 데이터를 기반으로 수행하고, 성능과 Tradeoff를 따진 후 적용합니다.
방법론
외부에서 효과가 있었다고 주장하는 방법론을 모아 둔 것입니다.
IC-Cache
큰 모델의 응답을 작은 모델의 Context로 활용하여 작은 모델로도 답변 품질을 유지하며 비용과 Latency를 줄이는 기법입니다.
- 큰 모델이 한 좋은 답변을 작은 모델에 사용하는 것은 충분히 실전성이 있습니다. 개인/소규모 단계에서도 Claude Code/Codex의 사고 과정을 운영 제품의 Light model이 활용하게 할 수 있습니다.
- 질문 난이도나 예제 품질에 따른 동적 라우팅과 피드백 루프는 이후에 고려합니다.
Nvidia’s Switchyard router
최근 호출 결과를 규칙 기반으로 점수화하고, 그 점수에 따라 모델을 변경하는 방식입니다. 예를 들어 어떤 작업에 대한 품질이 좋지 않으면 더 좋은 모델로 올리는 식입니다. 규칙 기반으로 판단이 힘들 경우 선택적으로 LLM이 판단할 수 있습니다.
전반적으로 Valid한 방식이지만, 평가 파이프라인을 견고하게 구축해야 합니다.