AI 에이전트 비용을 줄이려면, 기억을 더 자주 지워야 할까요?
핵심 요약 (TL;DR)
Asana는 10월 8일 브라우저 에이전트의 비용과 실행 시간을 개선한 실험을 공개했습니다.[1] 핵심은 더 싼 모델 하나를 고른 일이 아니라, 매번 바뀌던 작업 기록을 재사용하기 좋은 형태로 유지한 것입니다. AI가 만든 자동화의 비용이 부담스럽다면, 모델 가격표와 함께 ‘같은 자료를 어떻게 다시 보내는가’를 살펴볼 이유가 있습니다.
기록을 줄이는데 왜 비용이 늘었을까요?
Asana의 설명에 따르면 기존 에이전트는 도구와 시스템 지시문은 캐시했지만, 쌓여 가는 페이지 내용과 화면 캡처는 충분히 재사용하지 못했습니다. 매 단계마다 이전 캡처를 없애고 오래된 텍스트를 잘라 내면서 요청의 앞부분이 바뀌었기 때문입니다.[1]
이 실험에서 캐시는 앞에서부터 바뀌지 않은 부분을 재사용하는 방식입니다. 보내는 글을 짧게 만들려는 정리가 오히려 재사용을 깨뜨릴 수 있는 셈이지요. 따라서 ‘기록이 길면 비싸다’와 ‘기록을 지우면 싸진다’를 항상 같은 말로 볼 수는 없습니다. 어떤 제공사의 어떤 캐시 규칙을 쓰는지부터 확인해야 합니다.
팀은 무엇을 바꾸고 어떻게 확인했나요?
팀은 작업 기록도 캐시하고, 캡처를 매번 지우는 대신 일정량이 쌓였을 때 묶어서 정리했습니다. 텍스트를 보관할 수 있는 범위도 늘렸습니다. Codex 안의 GPT-6 Astra가 코드를 조사하고 실험을 실행했으며, 사람은 목표와 기준을 정하고 결론을 검토했다고 설명합니다.[1][2]
각 세션의 요청과 실행 흔적, 결과는 Command에 보존했습니다. 분석 결과는 작업 항목과 코드 변경안으로 이어졌고, 검토한 수정은 StackAI에 반영됐다고 합니다.[1] 이는 회사가 공개한 개발 사례이지, 이 글에서 코드를 실행해 재현한 성능 검증은 아닙니다.
‘76배 저렴하다’는 제목은 어떻게 읽어야 하나요?
발표의 큰 수치는 기존 Model B의 운영 설정과, 개선한 GPT-6.1 Sol 설정을 비교한 결과입니다. 같은 모델에서 설정만 바꾼 비교가 아니므로 모델 교체만의 효과로 읽으면 안 됩니다.[1][2] 원문은 조건별 실행 수가 적어 근소한 차이를 구분하기보다 큰 경향을 보여 주는 실험이라고 한계를 밝힙니다.[1]
또한 추정 모델 비용은 앱 전체의 운영비와 다릅니다. 서버, 관리자의 검수 시간, 오류를 복구하는 비용까지 함께 줄었다는 뜻은 아닙니다. 여러분의 앱에 같은 절감률을 약속하기보다, 비교한 기준과 빠진 비용을 먼저 확인하는 편이 정확합니다.
작은 업무용 MVP에서는 무엇부터 기록하면 좋을까요?
예를 들어 공개 상품 목록을 읽어 표로 만드는 자동화라면, 정답을 직접 확인할 수 있는 작은 목록을 먼저 준비해 보세요. 바꾸기 전후에 같은 항목을 처리하게 하고, 정답 누락·실행 시간·사용량 기록을 함께 남기는 방식입니다. 이는 해당 연구를 그대로 재현하는 절차가 아니라 첫 점검을 위한 제안입니다.
처음부터 긴 기억을 허용하기보다, 같은 페이지를 반복 방문하는지와 기록을 언제 자르는지를 살펴보세요. 비용을 낮췄어도 빠진 항목이 늘었다면 원하는 개선이 아닙니다. 원문 역시 잘못 진행되는 작업의 비용을 제한하도록 단계 수·토큰·작업별 비용의 상한을 둘 필요가 있다고 강조합니다.[1]
FAQ: 화면 캡처를 전부 남기면 더 좋은가요?
단정할 수 없습니다. 원문은 캡처를 유지하는 후속 실험도 다뤘지만, 긴 작업이나 작은 컨텍스트에서는 정리가 여전히 필요하다고 설명합니다. 고객 자료가 담긴 캡처라면 보관 권한과 기간도 별도로 정해야 합니다.[1]
FAQ: 구독료도 이 비율만큼 줄어드나요?
아닙니다. 이번 수치는 특정 실험의 모델 사용량으로 추정한 비용입니다. 월 구독료나 여러분의 청구액에 같은 비율을 적용할 근거는 없습니다.[1][2]
출처
[1] https://asana.com/inside-asana/cut-browsers-agent-cost
[2] https://openai.com/index/asana-browser-agent/
댓글 0
아직 댓글이 없습니다