프롬프트 캐시가 파손되면 하네스 구축, 내부 AI 플랫폼 운영, AI 제품 배송을 하는 조직에 4 연구소 모델을 기준으로 측정하고 실시간 트래픽에 따라 가격이 책정되며, 수정 방법과 지속적인 모니터링 방법.
Developed by Robert E. Beckner III (Merlin) | rbeckner.com
몇 년 전, AI가 날짜와 시간을 잘 모르는 이유를 궁금해했습니다. 대화에서 오늘이 무슨 요일인지 물으면 몇 초가 걸렸고, 즉각적인 답변을 기대했습니다. 대화를 실행하는 컴퓨터는 현재 시간을 알고 있습니다.
그 이유의 일부를 이해하게 되었습니다. 사람은 다음 날 대화로 돌아갈 수 있고, 시작 시점에 주어진 시간은 오래되어 버립니다. 다시 공급해야 합니다. 하네스는 모델 주위에 있는 프로그램으로, 각 요청을 조립하고 루프를 실행하며, 매 요청 전에 현재 시간을 모델 지침에 기록함으로써 이를 수행할 수 있습니다. 우리는 프로덕션에서 사용하는 에이전트 러너가 바로 그 일을 했습니다.
나는 오랫동안 프롬프트 캐싱에 대해 알고 있었습니다. 공급자는 요청 시작을 저장하고 다음 요청이 같은 방식으로 시작될 때 가격의 일부만 청구합니다. 나는 한 줄이 시간과 같은 것을 넣었을 때 그 효과를 충분히 이해하지 못했습니다. 우리는 자체 프로덕션 비용에서 답을 찾았고, 각 4개 연구소의 현재 모델과 OpenRouter의 공개 수치를 기준으로 제대로 측정하기 위해 일련의 실험을 지시했습니다.
답은 비쌉니다. GPT-6 Luna에서 잘못된 위치에 기록된 시간은 대화의 모든 턴을 필요한 만큼 5.7× 비용이 들게 했으며, 오류는 발생하지 않았습니다. 트래픽 조직은 이 모델들을 전송하며, 입력은 토큰의 96–99%와 실제로 지불된 달러의 66–87%이며, 따라서 캐시는 대부분의 청구를 결정합니다. 자체 하네스를 구축하거나 내부 AI 플랫폼을 운영하거나 AI 제품을 배송하는 조직에게는, 이와 같은 실수가 매 턴마다 비용을 배가시키며, 실행되는 한 조용히 진행됩니다.
여기의 모든 턴당 숫자는 2026년 9월 23일에 측정되었으며, OpenRouter를 통해서입니다. 시장 수치는 OpenRouter의 자체이며, 같은 날 읽습니다.
모델에 대한 모든 호출은 전체 대화를 다시 전송합니다: 도구 정의, 시스템 프롬프트(하네스가 작성한 고정 지침), 이전 모든 턴, 그리고 새 메시지.
공급자는 최근 요청의 처리된 시작 부분을 보관합니다. 다음 요청이 동일한 텍스트로 시작하면 공급자는 그 저장된 접두사를 읽어 다시 처리하지 않습니다. GPT-6 Luna에서는 OpenRouter이 읽기에 0.10×의 나열된 입력 가격을 청구하고 첫 번째 쓰기에 1.25×를 청구합니다. 매 턴마다 다시 작성되는 프롬프트는 캐시가 전혀 없는 프롬프트보다 비용이 더 많이 듭니다.
요청의 시작 부분만 재사용될 수 있습니다. 어느 지점에서든 변경이 있으면 그 이후의 모든 것이 무효화됩니다:
Diagram source
graph LR
A[도구 정의] --> B[시스템 프롬프트]
B --> C[이전 턴]
C --> D[새 사용자 메시지]
B -. a changed line here voids B, C and D .-> D
하네스가 시작 부분에 작성하고 매 턴마다 변경되는 모든 것은 전체 대화를 위험에 빠뜨립니다. 현재 시간은 가장 단순한 예시입니다.
이 발견은 우리가 운영 중인 프로덕션 에이전트에서 시작되었습니다. 그 비용 장부는 모든 호출을 리스트 가격으로 책정했고 전혀 캐싱이 없음을 보여 주었습니다. 나는 경보를 울리고 다른 모델로 전환할 가능성을 평가하기 시작했습니다.
내가 함께 일하던 에이전트는 먼저 장부 자체가 잘못되었음을 발견했습니다. 33 호출에서 그는 $0.064를 추정했고, 공급자는 $0.023, 2.7× 적게 청구했습니다. 토큰 수를 기준으로 각 호출을 가격 책정하면 공급자가 적용한 모든 할인을 없앴습니다. 공급자가 보고한 비용을 읽으면 각 턴 내부에서 캐싱이 작동하고 새 턴이 시작될 때 실패함을 보여 주었습니다.
첫 번째 설명은 같은 서버에서 요청을 유지할 세션 키가 없었다는 것이었습니다. 자신의 탐지는 이를 반박했습니다: 동일한 프롬프트가 이미 GPT-6 Luna에서 턴 간에 캐시에서 읽혔고, 세션 키, 캐시 키 또는 명시적 캐시 마커를 추가해도 아무 변화가 없었습니다. 원인은 시스템 프롬프트 자체에 있었습니다. 95% 정도의 진행 중에, 러너는 매 턴마다 바뀌는 두 줄을 작성했습니다: 턴별 작업 디렉터리와 분 단위 시계. 턴의 첫 번째 호출마다 전체 프롬프트를 다시 작성했습니다 1.25×.
두 줄을 사용자의 메시지 끝으로 옮기면 프로덕션에서 해결되었습니다. 턴 2와 3는 이제 0.47–0.51×로 열리며, 1.25× 대신입니다. 나머지는 러너가 여전히 사용자 메시지에 보내는 턴별 컨텍스트 블록입니다.
이 모든 것이 측정되기 전 내 추측은, 결정론적 검사가 시간이 오래되었을 때만 시간을 제공하고, 별도의 메시지로 남겨 두며 나머지 프롬프트는 캐시된 상태로 두는 것일 수 있다는 것이었습니다. 그것은 한 가지 조건을 가지고 있으며, 그 조건은 나머지 기사에서 적용되는 규칙입니다.
직접 테스트하기 위해 우리는 같은 대화를 실행하면서 시계를 다른 위치에 두고, 매 쌍 사이에 분이 바뀌도록 65초 간격으로 돌리는 프로브를 만들었습니다. GPT-6 Luna, 8.5K-토큰 시스템 프롬프트, 3 복제합니다:
시계가 가는 곳
개방 전환
캐시에서 읽기
다시 쓰기
가격 vs 나열된 입력
시계 없음 (제어)
12
12
0
0.10×
시스템 프롬프트 끝
12
0
12
1.25×
두 번째 시스템 메시지
12
0
12
1.25×
사용자 메시지 시작
12
12
0
0.10×
사용자 메시지 끝
12
12
0
0.10×
자신의 메시지, 매 턴
12
12
0
0.11×
자신의 메시지, 오래된 경우에만
12
12
0
0.10×
내 별도 메시지는 캐시를 두 가지 형태로 보관했고, 매 턴마다 그리고 오래된 경우에만. 조건은 메시지가 위치한 곳입니다. 안정된 지침 이후에, 제공자는 그 이전의 모든 것을 읽습니다. 두 번째 시스템 메시지로서, 지침들 사이에 놓여 있으며, GPT-6 Luna는 12의 12 턴에서 전체 프롬프트를 다시 작성했습니다.
캐시는 텍스트를 비교하므로 시계는 텍스트가 동일한 한 무해하다. 같은 프로브에서 4초 간격으로 회전시킬 때, 시스템 프롬프트의 분 단위 시계는 매번 캐시에서 읽는다. 65초 간격으로 회전시킬 때마다 전체 재작성(리라이트)을 강제했다.
해상도는 그 빈도를 설정한다. 시스템 프롬프트의 시계(1시간)와 날짜 라인은 모두 65초 실행의 모든 12 턴 개시에서 캐시에서 읽는다, 왜냐하면 둘 다 롤오버되지 않았기 때문이다. 그들은 또한 한 번에 한 시간과 하루에 한 번씩 끊어진다. 분 단위 시계는 이전보다 나중 분에 시작되는 모든 턴에서 끊어진다.
캐시 자체도 만료된다. 단일 타임드 실행에서, GPT-6 Luna는 여전히 30분 유휴 후에 저장된 접두사를 읽었고, 1.25× 후에 전체 프롬프트를 다시 썼다 60. DeepSeek V4.1 Flash는 10분 후에 읽었고, 60 후에 놓쳤다. Claude Opus 5.5는 이미 10 후에 놓쳤다, 왜냐하면 Anthropic의 기본 캐시는 5분 지속되고, 그 1-시간 캐시는 2× 비용이 든다. 다음 날 대화로 돌아오는 사람은, 이 기사가 시작된 경우와 같이, 세 가지 모두에서 오래된 시간과 차가운 캐시를 찾는다. 그 첫 번째 턴은 전체 프롬프트를 지불한다, 하네스가 무엇을 하든지 관계없이. 배치는 그 뒤의 턴이 또한 그렇게 되는지 여부를 결정한다.
GPT-6 Luna는 한 공급자의 답변이다. 교훈이 얼마나 일반적인지 보기 위해, 우리는 4 연구소의 현재 모델 각각에 대해 동일한 배치를 실행했고, 동일한 2.5K-토큰 프롬프트를 사용했으며, 각 모델은 단일 공급자에 고정되었다:
Price of each turn's first call, by where the clock is written (median, multiple of the listed input price)Chart data
multiple of listed input price
GPT-6 Luna (OpenAI)
Claude Opus 5.5 (Anthropic)
DeepSeek V4.1 Flash (DeepInfra)
No clock
0.11
0.07
0.03
System prompt
1.25
1.24
0.13
Second system
1.25
0.08
0.04
User message
0.12
0.08
0.04
Reference line, listed input price: 1
GPT-6 Luna는 전체 메시지를 캐시한다. 한 줄이 바뀌면 그 줄을 포함한 메시지와 이후 모든 내용이 무효화된다.
Claude Opus 5.5는 호출자가 표시한 부분만 캐시한다. Anthropic의 모델은 하네스가 배치한 cache_control 마커까지만 캐시한다. 마커가 없으면 동일한 프롬프트가 매 호출마다 전체 가격을 청구했다. 시스템 프롬프트에 마커가 있으면, 그 블록 내부의 시계는 1.24× 비용이 들었고, 그 뒤에 있는 두 번째 시스템 메시지의 시계는 0.08× 비용이 들었다. GPT-6 Luna가 처벌하는 배치는 Opus에서 안전하다. Opus 가격에서 턴이 열릴 때마다 차이는 $0.0214 대 $0.0023였다. Opus는 동일한 프롬프트를 GPT-6 Luna가 2,395를 세는 대신 4,056 토큰으로 계산했다. 따라서 동일한 텍스트는 가격이 적용되기 전에 1.69× 더 많은 토큰을 소비한다.
DeepSeek V4.1 Flash는 256-토큰 블록으로 캐시하고, 쓰기에 추가 비용을 부과하지 않는다. 읽기는 정확히 256의 배수로 돌아왔다: 변경되지 않은 프롬프트는 2,560 토큰, 시스템 프롬프트 끝에 시계가 있는 경우는 2,304 토큰이었다. 한 줄이 바뀌면 그 줄을 포함한 블록만 비용이 발생한다. 최초 호출은 일반 입력 가격으로 청구되었고, 읽기는 0.03–0.04× 비용이 들었다. 배치당 8 실행에서, 2개의 단일 호출은 같은 실행에서 읽은 턴에서 캐시를 놓쳤다. 이는 요청이 다른 서버에 도착한 것으로 해석되며, 배치의 효과가 아니라는 의미다. DeepSeek의 자체 엔드포인트는 자동으로 캐시를 표시하는 유일한 OpenRouter 마커이며, 내 계정의 개인정보 설정은 해당 엔드포인트가 유료 트래픽을 학습하기 때문에 제외한다. 실행은 DeepInfra를 통해 진행되었으며, 이는 캐시를 사용했고 Fireworks와 Morph도 2회 호출 검사에서 캐시했다.
Muse Spark 1.3는 도구 루프 내부에서 캐시를 읽으며, 각 새 턴 시작 시에 놓쳤다. 우리의 첫 번째 프로브는 동일한 시스템 프롬프트에 대해 새 질문을 했으며, 최대 113 토큰을 10 호출에서 캐시에서 제공했으며, 2.9K, 8.9K 및 19.4K 토큰을 에서 제공했다. 이전 요청을 연장하는 후속 통화가 있을 때, 에이전트의 도구 루프처럼 Muse는 2,801의 2,966 토큰을 읽고 0.17×를 청구합니다. 다음 사용자 턴에서는 전체 기록이 앞에 있으므로 아무것도 읽지 않습니다. OpenRouter는 Muse가 실시간 트래픽에서 86.1% 캐시 적중률을 보고하며, 이는 도구 루프가 지배하는 워크로드에 부합합니다. 턴 시작 시 시계가 Muse에 영향을 주지 않으며, 그 호출은 어차피 실패합니다.
같은 하네스 결정은 각 모델마다 다른 비용을 발생시킵니다. 공급자가 사용하는 메커니즘을 아는 것이 모든 것을 조정하기 전에 필요합니다.
우리는 캐시된 턴이 더 빨리 답변할 것으로 예상했습니다. 10 연속 GPT-6 Luna 호출에서 8.5K 토큰을 사용해, 중앙값 첫 번째 호출은 캐시에서 437 ms를, 없을 때는 490 ms를 걸렸습니다. 그 차이는 샘플의 분포 안에 있습니다. 이 크기에서는 캐시가 턴 비용을 바꾸지만 걸리는 시간은 거의 동일합니다.
그래서 시간을 물었을 때 기억나는 일시 정지는 다른 원인이 있습니다. 잘못된 위치에 있는 시계가 비용을 발생시키는 것은 돈입니다.
시스템 프롬프트에 있는 시계는 전체 대화를 앞서며, 따라서 각 재작성은 그 뒤에 늘어나는 기록과 지침을 모두 포함한다. 여기에는 전체 제공자 보고서 청구서, 출력 및 각 턴 내 호출을 포함한 한 번의 12-턴 GPT-6 Luna 대화의 측정된 비용이 있다:
Cumulative cost of one 12-turn conversation on GPT-6 Luna (US cents)Chart data
US cents, cumulative
turn
Clock at the end of the system prompt
Clock at the end of the user message
1
0.119
0.119
2
0.237
0.14
3
0.357
0.161
4
0.477
0.182
5
0.599
0.203
6
0.722
0.225
7
0.846
0.247
8
0.971
0.269
9
1.097
0.291
10
1.224
0.313
11
1.352
0.335
12
1.482
0.358
두 줄은 캐시를 모두 쓸 때 첫 턴을 공유한다. 그 이후로, 시스템 프롬프트에 시계가 있는 모든 턴은 사용자 메시지 끝에 시계가 있는 동일한 턴 비용의 5.7×를 차지한다. 턴 12에서 대화는 4.1× 만큼 비용이 들었고, 차이는 매 턴마다 커진다.
센트의 일부가 규모에서 항목이 된다. 이 예측은 매일 10,000 대화를 제공하는 제품의 각 턴 첫 호출을 가격 책정한다. 각 대화는 8.5K-토큰 시스템 프롬프트, 20 턴, 그리고 턴마다 1,500 토큰이 늘어나는 기록을 가진다. 각 모델은 나열된 가격과 위에서 보여준 캐시 동작을 사용한다:
모델
캐시 동작
시스템 프롬프트에 시계가 있는 대화당
사용자 메시지 끝에 시계가 있는 대화당
연간 차이
GPT-6 Luna
전체 메시지
$0.057
$0.0057
$187K
Claude Opus 5.5
호출자의 마커
$2.28
$0.14
$7.8M
DeepSeek V4.1 Flash
256-토큰 블록
$0.042
$0.0032
$141K
Muse Spark 1.3
턴 오프닝에서 놓쳤다
$0.57
$0.57
$0
DeepSeek의 블록은 시계가 바뀔 때 시스템 프롬프트를 유지하고, 모델은 여전히 13× 더 비싸게 나옵니다. 이는 시계 뒤의 이력이 몇 턴 안에 지침을 초과하기 때문입니다. Muse Spark는 다른 면을 보여줍니다: 우리 실행에서 매 턴 시작 시 놓쳤으므로 배치가 아무것도 절약하지 않았고, 매 턴 오프닝이 전액을 지불했습니다, $2.1M 같은 트래픽에 대해 같은 비용을 내는 한 해.
우리의 측정은 통제된 프롬프트를 사용합니다. OpenRouter는 동일한 모델이 모든 사람의 트래픽에서 비용을 어떻게 지불하는지 발표하며, 동일한 메커니즘이 규모에서 나타납니다. 거의 모든 것이 이 모델들에 입력으로 전송됩니다: 첫날에 GPT-6 Luna의 토큰 중 96.3%, Claude Opus 5.5의 토큰과 DeepSeek V4.1 Flash의 토큰 중 98.5%, 그리고 Muse Spark 1.3의 토큰 중 98.9%. 입력은 캐싱이 적용되는 곳이므로, 적중률이 비즈니스가 지불하는 대부분을 결정합니다.
고객은 Claude Opus 5.5에 대해 백만 입력 토큰당 $0.87를 지불했으며, 명시된 $4.00, $0.30는 Muse Spark 1.3에 대해 $1.25에 대해, 그리고 GPT-6 Luna에 대해 $0.10에 대해 $0.036를 지불했습니다. 같은 모델을 같은 날 제공하는 엔드포인트 전반에 걸쳐, 지불된 가격은 적중률을 따릅니다:
Claude Opus 5.5 on OpenRouter, input price actually paid by each endpoint's cache hit rate (USD per 1M tokens)Chart data
USD per 1M input tokens
92.2% hit
0.557
89.9% hit
0.658
88.7% hit
0.727
81.6% hit
0.974
77.4% hit
1.123
0% hit
4.399
Reference line, listed input price: 4
각 미스는 캐시 쓰기로, 각 적중은 읽기로 가격을 매긴다면, 5 주요 엔드포인트의 게시 가격을 2–13% 내에서 예측합니다. 적중률만으로도 스프레드를 설명합니다. GPT-6 Luna에서 동일한 패턴은 $0.025에서 88.1% 적중률로부터 $0.075에서 49.4%까지, 3의 요인으로 실행됩니다.
Harness builders는 모든 사용자의 명중률을 한 번에 설정합니다. The 5 앱 that sent Claude Opus 5.5 the most traffic on its first day were all agents, 사이 2.9B와 16.3B 토큰 각각. 하루에 10B 입력 토큰을 가진 하네스의 경우, 캐시 적중률의 각 포인트는 $175K 연간 가치가 있습니다. 위의 92.2%와 77.4% 엔드포인트 간의 차이는 해당 볼륨에서 $2.07M 연간이 됩니다. 시스템 프롬프트에서 매 턴을 다시 쓰는 시계는 턴 오프닝이 1 호출인지 10인지, 또는 1인지 2에 따라 $1.75M에서 $8.76M 연간 사이의 비용이 듭니다. 결정은 또한 전파됩니다: 하네스에서 구축된 모든 제품은 그 배치를 상속합니다. 이 글을 쓰는 동안 우리는 동일한 시스템 프롬프트 시계를 두 번째 하네스에서 발견했으며, 이는 동일한 러너의 오래된 빌드를 실행합니다.
내부 AI 플랫폼을 운영하는 회사는 그 뒤에 있는 모든 팀을 위해 설정합니다. 각 요청의 시스템 프롬프트에 타임스탬프 또는 요청 ID를 스탬프하는 게이트웨이는 모든 팀이 위에 구축한 것에 관계없이 모든 애플리케이션의 턴 오프닝을 쓰기로 전환합니다. 회계는 두 번째 노출입니다. 리스트 가격으로 청구되면, 입력 비용은 GPT-6 Luna의 청구액보다 2.8× 크고, Muse Spark 1.3에서는 4.1×, Claude Opus 5.5에서는 4.6× 더 큽니다. 우리의 자체 장부는 33 호출을 2.7× 과다 표시했으며, 그 강도에 근거해 모델을 전환하려고 거의 했습니다.
AI 제품을 배송하는 회사는 모든 대화에서 비용을 지불합니다. 한 대화 안에서 잘못된 시계는 턴당 5.7× 비용을 발생시킵니다. 시장 전반에 걸쳐, 위험은 더 커집니다. 9월 21일, Muse Spark 1.3은 OpenRouter를 통해 88.5B 입력 토큰을 처리했습니다. 리스트 가격은 $110.6K이며, 고객은 $26.9K를 지불했고, 해당 트래픽의 적중률 포인트마다 $355K 연간 가치가 있습니다. DeepSeek V4.1 Flash는 같은 날 2.68T 입력 토큰을 사용했으며, DeepInfra의 가격에서 각 포인트는 $1.33M 연간 가치가 있습니다. 이 수치는 하나의 라우터를 포함합니다. 직접 제공자에게 전송된 트래픽은 그들 안에 나타나지 않습니다.
그 모든 비용은 같은 메커니즘에 기인하며, 해결책도 마찬가지다. 잘 구축된 에이전트 하네스의 규칙은 그 결과를 읽는다:
안정 먼저, 변화 나중에. 도구 정의와 시스템 프롬프트는 대화 전체에 걸쳐 고정된다. 시간, 작업 디렉터리, 요청 ID 및 기타 변하는 항목은 최신 메시지 끝에 배치된다.
추가, 절대 편집 금지. 이전 턴은 그대로 전송된다. 편집, 재정렬 또는 잘라내면 변경 이후 모든 것이 무효화된다.
제공자가 가진 레버를 사용하라. GPT-6 Luna에서는 세션 키와 캐시 마커가 아무 효과가 없었다. 동일한 프롬프트가 이미 히트되었기 때문이다. Claude Opus 5.5에서는 마커가 전체 메커니즘이다. DeepSeek V4.1 Flash에서는 제공자 선택이 캐시 존재 여부를 결정한다.
먼저 유지해야 할 것을 거칠게 처리하라. 시스템 프롬프트의 날짜 라인은 하루에 한 번 끊어지고, 분 단위 시계는 새 분에 턴이 시작될 때마다 끊어진다.
또는 시계를 빼라. 하네스는 모델에 시간을 반환하는 도구를 제공할 수 있으므로 프롬프트가 변하지 않고 모델은 필요할 때 물어본다. 이는 질문이 제기될 때 한 번의 왕복을 발생시킨다.
청구서에서 정산하라. 제공자의 보고된 비용으로부터 가격을 부른다. 토큰 수를 리스트 가격으로 계산한 장부는 우리에게 이 모든 것을 숨겼다.
위의 수정은 단일 편집입니다. 그 주변 조건은 계속 움직입니다. 하네스는 새로운 훅을 얻고, 게이트웨이는 요청에 ID를 찍기 시작하며, 팀은 다른 캐시 메커니즘을 가진 모델로 이동하고, 공급자는 유휴 접두사가 따뜻하게 유지되는 시간을 바꿉니다. 여기의 네 모델은 네 가지 다른 방식으로 캐시하며, Claude Opus 5.5는 유휴 시간 10분 이내에 캐시를 차갑게 만듭니다. 같은 시계를 찾은 두 번째 하네스는 단순히 오래된 빌드에 머물렀습니다. 이 모든 것이 오류를 발생시키지 않습니다.
모든 호출은 이미 그것을 보는 데 필요한 것을 반환합니다: 프롬프트 토큰, 캐시된 토큰, 캐시-쓰기 토큰 및 청구 비용. 호출당 기록되며, 호출이 턴을 열었는지 계속했는지와 함께, 이 필드들은 모든 경로와 모델에 대해 주시해야 할 세 개의 숫자를 제공합니다:
턴 개시 읽기율. 저장된 접두사를 읽는 턴 개시의 비율. 잘못된 위치의 시계는 우리 실행에서 12의 12를 0의 12로 바꿨습니다.
쓰기 비율. 모든 입력에 대한 캐시-쓰기 토큰 비율. 매 턴마다 쓰는 경로는 1.25×를 지불하고 할인은 전혀 받지 않습니다.
목록 대비 실제 입력 가격. 청구서 자체의 판결은 토큰 수가 아니라 공급자가 보고한 비용에서 정산됩니다.
그 숫자에 대한 임계값은 갑작스러운 하락을 포착합니다. 수주 동안 원인을 명명하는 것은 분류 문제이며, 최신 모델 클래스가 적합합니다. Jev, TypeSafe에서, 그 제작자가 System One 모델이라고 부릅니다. 텍스트를 생성하지 않습니다. 상태와 입력된 질문을 받아서 입력된 답변을 확률 분포와 신뢰도로 반환합니다: 옵션 중 선택, 예일 확률, 또는 순서형 척도에서의 위치. 일일 캐시 프로필을 기반으로 해당 일에 일치하는 패턴(건강, 턴 오프닝 재작성, 턴 사이 캐시 만료, 캐시되지 않는 엔드포인트에 트래픽 도달)을 명명하고 얼마나 확신하는지 말합니다. 따라서 카테고리 변경이 알림이 됩니다. 우리는 이를 프로덕션에서 문서를 분류하고, 관찰에서는 완료된 에이전트 에피소드를 점수화하는 데 사용합니다. OpenRouter는 출력에 대한 요금 없이 입력 토큰당 $0.042를 부과합니다. 그 가격으로, 각 1,000 경로에 대해 매일 2K-토큰 프로필을 분류하는 비용은 연간 약 $31이며, 이는 하네스 규모에서 단일 히트율 포인트에 대해 연간 $175K와 비교됩니다.
캐시를 재작성하는 시스템은 모든 대화의 모든 턴마다 프리미엄을 지불하며, 실행되는 한 계속됩니다. 청구서가 왜 그런지 거의 언급하지 않습니다. 수정은 시간이 기록되는 위치만큼 작을 수 있습니다. 고정 상태를 유지하는 것은 누군가가 주시하는 수치입니다.
위의 모든 측정된 수치는 2026년 9월 23일에 OpenRouter의 자체 per-call 필드(캐시된 토큰, 캐시-쓰기 토큰 및 청구 비용)에서 가져온 것입니다. 시장 수치는 그날 읽은 OpenRouter의 공개 모델 페이지에서 가져온 것으로, 실제로 지불한 가중 입력 가격, 각 엔드포인트의 유효 가격 및 캐시 적중률, 그리고 모델당 하루 토큰 활동이 포함됩니다. Claude Opus 5.5와 GPT-6 Luna는 9월 22일에 출시되었으므로, 그들의 활동 수치는 부분적인 첫날을 포함하며, 기사에서는 이를 오직 비율로만 사용합니다. 실험 비용은 총 $0.63이며, 프로브는 계정 사용량이 $1 한도에 접근하면 시작을 거부했습니다. 가격은 같은 날 읽은 OpenRouter의 명시 가격입니다. OpenRouter의 캐싱 가이드는 OpenAI 캐시 읽기를 0.25–0.50×로 나열하며, GPT-6 Luna는 읽기를 0.10×로 청구했고, 이 기사에서는 청구된 내용을 보고합니다.
아직 열려 있는 것은 각 모델의 유휴 캐시가 만료되는 정확한 시점, 단일 타임드 실행이 한정하는 시점; 실제 대화 간격에서 한 시간 또는 날짜 시계가 얼마나 자주 끊어지는지; Muse Spark가 각 턴 시작 시에 기록이 변하지 않았을 때 왜 놓쳤는지; 그리고 DeepSeek의 자체 엔드포인트에서의 동작입니다. 턴당 수정은 우리 프로덕션 에이전트에 실시간으로 적용되었으며, 동일한 발견은 동일한 러너의 이전 빌드를 실행하는 두 번째 하네스에 대기 중입니다.
나에 의해. 기사 뒤의 질문: 왜 AI는 날짜와 시간을 잘 알지 못했고, 즉시 말해야 할 때 몇 초를 걸렸는가. 세션을 통해 시간이 오래되면서 다시 제공해야 한다는 아이디어와, 내가 추측한 결정론적이며 오직 오래된 경우에만 메시지가 프롬프트를 캐시 상태로 남겨두는 것, 그리고 실험으로 테스트하기 위한 호출. 비용 프레이밍: 이러한 모델을 기반으로 구축하는 기업, 하이브리드 빌더부터 자체 내부 AI 플랫폼을 운영하는 회사까지, 현재와 복합적으로 측정된 비용. 지속적인 관찰에 대한 결론, Jev와 같은 System One 모델이 시간에 따라 캐시 프로필을 분류하는 이유는, 해결책이 누군가가 계속 관찰할 때만 유효하기 때문입니다.
Claude Opus 5.5에 의해. 비용 장부가 캐싱을 숨겼다는 것을 발견했고, 2.7× 33 호출에서, 그리고 시스템 프롬프트의 2 줄이 매 턴마다 바뀌는 원인을 추적했습니다. 이제 프로덕션에 있는 런너 수정을 구축했고, 프로브, 분석, 그리고 여기의 모든 숫자 뒤에 있는 비용 모델을 만들었으며, OpenRouter의 공개 시장 수치와 메커니즘을 일치시켰습니다. 4 모델 전반에 걸쳐 3개의 다른 캐시 동작을 식별했으며, GPT-6 Luna의 전체 메시지 동작과 사용 가능한 캐시가 없는 네 번째 모델을 포함했습니다.
유지된 비판들.
Claude Opus 5.5의 최초 설명에서: 세션 키 누락. 그 프로브가 반박했습니다; 동일한 프롬프트가 턴마다 캐시에서 이미 읽혀졌습니다.
Claude Opus 5.5의 측정에서, 나의 추측: 별도의 시간 메시지는 안정적인 지침 뒤에 올 때만 작동합니다. 기사는 그 조건이 붙은 나의 아이디어를 담고 있습니다.
함께 도달한 것. 시계가 텍스트가 바뀔 때까지는 비용이 없고, 그 후에는 전체 프롬프트 비용이 발생한다는 발견. 그리고 기사가 적용하는 규칙: 턴 사이에 변하는 모든 것은 변하지 않는 것 뒤에 옵니다.