← 記事に戻る
Price of each turn's first call, by where the clock is written (median, multiple of the listed input price)
Cumulative cost of one 12-turn conversation on GPT-6 Luna (US cents)
Claude Opus 5.5 on OpenRouter, input price actually paid by each endpoint's cache hit rate (USD per 1M tokens)
発見
Copy article
プロンプトキャッシュのミスは、組織に AI の各ターンでほぼ 6 倍のコストをもたらす可能性があります
破損したプロンプトキャッシュが、ハーネスを構築し、内部 AI プラットフォームを運用し、AI 製品を出荷する組織に与えるコストは、4 ラボのモデルで測定され、ライブトラフィックに対して価格設定され、修正方法と監視方法は。
Developed by Robert E. Beckner III (Merlin) | rbeckner.com
数年前、AI が日付と時刻をよく知らない理由を疑い始めました。 会話で何日かを尋ねると数秒かかり、私は即座に答えを期待していました。 会話を実行しているコンピュータは現在時刻を知っています。
以来、理由の一部を理解するようになりました。 人は翌日に会話に戻ることができ、開始時に与えられた時刻は古くなります。 何かがそれを再び供給する必要があります。 モデルの周りにあるプログラムであるハーネスは、各リクエストの前に現在時刻をモデルの指示に書き込むことでそれを行うことができます。 本番で使用しているエージェントランナーはまさにそれを行いました。
私は長い間プロンプトキャッシュについて知っていました。 プロバイダーはリクエストの開始を保存し、次のリクエストが同じ方法で開始されたときに価格の一部で請求します。 そのメカニズムを十分に理解しておらず、時間のような行がそれに与える影響を見ていませんでした。 私たちは自社の本番コストで答えを見つけ、1 つの現在モデルを 4 つのラボから、OpenRouter の公開数値と比較して正確に測定する実験を指示しました。
答えは高価です。 GPT-6 Luna では、誤った場所に書かれた時間が会話の各ターンを必要なものの 5.7× にし、エラーを引き起こさなかった。 交通機関の組織はこれらのモデルを送信し、入力はトークンの96–99%と実際に支払われたドルの66–87%であり、キャッシュが請求書のほとんどを決定します。 自社のハーネスを構築し、内部AIプラットフォームを運用したりAI製品を出荷したりする組織にとって、このようなミスは、実行されている限り、すべてのターンのコストを静かに増幅します。
ここでの各ターン数は2026年9月23日までに測定されました。OpenRouter。 市場数値はOpenRouter自身のもので、同じ日に読み取られます。
プロンプトキャッシュはリクエストの開始部分を保存し、十分の一で請求します
モデルへのすべての呼び出しは、ツール定義、システムプロンプト(ハーネスが書く固定指示)、以前のすべてのターン、および新しいメッセージを再度送信します。
プロバイダーは最近のリクエストの処理済み開始部分を保持します。 次のリクエストが同じテキストで始まると、プロバイダーはその保存されたプレフィックスを読み取り、再処理しません。 GPT-6 Lunaでは、OpenRouter が読み取りを0.10×のリスト価格で請求し、最初の書き込みを1.25×で請求しました。 すべてのターンで再度書かれるプロンプトは、キャッシュのないプロンプトよりもコストが高くなります。
再利用できるのはリクエストの開始部分だけです。 どこかで変更があると、その後のすべてが無効になります:
Diagram source
graph LR
A[ツール定義] --> B[システムプロンプト]
B --> C[以前のターン]
C --> D[新しいユーザーメッセージ]
B -. a changed line here voids B, C and D .-> Dハーネスが開始近くに書き、毎ターン変更するものは、後続の会話全体を危険にさらします。 現在時刻は最も単純な例です。
私たちは自分たちの請求書で、私たち自身のコスト台帳に隠れていることを発見しました
発見は、私たちが本番で実行しているエージェントで始まりました。 そのコスト台帳はすべての呼び出しをリスト価格で評価し、キャッシュを一切示しませんでした。 私は警報を上げ、別のモデルへの切替えを検討し始めました。
私が作業していたエージェントは、まず台帳自体が誤っていることを発見しました。 33 回の呼び出しで $0.064 を推定しましたが、プロバイダーは $0.023 を請求し、2.7× 少なく。 トークン数から各呼び出しの価格を算出すると、プロバイダーが適用したすべての割引が消えてしまいました。 プロバイダー報告のコストを読むと、各ターン内でキャッシュが機能し、毎回新しいターンの開始時に失敗していることが示されました。
彼の最初の説明は、同じサーバー上でリクエストを保持するセッションキーが欠落しているというものでした。 彼自身の調査はそれを否定しました:同一プロンプトはすでに GPT-6 Luna のターン間でキャッシュから読み取られており、セッションキー、キャッシュキー、または明示的なキャッシュマーカーを追加しても何も変わりませんでした。 原因はシステムプロンプト自体にありました。 途中の約 95% で、ランナーは毎ターン変更される2行を書きました:ターンごとの作業ディレクトリと分単位のクロック。 ターンの最初の呼び出しは、1.25×で再び全プロンプトを書き込みました。
両方の行をユーザーのメッセージの末尾に移動すると、本番で修正されました。 ターン 2 と 3 は現在 0.47–0.51× で開き、1.25× ではなくなりました。 残りは、ランナーがユーザーのメッセージでまだ送信しているターンごとのコンテキストブロックです。
時間が経過する場所が、プロンプトが読み取られるか再書き換えられるかを決定します
これが測定される前の私の推測は、決定論的チェックが時間を提供できるのは、古くなったときだけで、別のメッセージとして、残りのプロンプトはキャッシュされたままであるということでした。 それは一つの条件で保持され、その条件は記事の残りの部分が依存するルールです。
直接テストするために、私たちは同じ会話を異なる場所で時計を動かし、65 秒間隔で回転させるプローブを作成しました。そうすると、各ペアの間で分が変わります。 GPT-6 Luna、8.5K-トークンのシステムプロンプト、3 を複製します:
| 時計が動く場所 | 開始の切り替え | キャッシュから読み取り | 再書き換え | 価格対リスト入力 |
|---|---|---|---|---|
| 時計なし(対照) | 12 | 12 | 0 | 0.10× |
| システムプロンプトの終わり | 12 | 0 | 12 | 1.25× |
| 2番目のシステムメッセージ | 12 | 0 | 12 | 1.25× |
| ユーザー メッセージの開始 | 12 | 12 | 0 | 0.10× |
| ユーザー メッセージの終了 | 12 | 12 | 0 | 0.10× |
| それ自身のメッセージ、毎ターン | 12 | 12 | 0 | 0.11× |
| それ自身のメッセージ、古くなったときのみ | 12 | 12 | 0 | 0.10× |
私の別メッセージはキャッシュを両方の形式で保持し、すべてのターンで、かつ古くなったときのみ。 条件はメッセージがある場所です。 安定した指示の後、プロバイダーはその前のすべてを読み取ります。 2番目のシステムメッセージとして、指示の中に位置し、GPT-6 Lunaは12の12ターンで全プロンプトを書き直しました。
後続のルールは短いです。 ターン間で変わるものは、変わらないものの後に来ます。
時計はテキストが変わらない限り何も費用がかかりません
キャッシュはテキストを比較するので、テキストが同じである限り時計は無害です。 同じプローブで、4 秒間隔でターンが行われると、システムプロンプトの分時計は毎回キャッシュから読み取ります。 65 秒ごとにターンを切り替えると、毎回完全な再書き換えを強制します。
解像度はそれが発生する頻度を設定します。 システムプロンプトの 1 時間時計と日付行は、65 秒間隔のすべての 12 ターン開始時にキャッシュから読み取ります。どちらも切り替わらなかったためです。 彼らもまた、1 時間ごとと 1 日ごとに壊れます。 1 分時計は、前のターンより後の分で開始するたびに壊れます。
キャッシュ自体も期限切れになります。 単一のタイムドランで、GPT-6 Luna は 30 分間アイドル後に保存されたプレフィックスを読み取り、1.25× 後にプロンプト全体を書き直しました 60. DeepSeek V4.1 Flash は 10 分後に読み取り、60 後に失敗しました。 Claude Opus 5.5 は 10 後にすでに失敗していました。Anthropic のデフォルトキャッシュは 5 分間持続し、1 時間キャッシュは 2× のコストで書き込みます。 翌日に会話に戻る人、この記事が始まったケースは、3 つすべてで古い時間と冷たいキャッシュを見つけます。 その最初のターンの戻りは、ハーネスが何をしてもプロンプト全体を支払います。 配置はその後のターンも同様かどうかを決定する。
4 ラボのモデルは4 異なる回答を出しました
GPT-6 Luna はあるプロバイダーの回答です。 レッスンがどれほど一般的かを見るために、4 ラボの各現在モデルで同じ配置を実行し、同一の2.5K トークンプロンプトを使用し、各プロバイダーに固定しました:
Chart data
| GPT-6 Luna (OpenAI) | Claude Opus 5.5 (Anthropic) | DeepSeek V4.1 Flash (DeepInfra) | |
|---|---|---|---|
| No clock | 0.11 | 0.07 | 0.03 |
| System prompt | 1.25 | 1.24 | 0.13 |
| Second system | 1.25 | 0.08 | 0.04 |
| User message | 0.12 | 0.08 | 0.04 |
Reference line, listed input price: 1
GPT-6 Luna はメッセージ全体をキャッシュします。 1 行が変更されると、その行を保持するメッセージとその後のすべてが無効になります。
Claude Opus 5.5 は呼び出し側がマークした場所をキャッシュします。 Anthropic のモデルはハーネスが置く
cache_control マーカーまでしかキャッシュしません。 マーカーがない場合、同じプロンプトは毎回フル価格で請求されました。 システムプロンプトにマーカーがあると、そのブロック内の時計は 1.24 倍のコストになり、次のシステムメッセージの時計は 0.08 倍になりました。 GPT-6 Luna が罰する配置は Opus では安全です。 Opus の価格では、ターン開始ごとの差は $0.0214 対 $0.0023 でした。 Opus は同一プロンプトを 4,056 トークンとしてカウントし、GPT-6 Luna は 2,395 とカウントしたため、同じテキストは価格が適用される前に 1.69 倍多くトークンが必要でした。DeepSeek V4.1 Flash は 256 トークンブロックでキャッシュし、書き込みに追加料金はかかりません。 読み取りは 256 の正確な倍数で戻ってきました:変更されていないプロンプトは 2,560 トークン、システムプロンプトの末尾に時計がある場合は 2,304 トークン。 変更された行はそれを保持するブロックのみがコストします。 最初の呼び出しは通常入力価格で請求され、読み取りは 0.03–0.04 倍で行われました。 8 配置あたりの実行で、2 個の単一呼び出しは、同じ実行が読み取ったターンでキャッシュにヒットしませんでした。これはリクエストが別のサーバーに到達したことを意味し、配置の効果ではありません。 DeepSeek の独自エンドポイントは OpenRouter が自動的にキャッシュするとマークする唯一のもので、私のアカウントのプライバシー設定はそのエンドポイントを除外しています。なぜならそのエンドポイントは有料トラフィックでトレーニングされるからです。 実行は DeepInfra を通過し、Fireworks と Morph も 2 回呼び出しでキャッシュしました。
Muse Spark 1.3 はツールループ内でキャッシュを読み取り、各新しいターンの開始時にミスします。 私たちの最初のプローブは、同じシステムプロンプトに対して新しい質問を行い、最大 113 トークンを 10 回の呼び出しでキャッシュから提供し、2.9K、8.9K および 19.4K トークンで でした。 以前のリクエストを拡張するフォローアップコールが行われたとき、エージェントのツールループのように、Muse は 2,801 の 2,966 トークンを読み取り、0.17× を請求しました。 次のユーザーのターンでは、全履歴が前にある状態で、何も読み取らなかった。 OpenRouter は Muse のライブトラフィックに対して 86.1% のキャッシュヒット率を報告し、ツールループで支配されるワークロードに適合します。 ターンの開始時に、Muse ではクロックは差し支えありません。なぜなら、そのコールはどちらにしてもミスします。
同じハーネス決定は、各モデルで異なる金額を費やします。 プロバイダーが使用するメカニズムを知ることは、何かを調整する前に重要です。
キャッシュヒットは速度ではなく金銭をもたらした
キャッシュされたターンがより速く応答することを期待した。 10 の連続ペアの GPT-6 Luna 呼び出しで 8.5K トークン、中央値の最初の呼び出しはキャッシュから 437 ms、キャッシュなしで 490 ms かかった。 そのギャップはサンプルの分布内にある。 このサイズでは、キャッシュがターンのコストを変え、所要時間はほぼ同じまま。
したがって、時間を尋ねたときに覚えているポーズには別の原因がある。 間違った場所にある時計のコストは金銭である。
会話全体で、書き換えは複合的になる
システムプロンプトの時計は会話全体の前に位置し、したがって各書き換えはそれに続く歴史と指示の両方をカバーする。 ここに、完全なプロバイダー報告請求書を含む、1 12-ターン GPT-6 Luna 会話の測定コストがある。出力と各ターン内の呼び出しも含む:
Chart data
| turn | Clock at the end of the system prompt | Clock at the end of the user message |
|---|---|---|
| 1 | 0.119 | 0.119 |
| 2 | 0.237 | 0.14 |
| 3 | 0.357 | 0.161 |
| 4 | 0.477 | 0.182 |
| 5 | 0.599 | 0.203 |
| 6 | 0.722 | 0.225 |
| 7 | 0.846 | 0.247 |
| 8 | 0.971 | 0.269 |
| 9 | 1.097 | 0.291 |
| 10 | 1.224 | 0.313 |
| 11 | 1.352 | 0.335 |
| 12 | 1.482 | 0.358 |
2 行は最初のターンを共有し、両方ともキャッシュを書き込む。 それ以降、システムプロンプトの時計を持つ各ターンは、ユーザーメッセージの末尾にある時計を持つ同じターンのコストの 5.7× になる。 ターン 12 で会話は 4.1× だけコストがかかり、ギャップは毎ターン拡大する。
セントの分数は規模で行項目になる。 この予測は、1 日あたり 10,000 会話を提供する製品の各ターンの最初の呼び出しを価格設定し、各会話は 8.5K トークンのシステムプロンプト、20 ターン、そして歴史が 1,500 トークンずつ増えると仮定する。 各モデルは、上記で示したリスト価格とキャッシュ挙動を使用する:
| モデル | キャッシュ挙動 | 会話あたり、システムプロンプトの時計 | 会話あたり、末尾の時計 | 年間あたりの差異 |
|---|---|---|---|---|
| GPT-6 Luna | 全メッセージ | $0.057 | $0.0057 | $187K |
| Claude Opus 5.5 | 呼び出し元のマーカー | $2.28 | $0.14 | $7.8M |
| DeepSeek V4.1 Flash | 256-トークン ブロック | $0.042 | $0.0032 | $141K |
| Muse Spark 1.3 | ターンオープニングでミス | $0.57 | $0.57 | $0 |
DeepSeek のブロックは時計が変わるときにシステムプロンプトを保持し、モデルはまだ 13× もっと高価になり、数ターンで時計の後ろにある履歴が指示を上回ります。 Muse Spark は別の側面を示します:私たちの実行では毎ターンの開始時にミスし、配置は何も節約せず、毎ターンオープニングはフル価格で、同じトラフィックで年間 $2.1M を支払いました。
ライブトラフィックでは、キャッシュヒット率が請求書の大部分を占めます
私たちの測定は制御されたプロンプトを使用します。 OpenRouter は、同じモデルが誰にでもトラフィックでどれだけのコストになるかを公開し、同じメカニズムがスケールで現れます。 これらのモデルに送られるほぼすべては入力です:96.3%はGPT-6 Lunaのトークンのうち最初の日に、98.5%はClaude Opus 5.5の、DeepSeek V4.1 Flashの、そして98.9%はMuse Spark 1.3の。 入力はキャッシュが適用される場所であり、ヒット率がビジネスが支払う費用のほとんどを決定します。
顧客は Claude Opus 5.5 に対して 1百万入力トークンあたり $0.87 を支払った。上場の $4.00 に対して、$0.30 は $1.25 で Muse Spark 1.3 に対して、そして $0.036 は $0.10 で GPT-6 Luna に対して。 同じモデルを同じ日に提供するエンドポイント全体で、支払われる価格はヒット率に従います:
Chart data
| USD per 1M input tokens | |
|---|---|
| 92.2% hit | 0.557 |
| 89.9% hit | 0.658 |
| 88.7% hit | 0.727 |
| 81.6% hit | 0.974 |
| 77.4% hit | 1.123 |
| 0% hit | 4.399 |
Reference line, listed input price: 4
すべてのミスをキャッシュ書き込み、すべてのヒットを読み取りとして価格設定すると、各 5 主要エンドポイントの掲載価格を 2–13% 以内に予測できます。 ヒット率だけがスプレッドを説明します。 GPT-6 Luna では、同じパターンが $0.025 から 88.1% ヒット率で $0.075 まで 49.4% で実行され、係数は 3 です。
スケールでのキャッシュミスが組織に与えるコスト
同じ配置決定は、これらの API を構築する各種組織で異なる結果をもたらします。
ハーネスビルダーはすべてのユーザーのヒット率を一度に設定します。 Claude Opus 5.5 に最も多くトラフィックを送った 5 アプリはすべてエージェントで、各々 2.9B と 16.3B トークンを持っていました。 そのモデルで 10B 入力トークンを持つハーネスの場合、キャッシュヒット率の各ポイントは $175K 年間の価値があります。 上記の 92.2% と 77.4% エンドポイント間のギャップは、そのボリュームで $2.07M 年間です。 システムプロンプトで毎回のターンを再書き換えるクロックは、ターンオープニングが 1 コールで 10 か 1 で 2 かによって、$1.75M から $8.76M 年間のコストがかかります。 この決定はまた伝播します:ハーネスで構築されたすべての製品はその配置を継承します。 これを書いている間に、私たちの別のハーネスで同じシステムプロンプトクロックを見つけました。これは同じランナーの古いビルドを実行しています。
内部 AI プラットフォームを運用する企業は、背後にあるすべてのチームのためにそれを設定します。 各リクエストのシステムプロンプトにタイムスタンプまたはリクエスト ID をスタンプするゲートウェイは、監査のためにすべてのアプリケーションのターンオープニングを書き込みに変え、チームが上に構築するものに関係なく行います。 会計は二番目の露出です。 リスト価格でチャージバックされると、入力コストは GPT-6 Luna の請求額より 2.8× 大きく、Muse Spark 1.3 では 4.1×、Claude Opus 5.5 では 4.6× です。 私たち自身の台帳は 33 コールを 2.7× 過大評価し、私はそれに基づいてモデルを切り替えるかどうかを検討しました。
AI 製品を出荷する企業は、すべての会話でそれを支払います。 1 つの会話内で、誤ったクロックは 5.7× のコストを各ターンにかけました。 市場全体で、賭け金はさらに大きくなります。 9 月 21 日、Muse Spark 1.3 は OpenRouter を通じて 88.5B の入力トークンを処理しました。 リスト価格ではそれは $110.6K です。顧客は $26.9K を支払い、そのトラフィックのヒット率の各ポイントは $355K 年間の価値があります。 DeepSeek V4.1 Flash は同じ日に 2.68T の入力トークンを処理し、DeepInfra の価格で各ポイントは $1.33M 年間の価値があります。 これらの数字は 1 つのルーターをカバーしています。 トラフィックがプロバイダーに直接送信されても、それらには表示されません。
修正策:すべてのリクエストの開始を凍結し、変更点を末尾に追加する
それらすべてのコストは同じメカニズムに遡り、修正も同様です。 よく構築されたエージェントハーネスの慣例はその結果を読み取る:
- 安定を先に、変更を後に。 ツール定義とシステムプロンプトは会話全体で凍結される。 時間、作業ディレクトリ、リクエストID、その他変わるものは最新メッセージの末尾に配置される。
- 追加する、編集しない。 以前のターンはそのまま送信される。 編集、再順序付け、または削除は変更後のすべてを無効にする。
- プロバイダーが持つレバーを使用する。 GPT-6 Luna では、セッションキーとキャッシュマーカーは何もしなかった、同一プロンプトがすでにヒットしていたため。 Claude Opus 5.5 では、マーカーが全メカニズムである。 DeepSeek V4.1 Flash では、プロバイダーの選択がキャッシュの有無を決定する。
- 早期に残すべきものは粗くする。 システムプロンプトの日時行は1日ごとに壊れ、1分単位の時計は新しい分でターンが開始するたびに壊れる。
- または時計を外す。 ハーネスはモデルに時間を返すツールを与えることができ、プロンプトは決して変わらず、モデルは必要なときに尋ねる。 それは質問が行われる瞬間に往復を必要とする。
- 請求書から決済する。 プロバイダーの報告コストから価格を呼び出す。 リスト価格でトークン数から構築された台帳は、私たちからすべてを隠していた。
ハットレートを監視してください。破損するものは常に変化しています
上記の修正は単一の編集です。 それに伴う条件は継続的に変動します。 ハーネスは新しいフックを取得し、ゲートウェイはリクエストにIDをスタンプし、チームは別のキャッシュメカニズムを持つモデルに移行し、プロバイダーはアイドルプレフィックスの暖かさを変更します。 ここにある4つのモデルは4つの異なる方法でキャッシュし、Claude Opus 5.5 はアイドル時間の10分以内にキャッシュを冷却します。 同じクロックを見つけた2番目のハーネスは、単に古いビルドで動作していました。 これらのいずれもエラーを引き起こしません。
すべての呼び出しはすでにそれを確認するために必要なものを返します:プロンプトトークン、キャッシュトークン、キャッシュ書き込みトークン、および請求コスト。 呼び出しごとに記録され、呼び出しがターンを開始したか継続したかとともに、これらのフィールドはルートとモデルごとに監視すべき3つの数値を提供します:
- ターン開始読み取り率。 ストアドプレフィックスを読み取るターン開始の割合。 誤った場所にあるクロックは、私たちの実行で12の12から0の12へと変化しました。
- 書き込みシェア。 すべての入力に対するキャッシュ書き込みトークンの割合。 すべてのターンで書き込むルートは1.25×を支払い、割引を受けません。
- リストに対する実効入力価格。 請求書自体の判定は、トークン数ではなくプロバイダーの報告コストから決定されます。
それらの数値に閾値を設定すると急激な低下を検出できます。 何週間にわたるデータの原因を命名することは分類問題であり、より新しいクラスのモデルがそれに適しています。 Jev、TypeSafe から、メーカーはそれを System One モデルと呼びます。 それはテキストを生成しません。 状態と入力された質問を受け取り、確率分布と信頼度を伴う入力された回答を返します:選択肢の中からの選択、はいの確率、または順序付きスケール上の位置。 ルートの毎日のキャッシュプロファイルが与えられれば、日が一致するパターン(健康、オープニングの書き換え、ターン間でのキャッシュの期限切れ、キャッシュされないエンドポイントに到達するトラフィック)を名前付けし、どれだけ確信があるかを述べることができるので、カテゴリの変更がアラートになります。 私たちは本番環境で文書を分類し、観測では完了したエージェントエピソードをスコアリングするために使用します。 OpenRouter は、入力トークン百万あたり$0.042で、出力は無料です。 その価格で、各 1,000 ルートの 2K トークンの毎日プロファイルを分類するのに約 $31 年、ハーネススケール上の単一ヒット率ポイントに対して $175K 年がかかります。
キャッシュを書き換え続けるシステムは、実行している限り、すべての会話のすべてのターンでプレミアムを支払いますが、請求書はなぜかほとんど言いません。 修正は、時間が書かれている場所だけで小さくなることがあります。 それを固定し続けるには、誰かが監視する数が必要です。
私たちが測定したものと、まだ測定されるべきもの
上記のすべての測定値は、2026年9月23日にOpenRouter の各呼び出しフィールド(キャッシュトークン、キャッシュ書き込みトークン、請求コスト)から取得されます。 市場データは、その日に読み取ったOpenRouter の公開モデルページから取得されます:実際に支払われた加重入力価格、各エンドポイントの実効価格とキャッシュヒット率、およびモデルごとの1日分のトークン活動。 Claude Opus 5.5 と GPT-6 Luna は9月22日にリリースされ、彼らの活動数値は部分的な初日をカバーし、記事はそれらをシェアとしてのみ使用します。 実験の総費用は $0.63 で、アカウントの使用量が $1 上限に近づくとプローブは開始を拒否しました。 価格は同じ日に読み取ったOpenRouter のリスト価格です。 OpenRouter のキャッシュガイドは OpenAI のキャッシュ読み取りを 0.25–0.50× とリストし、GPT-6 Luna は読み取りを 0.10× で請求し、この記事は請求された内容を報告しています。
未解決:各モデルのアイドルキャッシュが失効する正確なポイント、単一のタイムドランが囲むだけの点、実際の会話ギャップで時間または日付クロックが壊れる頻度、Muse Spark が各ターンの開始時に履歴が変更されていないときにミスした理由、および DeepSeek の自身のエンドポイントでの挙動。 ターンごとの修正は私たちの本番エージェントで稼働しており、同じ発見は同じランナーの古いビルドを実行する2番目のハーネスにキューされています。
主な帰属
私による。 記事の背後にある質問:AIはなぜ日付と時刻を正確に知っているように見えず、瞬時に言うべきところを数秒かけて言うのか。 セッションを通じて時間が古くなり、再度提供する必要があるという考え、私の推測では、決定的で古くなったときのみのメッセージがプロンプトをキャッシュに残すことになる、そして実験でそれをテストする呼び出し。 コストフレーミング:これらのモデルを構築する企業、ハーネスビルダーから自社の内部AIプラットフォームを運営する企業まで、今日の状態とそれが複合する方法を定量化したもの。 継続的観測の締めくくりとして、JevのようなSystem Oneモデルが時間とともにキャッシュプロファイルを分類するため、修正は誰かが監視し続ける限り有効である。
Claude Opus 5.5による。 彼は私たちのコスト台帳がキャッシュを隠していたことを発見し、2.7×33呼び出しで、そして原因をシステムプロンプトの2行に追跡し、毎ターンで変わるもの。 彼は現在本番環境にあるランナー修正、プローブ、分析、およびここにあるすべての数値の背後にあるコストモデルを構築し、OpenRouterの公開市場数値とメカニズムを照合しました。 4モデル全体で、彼は3異なるキャッシュ挙動を特定し、GPT-6 Lunaの全メッセージ挙動と、使用可能なキャッシュのない第4モデルを含めました。
保持された批判。
- Claude Opus 5.5からの最初の説明:セッションキーが欠落している。 彼のプローブはそれを否定しました;同一プロンプトがすでにキャッシュから読み取られていることがターン間で確認されました。
- Claude Opus 5.5の測定から、私の推測:別々の時間メッセージは安定した指示の後に来るときのみ機能します。 記事はその条件付きで私のアイデアを伝えます。
一緒に到達。 時計はテキストが変わるまで何も費用がかからず、変わるときに全プロンプトの費用がかかるという発見。 そして記事が導入するルール:ターン間で変わるものは、変わらないものの後に来る。
#AI#agents#benchmarking#performance#cost#experiential#insights