أخطاء تخزين مؤقت للمحفزات قد تكلف مؤسستك تقريباً 6 مرة أكثر في كل دور للذكاء الاصطناعي
ما يكلفه تخزين مؤقت للمحفزات المكسور للمنظمات التي تبني حوامل، تشغل منصات ذكاء اصطناعي داخلية أو ترسل منتجات ذكاء اصطناعي، محسوباً على نماذج 4 مختبرات ومقابلها مقابل حركة المرور الحية، مع الإصلاح وكيفية الاستمرار في مراقبته.
Developed by Robert E. Beckner III (Merlin) | rbeckner.com
منذ سنوات بدأت أتساءل لماذا لا يبدو أن الذكاء الاصطناعي يعرف التاريخ والوقت جيداً. سؤال المحادثة عن اليوم قد يستغرق ثوانٍ، وكنت أتوقع إجابة فورية. الكمبيوتر الذي يشغل المحادثة يعرف ما هو الوقت.
لقد فهمت منذ ذلك الحين جزءاً من السبب. يمكن للشخص أن يعود إلى المحادثة في اليوم التالي، وأي وقت تم إعطاء المحادثة في البداية قد أصبح قديمًا. يجب أن يقدمه مرة أخرى. الحاملة، البرنامج حول النموذج الذي يجمع كل طلب ويشغل الحلقة، يمكن أن يفعل ذلك بكتابة الوقت الحالي في تعليمات النموذج قبل كل طلب. مشغل الوكيل الذي نستخدمه في الإنتاج فعل ذلك بالضبط.
كنت أعرف عن تخزين مؤقت للمحفزات منذ وقت طويل. يخزن المزودون بداية الطلب ويحسبونه بنصف السعر عندما يبدأ الطلب التالي بنفس الطريقة. لم أكن أعرف آليته جيداً بما يكفي لأرى ما يفعله سطر مثل الوقت عليه. وجدنا الإجابة في تكاليف الإنتاج الخاصة بنا، وأوجّهت مجموعة من التجارب لقياسها بشكل صحيح، عبر نموذج حالي واحد من كل مختبر من 4 مختبرات ومع الأرقام العامة لـ OpenRouter لما يدفعه الجميع.
الإجابة مكلفة. على GPT-6 Luna، جعل الوقت المكتوب في المكان الخطأ كل دور من المحادثة يكلف 5.7× ما كان يحتاجه، ولم يرفع أي شيء خطأ. عبر منظمات المرور تُرسل هذه النماذج، المدخل هو 96–99% من الرموز و66–87% من الدولارات المدفوعة فعلياً، لذلك يقرر التخزين معظم الفاتورة. لمنظمة تبني جهازها الخاص، أو تشغل منصة ذكاء اصطناعي داخلية أو ترسل منتجات ذكاء اصطناعي، فإن خطأً كهذا يضاعف تكلفة كل دور، بصمت، طالما يعمل.
تم قياس كل رقم لكل دور هنا في 23 سبتمبر 2026، عبر OpenRouter. الأرقام السوقية هي ملك OpenRouter، اقرأها في نفس اليوم.
يخزن ذاكرة التخزين المؤقت للمطالبة بداية الطلب ويحسبها عند العاشرة#
كل مكالمة إلى نموذج ترسل المحادثة بأكملها مرة أخرى: تعريفات الأداة، مطالبة النظام (التعليمات الثابتة التي يكتبها الحزام)، كل دور سابق، والرسالة الجديدة.
يحتفظ الموفرون بالبداية المعالجة للطلبات الأخيرة. عندما يبدأ الطلب التالي بنفس النص، يقرأ الموفر ذلك البادئة المخزنة بدلاً من معالجته مرة أخرى. على GPT-6 Luna، تم احتساب قراءة بـ 0.10× سعر الإدخال المدرج والكتابة الأولى بـ 1.25×. مطالبة تُكتب مرة أخرى في كل دور لذلك تكلف أكثر من مطالبة بدون ذاكرة تخزين مؤقت على الإطلاق.
يمكن إعادة استخدام بداية الطلب فقط. أي تغيير في أي نقطة يلغي كل شيء بعده:
Diagram source
graph LR
A[تعريفات الأداة] --> B[مطالبة النظام]
B --> C[الأدوار السابقة]
C --> D[رسالة المستخدم الجديدة]
B -. a changed line here voids B, C and D .-> D
أي شيء يكتبه الحزام بالقرب من البداية ويتغير في كل دور يضع المحادثة بأكملها في خطر. الوقت الحالي هو أبسط مثال.
وجدنا ذلك في فاتورتنا الخاصة، مخفيًا في دفتر التكاليف الخاص بنا#
بدأت الاكتشاف في وكيل نُشغله في الإنتاج. كان دفتر التكاليف الخاص به يحدد تكلفة كل مكالمة بالسعر القائم ولم يُظهر أي تخزين مؤقت على الإطلاق. رفعت إنذارًا وبدأت أزن التحول إلى نموذج مختلف.
وجد الوكيل الذي كنت أعمل معه أولاً أن الدفتر نفسه كان خاطئًا. على مدى 33 مكالمات، قدر $0.064؛ كان الموفر قد احتسب $0.023، أقل بـ 2.7×. حساب كل مكالمة من عدّات الرموز قد مسح كل خصم كان الموفر يطبقه. قراءة تكلفة الموفر المبلغ عنها بدلاً من ذلك أظهرت أن التخزين المؤقت يعمل داخل كل دور ويفشل عند بداية كل جديد.
كان تفسيره الأول هو نقص مفتاح الجلسة الذي سيبقي الطلبات على نفس الخادم. حاز استكشافه الخاص على ذلك: الموجهات المتطابقة كانت بالفعل تُقرأ من التخزين المؤقت عبر الأدوار على GPT-6 Luna، وإضافة مفتاح جلسة، أو مفتاح تخزين مؤقت، أو علامة تخزين مؤقت صريحة لم تغير شيئًا. كان السبب في موجه النظام نفسه. حول 95% من الطريق، كتب الجريّ سطرين تغيران في كل دور: دليل عمل لكل دور وساعة دقيقة. كتب كل مكالمة أولى من دور مرة أخرى الموجه بأكمله عند 1.25×.
نقل كلا السطرين إلى نهاية رسالة المستخدم أصلح ذلك في الإنتاج. الأدوار 2 و 3 الآن تفتح بـ 0.47–0.51× بدلاً من 1.25×. الباقي هو كتلة من سياق كل دور يرسلها الجريّ في رسالة المستخدم.
حيث يحدد الوقت ما إذا كان الطلب يُقرأ أم يُعاد كتابته#
كان تخميني، قبل قياس أي من هذا، أن فحصًا حتميًا يمكن أن يزود الوقت فقط عندما يصبح قديمًا، كرسالة منفصلة، ويترك بقية الطلب مخزنة مؤقتًا. هو قائم، بشرط واحد، وهو القاعدة التي يعتمد عليها بقية المقال.
لاختباره مباشرة، بنينا جهازًا يجرى نفس المحادثة مع الساعة في أماكن مختلفة، يبعد 65 ثانية بحيث يتغير الدقائق بين كل زوج. GPT-6 Luna، وهو نظام طلب برمز 8.5K، يكرر 3:
حيث تذهب الساعة
فتحات التبديل
قراءة من التخزين المؤقت
إعادة كتابة
السعر مقابل الإدخال المدرج
لا ساعة (تحكم)
12
12
0
0.10×
نهاية طلب النظام
12
0
12
1.25×
رسالة نظام ثانية
12
0
12
1.25×
بداية رسالة المستخدم
12
12
0
0.10×
نهاية رسالة المستخدم
12
12
0
0.10×
رسالتها الخاصة، في كل دور
12
12
0
0.11×
رسالتها الخاصة، فقط عندما تكون قديمة
12
12
0
0.10×
رسالتي المنفصلة احتفظت بالذاكرة المؤقتة في كلا الشكلين، في كل دور وفقط عندما تكون قديمة. الشرط هو حيث تبقى الرسالة. بعد التعليمات الثابتة، يقرأ الموفر كل شيء قبله. كرسالة نظام ثانية، تقع بين التعليمات، وكتب GPT-6 Luna الموجه بالكامل مرة أخرى على 12 من 12 دورات.
القاعدة التي تليها قصيرة. أي شيء يتغير بين الدورات يذهب بعد كل شيء لا يتغير.
يقارن التخزين المؤقت النص، لذا تكون الساعة غير ضارة طالما يبقى نصها ثابتًا. في نفس الجهاز مع التدوير 4 ثانية على التوالي، كانت الساعة الدقيقة في موجه النظام تُقرأ من التخزين المؤقت في كل مرة. مع التدوير 65 ثانية على التوالي، أجبرت إعادة كتابة كاملة في كل دور.
يحدد الدقة مدى تكرار ذلك. الساعة ساعة وخط التاريخ في موجه النظام يقرآن من التخزين المؤقت في جميع فتحات الدور 12 من الجولات التي تستغرق 65 ثانية، لأنهما لم يتجاوزا. ينكسران أيضًا، مرة كل ساعة ومرة كل يوم. تنكسر الساعة الدقيقة في كل دور يبدأ في دقيقة لاحقة من الدقائق السابقة.
ينتهي صلاحية التخزين المؤقت نفسه أيضًا. في الجولات المفردة الموقوتة، لا تزال GPT-6 Luna تقرأ بادئتها المخزنة بعد 30 دقيقة من الخمول وتكتب الموجه بالكامل مرة أخرى عند 1.25× بعد 60. DeepSeek V4.1 Flash قرأ بعد 10 دقيقة وتفوت بعد 60. Claude Opus 5.5 قد فات بالفعل بعد 10، لأن التخزين المؤقت الافتراضي لـ Anthropic يدوم 5 دقيقة وتكلفة تخزينه لمدة 1 ساعة هي 2× للكتابة. الشخص الذي يعود إلى محادثة في اليوم التالي، الحالة التي بدأ بها المقال، يجد كلًا من وقت قديم وتخزين مؤقت بارد في جميع الثلاثة. يدفع الدور الأول مرة أخرى مقابل الموجه بالكامل مهما كان ما يفعله الحاملة. يحدد التوزيع ما إذا كانت الأدوار التالية بعده كذلك.
GPT-6 Luna هو إجابة أحد المزودين. لرؤية مدى عمومية الدرس، أجرينا نفس التوزيعات على نموذج حالي واحد من كل من 4 labs، مع موجه يساوي 2.5K رمز، كل منها مثبت على مزود واحد:
Price of each turn's first call, by where the clock is written (median, multiple of the listed input price)Chart data
multiple of listed input price
GPT-6 Luna (OpenAI)
Claude Opus 5.5 (Anthropic)
DeepSeek V4.1 Flash (DeepInfra)
No clock
0.11
0.07
0.03
System prompt
1.25
1.24
0.13
Second system
1.25
0.08
0.04
User message
0.12
0.08
0.04
Reference line, listed input price: 1
GPT-6 Luna يضع الكاش في الرسائل الكاملة. سطر واحد متغير يلغي الرسالة التي تحملها وكل ما بعدها.
Claude Opus 5.5 يضع الكاش حيث يعلّمه المُستدعِ. نماذج Anthropic تضع الكاش فقط حتى علامة cache_control التي يضعها الحاسوب. بدون علامة، نفس الموجه يفرض السعر الكامل في كل مكالمة. مع العلامة في موجه النظام، تكلف الساعة داخل تلك الكتلة 1.24×، بينما الساعة في رسالة نظام ثانية بعدها تقرأ عند 0.08×. التوزيع الذي يعاقب عليه GPT-6 Luna آمن على Opus. بأسعار Opus كان الفرق لكل فتح دور هو $0.0214 مقابل $0.0023. كما احتسب Opus نفس الموجه كـ 4,056 رمز بينما احتسب GPT-6 Luna 2,395، لذا يكلف نفس النص 1.69× أكثر من الرموز قبل أي سعر يُطبق.
DeepSeek V4.1 Flash يضع الكاش في كتل 256 رمزًا ولا يفرض أي رسوم إضافية للكتابة. جاءت القراءات في مضاعفات دقيقة لـ 256: 2,560 رمزًا للموجه غير المتغير، 2,304 مع الساعة في نهاية موجه النظام. يكلف سطر متغير فقط الكتلة التي تحملها. تُفرض المكالمات الأولى بالسعر البسيط للإدخال، والقراءات عند 0.03–0.04×. عبر 8 جولات لكل توزيع، فقدت 2 مكالمة واحدة الكاش في دور الذي قرأ نفس الجولة بعد ذلك، وهو ما يُقرأ كأن الطلب يصل إلى خادم مختلف بدلاً من كونه تأثيرًا للتوزيع. نقطة النهاية الخاصة بـ DeepSeek هي الوحيدة التي تُعلّم OpenRouter كـ كاش تلقائيًا، وإعداد الخصوصية لحسابي يستبعدها لأن تلك النقطة تُدرّب على حركة مرور مدفوعة. مرت الجولات عبر DeepInfra، التي تم تخزينها مؤقتًا، كما فعل Fireworks وMorph في فحص 2-call.
Muse Spark 1.3 يقرأ كاشه داخل حلقة أداة ويفشل في البداية لكل دور جديد. أسئلة الفحص الأولى، التي تسأل سؤالًا جديدًا ضد نفس موجه النظام، خدمت على الأكثر 113 رمزًا من الكاش في 10 مكالمة، عند 2.9K، 8.9K و19.4K رمزًا. عندما يمد مكالمة المتابعة الطلب السابق، كما يفعل حلقة أدوات الوكيل، يقرأ Muse 2,801 من 2,966 رموزًا ويحسب 0.17×. في دور المستخدم التالي، مع التاريخ الكامل أمامه، لا يقرأ أي شيء. يبلّغ OpenRouter معدل نجاح التخزين المؤقت 86.1% لـ Muse على حركة المرور الحية، وهو ما يتناسب مع عبء عمل يهيمن عليه حلقة أدوات. في بداية الدور لا يفرق الساعة على Muse، لأن تلك المكالمة تفشل في أي حال.
نفس قرار الحزام يكلف مبلغًا مختلفًا على كل نموذج. معرفة أي آلية يستخدمها موفر الخدمة تأتي قبل ضبط أي شيء.
كنا نتوقع أن الجولات المخزنة تُجيب أسرع. في 10 أزواج متسلسلة من مكالمات GPT-6 Luna عند 8.5K رموز، استغرقت المكالمة الأولى المتوسطة 437 ms من الذاكرة المؤقتة و490 ms دونها. هذا الفجوة تقع ضمن انتشار العينات. في هذا الحجم، يغيّر التخزين المؤقت ما يكلفه الجولة ويترك مدة التنفيذ تقريباً كما هي.
لذا التوقف الذي أتذكره عند طلب الوقت له سبب آخر. ما يكلفه ساعة في مكان خاطئ هو المال.
تقع ساعة في موجه النظام أمام المحادثة بأكملها، لذا تغطي كل إعادة كتابة التاريخ المتزايد خلفها بالإضافة إلى التعليمات. إليك تكلفة قياس واحدة من محادثة GPT-6 Luna ذات 12 دور، مع الفاتورة المبلغ عنها بالكامل من المزود، بما في ذلك الإخراج والمكالمات داخل كل دور:
Cumulative cost of one 12-turn conversation on GPT-6 Luna (US cents)Chart data
US cents, cumulative
turn
Clock at the end of the system prompt
Clock at the end of the user message
1
0.119
0.119
2
0.237
0.14
3
0.357
0.161
4
0.477
0.182
5
0.599
0.203
6
0.722
0.225
7
0.846
0.247
8
0.971
0.269
9
1.097
0.291
10
1.224
0.313
11
1.352
0.335
12
1.482
0.358
تشترك السطران في دورهما الأول، عندما يكتبان الذاكرة المؤقتة. من ذلك الحين، كل دور مع الساعة في موجه النظام يكلف 5.7× ما يكلفه نفس الدور مع الساعة في نهاية رسالة المستخدم. بحلول الدور 12 كانت المحادثة قد تكلف 4.1× أكثر، وتزداد الفجوة مع كل دور.
تصبح كسور المِنت جزءًا من بند في الحجم الكبير. تُسعّر هذه التوقعات أول مكالمة لكل دور لمنتج يخدم 10,000 محادثة يوميًا، كل منها مع موجه نظام بـ 8.5K رمز، 20 دور، وتاريخ يتزايد بـ 1,500 رموز في كل دور. يستخدم كل نموذج سعره المدرج وسلوك التخزين المؤقت الذي أظهره أعلاه:
النموذج
سلوك التخزين المؤقت
لكل محادثة، ساعة في موجه النظام
لكل محادثة، ساعة في النهاية
لكل سنة، الفرق
GPT-6 Luna
الرسالة الكاملة
$0.057
$0.0057
$187ك
Claude Opus 5.5
علامة المتصل
$2.28
$0.14
$7.8م
DeepSeek V4.1 Flash
256-كتل التوكن
$0.042
$0.0032
$141ك
Muse Spark 1.3
فات في فتحات الدور
$0.57
$0.57
$0
تحافظ كتل DeepSeek على موجه النظام عندما يتغير الساعة، ولا يزال النموذج أكثر تكلفة بـ 13×، لأن التاريخ خلف الساعة يتجاوز التعليمات خلال بضع دورات. يظهر Muse Spark الجانب الآخر: فقد في بداية كل دور في تجاربنا، لذا لم يُوفر أي شيء هناك وكل فتح دور دفع السعر الكامل، $2.1م سنة لنفس الحركة المرور.
في حركة المرور الحية، معدل تسديد الكاش هو الجزء الأكبر من الفاتورة#
تستخدم قياساتنا موجهًا مُتحكمًا. ينشر OpenRouter ما تكلفته نفس النماذج على حركة المرور للجميع، وتظهر نفس الآلية هناك على نطاق واسع. تقريبًا كل ما يُرسل إلى هذه النماذج هو إدخال: 96.3% من رموز GPT-6 Luna في يومه الأول، 98.5% من Claude Opus 5.5 و DeepSeek V4.1 Flash، و 98.9% من Muse Spark 1.3. الإدخال هو المكان الذي يُطبق فيه الكاش، لذا يحدد معدل التسديد معظم ما يدفعه العمل.
دفع العملاء $0.87 لكل مليون رمز إدخال لـ Claude Opus 5.5 مقابل $4.00 المدرج، $0.30 مقابل $1.25 لـ Muse Spark 1.3، و $0.036 مقابل $0.10 لـ GPT-6 Luna. عبر نقاط النهاية التي تخدم نفس النموذج في نفس اليوم، يتبع السعر المدفوع معدل التسديد:
Claude Opus 5.5 on OpenRouter, input price actually paid by each endpoint's cache hit rate (USD per 1M tokens)Chart data
USD per 1M input tokens
92.2% hit
0.557
89.9% hit
0.658
88.7% hit
0.727
81.6% hit
0.974
77.4% hit
1.123
0% hit
4.399
Reference line, listed input price: 4
يوقع تسعير كل فشل ككتابة كاش وكل نجاح كقراءة توقعات أسعار كل من نقاط النهاية الرئيسية 5 ضمن 2–13%. يفسر معدل الضرب وحده التوزيع. على GPT-6 Luna يتبع نفس النمط من $0.025 عند معدل ضربة 88.1% إلى $0.075 عند 49.4%، عامل 3.
ما يكلفه خطأ التخزين المؤقت للمؤسسة على نطاق واسع#
قرار التوزيع نفسه يختلف على كل نوع من المؤسسات التي تبني على هذه الـ APIs.
يحدد مُنشئو Harness معدل الضربة لكل مستخدم مرة واحدة. التطبيقات 5 التي أرسلت Claude Opus 5.5 أكثر حركة مرور في يومه الأول كانت جميعها وكلاء، بين 2.9B و 16.3B رموز لكلٍ منها. لمُحمل على 10B رموز مدخل يوميًا على ذلك النموذج، كل نقطة من معدل الضربة على الذاكرة المؤقتة تُستَحَق $175K سنويًا. الفجوة بين نقاط النهاية 92.2% و 77.4% أعلاه تُصل إلى $2.07M سنويًا عند ذلك الحجم. ساعة في موجه النظام التي تُعيد كتابة كل دور افتتاحي تكلف بين $1.75M و $8.76M سنويًا، اعتمادًا على ما إذا كانت فتحات الدور 1 مكالمة في 10 أو 1 في 2. القرار ينتقل أيضًا: كل منتج يُبنى على Harness يرث وضعه. أثناء كتابة هذا وجدنا نفس ساعة موجه النظام في Harness ثاني لنا، الذي يعمل بنسخة أقدم من نفس runner.
تُحدد الشركات التي تشغل منصة AI داخلية ذلك لكل فريق خلفها. بوابة تُطبع كل طلب بموجه النظام مع طابع زمني أو معرف طلب للتدقيق تُحوّل فتحات دور كل تطبيق إلى كتابات، مهما كان ما يبنيه الفرق على القمة. المحاسبة هي التعرض الثاني. يُخصم عند سعر القوائم، تكاليف المدخل تبدو 2.8× أكبر من الفاتورة على GPT-6 Luna، 4.1× على Muse Spark 1.3 و 4.6× على Claude Opus 5.5. سجلنا الخاص أظهر مكالمات 33 بأكثر من 2.7×، وكنت على وشك تبديل النماذج بناءً على ذلك.
تدفع الشركات التي تُصدر منتجات AI ذلك في كل محادثة. داخل محادثة واحدة، تكلفة الساعة المفقودة هي 5.7× لكل دور. عبر السوق، تتزايد المخاطر. في 21 سبتمبر، أخذ Muse Spark 1.3 88.5B رموز مدخل عبر OpenRouter. عند سعر القوائم هذا هو $110.6K؛ دفع العملاء $26.9K، وكل نقطة من معدل الضربة على تلك الحركة تُستَحَق $355K سنويًا. أخذ DeepSeek V4.1 Flash 2.68T رموز مدخل في نفس اليوم، وبأسعار DeepInfra كل نقطة تُستَحَق $1.33M سنويًا. تغطي هذه الأرقام جهاز توجيه واحد. المرور المرسل إلى المزودين مباشرة لا يظهر فيهم.
الحل: احتفظ ببدء كل طلب ثابتًا وأضف ما يتغير في النهاية#
كل واحد من تلك التكاليف يعود إلى نفس الآلية، وكذلك الحل. تقاليد حزم الوكيل المصممة جيدًا تُقرأ كعواقبها:
ثابت أولًا، متغير أخيرًا. تعريفات الأداة وموجه النظام تبقى ثابتة طوال المحادثة. الوقت، دليل العمل، معرف الطلب وأي شيء آخر يتغير يذهب في نهاية الرسالة الأحدث.
أضف، لا تعدل. الأدوار السابقة تُرسل بالضبط كما كانت. التعديل، إعادة الترتيب أو تقليمها يلغي كل شيء بعد التغيير.
استخدم الرافعة التي يملكها موفر الخدمة. على GPT-6 Luna، لم تُفعل مفاتيح الجلسة وعلامات التخزين المؤقت لأن المطالبات المتطابقة كانت بالفعل تُستهدف. على Claude Opus 5.5 العلامة هي الآلية الكاملة. على DeepSeek V4.1 Flash، يحدد اختيار الموفر ما إذا كان هناك تخزين مؤقت.
اجعل ما يجب أن يبقى مبكرًا أكثر سمكًا. سطر التاريخ في موجه النظام ينكسر مرة واحدة يوميًا، وساعة دقيقة تنكسر كلما بدأ دور في دقيقة جديدة.
أو اترك الساعة خارجًا. يمكن لحزمة أن تعطي النموذج أداة تُعيد الوقت، لذا لا يتغير الموجه ويطلب النموذج عندما يحتاج إلى معرفة. هذا يكلف رحلة ذهاب وإياب، في لحظة طرح السؤال.
استقر من الفاتورة. مكالمات السعر من تكلفة موفر الخدمة المبلغ عنها. سجل مبني من عدد الرموز بسعر القائمة أخفى كل ذلك عنا.
الإصلاح أعلاه هو تعديل واحد. الشروط حوله تستمر في التحرك. يكتسب الحامل خطافًا جديدًا، يبدأ البوابة في طباعة الطلبات بمعرف، ينتقل الفريق إلى نموذج بآلية ذاكرة مؤقتة مختلفة، يغير الموفر مدة البادئة الخاملة التي تبقى دافئة. النماذج الأربعة هنا تُخزن في أربع طرق مختلفة، وClaude Opus 5.5 سمح للذاكرة المؤقتة أن تبرد خلال 10 دقيقة من وقت الخمول. الحامل الثاني حيث وجدنا نفس الساعة كان ببساطة يعمل على بناء أقدم. لا يرفع أي من هذا خطأ.
كل مكالمة تُعيد بالفعل ما يلزم لرؤيتها: رموز الموجه، رموز الذاكرة المؤقتة، رموز كتابة الذاكرة المؤقتة والتكلفة المفوترة. مسجلة لكل مكالمة، معًا مع ما إذا كانت المكالمة فتحت دورًا أو استمرت فيه، تُعطي تلك الحقول ثلاثة أرقام يجب مراقبتها لكل مسار ونموذج:
معدل قراءة فتح الدور. حصة فتحات الدور التي تقرأ البادئة المخزنة. ساعة في المكان الخطأ أخذته من 12 من 12 إلى 0 من 12 في تجاربنا.
حصة الكتابة. رموز كتابة الذاكرة المؤقتة كحصة من جميع المدخلات. مسار يكتب في كل دور يدفع 1.25× ولا يجمع الخصم أبدًا.
سعر الإدخال الفعلي مقابل القائمة. حكم الفاتورة نفسه، يُسدد من تكلفة الموفر المبلغ عنها بدلاً من عدد الرموز.
عتبة على تلك الأرقام تلتقط انخفاضًا مفاجئًا. تسمية السبب عبر أسابيع من البيانات هي مشكلة تصنيف، وفئة نموذج أحدث تناسبها. Jev، من TypeSafe، هو ما يسميه صانعه نموذج System One. لا يُنشئ نصاً. يأخذ حالة وأسئلة مكتوبة ويعيد إجابات مكتوبة مع توزيع احتمالات وثقة: اختيار بين الخيارات، احتمال للـ yes، أو موضع على مقياس مرتب. مع ملف تعريف التخزين المؤقت اليومي لمسار، يمكنه تسمية النمط الذي يطابق اليوم (صحي، فتحات التبديل التي تُعيد الكتابة، انتهاء صلاحية التخزين المؤقت بين التبديلات، مرور المرور إلى نقطة نهاية لا تُخزن) ويقول مدى يقينه، بحيث يصبح تغيير الفئة إنذاراً. نستخدمه في الإنتاج لتصنيف المستندات، وفي الملاحظة، لتقييم حلقات الوكيل المنتهية. يدرج OpenRouter ذلك بـ $0.042 لكل مليون رمز إدخال دون رسوم على الإخراج. بهذا السعر، تصنيف ملف تعريف يومي بـ 2K رمز لكل من مسارات 1,000 يكلف حوالي $31 سنوياً، مقابل $175K سنوياً لنقطة واحدة من معدل الضرب عند مقياس الحافلة أعلاه.
نظام يواصل إعادة كتابة التخزين المؤقت يدفع القسط على كل تبديل في كل محادثة، طالما يعمل، وفاتورة القسط نادراً ما توضح السبب. الإصلاح يمكن أن يكون صغيراً مثل المكان الذي يُكتب فيه الوقت. الحفاظ عليه ثابتاً يتطلب عددًا يراقبه شخص ما.
كل رقم قياس أعلاه يأتي من حقول كل مكالمة في OpenRouter (الرموز المخزنة مؤقتًا، رموز الكتابة المؤقتة، والتكلفة المفوترة) في 23 سبتمبر 2026. الأرقام السوقية تأتي من صفحات النموذج العامة لـ OpenRouter التي نُسخت ذلك اليوم: سعر المدخل المرجح المدفوع فعليًا، سعر كل نقطة نهاية الفعلي ومعدل الضرب المؤقت، و يوم واحد من نشاط الرموز لكل نموذج. Claude Opus 5.5 وGPT-6 Luna انطلقوا في 22 سبتمبر، لذا تغطي أرقام نشاطهم يومًا أوليًا جزئيًا، وتستخدم المقالة هذه الأرقام فقط كحصص. تكلفت التجارب $0.63 إجماليًا، ورفضت المسبار البدء بمجرد أن اقترب استخدام الحساب من حد $1. الأسعار هي الأسعار المدرجة لـ OpenRouter التي نُسخت في نفس اليوم. دليل التخزين المؤقت لـ OpenRouter يذكر OpenAI قراءات مؤقتة عند 0.25–0.50×؛ فـ GPT-6 Luna فوترت قراءاتها عند 0.10×، وتبلغ هذه المقالة بما فوتر.
ما زال مفتوحًا: النقطة الدقيقة التي ينقضي فيها التخزين المؤقت غير النشط لكل نموذج، التي تنتهي فيها الجولات المؤقتة الفردية؛ مدى تكرار كسر ساعة أو تاريخ الساعة على فجوات المحادثة الحقيقية؛ لماذا فشل Muse Spark في بداية كل دور عندما لم يتغير تاريخه؛ وسلوك DeepSeek على نقطة النهاية الخاصة به. الإصلاح لكل دور يعمل حاليًا في وكيلنا الإنتاجي، وقد تم وضع نفس الاكتشاف في قائمة انتظار لحزام ثاني يشتغل بنسخة أقدم من نفس المشغل.
بواسطة أنا. السؤال وراء المقال: لماذا لم يبدو أن الذكاء الاصطناعي يعرف التاريخ والوقت جيداً، وأخذ ثوانٍ ليقوله عندما كان يجب أن يكون فوريًا. الفكرة أن الوقت يصبح قديمًا عبر الجلسة ويجب توفيره مرة أخرى، تخميني أن رسالة محددة فقط عندما تكون قديمة ستترك الموجه مخزنًا، والاتصال لاختبارها بالتجربة. إطار التكلفة: مقدّر للشركات التي تبني على هذه النماذج، من بنّائي المنصات إلى الشركات التي تدير منصاتها الداخلية للذكاء الاصطناعي، كما هو اليوم ومع تزايده. الإغلاق على الملاحظة المستمرة، مع نموذج System One مثل Jev يصنف ملف الذاكرة المؤقتة مع مرور الوقت، لأن الإصلاح يبقى فقط طالما يظل أحد يراقب.
بواسطة Claude Opus 5.5. وجد أن دفتر تكاليفنا أخفى التخزين المؤقت، 2.7× على مكالمات 33، وتتبعت السبب إلى خطوط 2 في موجه النظام التي تغيرت في كل دور. بنى إصلاح المشغل الذي الآن في الإنتاج، الاستكشاف، التحليل، ونموذج التكلفة وراء كل رقم هنا، وتطابق الآلية مع الأرقام السوقية العامة لـ OpenRouter . عبر نماذج 4 حددت 3 سلوكيات تخزين مؤقت مختلفة، بما في ذلك سلوك GPT-6 Luna الكامل للرسالة، ونموذج رابع بدون ذاكرة مؤقتة قابلة للاستخدام.
الانتقادات التي بقيت.
من Claude Opus 5.5، من شرحها الأول: مفتاح الجلسة المفقود. ألغى استكشافها ذلك؛ الموجهات المتطابقة التي تم قراءتها بالفعل من الذاكرة المؤقتة عبر الأدوار.
من قياسات Claude Opus 5.5، تخميني: رسالة الوقت المنفصلة تعمل فقط عندما تأتي بعد التعليمات الثابتة. يحمل المقال فكرتي مع ذلك الشرط المرفق.
وصلنا معًا. الاكتشاف أن الساعة لا تكلف شيئًا حتى يتغير نصها، ثم تكلف الموجه بأكمله. والقانون الذي يفعله المقال: أي شيء يتغير بين الأدوار يأتي بعد كل شيء لا يتغير.