讨论

AI成本优化工作流:缓存、路由与批处理

来自 Wikiprompt,自由的提示词百科全书

Coin Shot ☁️

2026年9月3日

AI成本优化工作流:缓存、路由与批处理 一个9步工作流程,用于通过提示缓存、模型路由、输出上限、答案缓存、批处理和测量来降低AI API成本。

提示词内容收藏

🌐
1/ 缓存提示词中永远不变的部分。如果你每次调用都发送相同的系统提示词或知识库,你就要为重新读取从未变动的文本支付全价。Anthropic允许你缓存这个稳定的前缀。缓存读取成本仅为正常输入的10%。这意味着每次调用中重复的部分可节省90%。 2/ 但缓存仅在前缀完全一致时才有效。改动一个字,哪怕是一个时间戳,你就要再次支付全价。解决办法:把静态内容放在前面(指令、工具、文档),把变化的内容放在最后。顺序的重要性远超人们所想。 3/ 停止重新发送整个对话。大多数应用每轮都会重新发送全部聊天历史。你的成本随每条消息不断攀升。将旧轮次总结为简短的运行摘要。只保留最后几条消息的原文。一个40条消息的线程可以压缩为5行摘要加上最后3轮对话。 4/ 检索,而不是堆砌。把整个知识库粘贴进去“以防万一”是账单爆炸的原因。只提取与问题实际匹配的3到5个片段。你将上下文从50,000个令牌减少到约2,000个,而且答案会更精准。 5/ 使用能胜任任务的最小模型。大多数请求不需要你的最大模型。将分类、路由和简短回复发送给更便宜的模型,如Haiku。把昂贵模型留给那困难的10%。 6/ 限制输出。输出令牌通常比输入成本更高。设置max_tokens并明确要求你想要的格式。“用一句话回答”是成本杠杆,而不仅仅是风格选择。 7/ 缓存答案,而不仅仅是提示词。如果500个用户问同一个常见问题,你不需要500次模型调用。存储常见答案并直接从你自己的缓存中提供。最便宜的令牌是你从未发送的那个。 8/ 批量处理所有非实时任务。夜间报告、标记积压任务、评估、模型迁移。这些都不需要即时回复。Anthropic的Batch API在输入和输出上提供50%折扣,且大多数批次在一小时内完成。与提示词缓存叠加,输入成本节省可达约95%。 9/ 在优化之前先测量。发送前统计令牌数。按功能记录使用情况。你几乎总会发现一个臃肿的提示词消耗了大部分账单。先消灭那个。 结语:无限访问从来不是重点。用十分之一的令牌获得相同结果才是。这就是整个游戏。

登录以查看完整提示词

继续使用:

登录即表示你同意我们的 使用条款 隐私政策

用法

此提示词专为 other 设计。复制上方内容并粘贴到你常用的 AI 工具中。

为获得最佳效果,可将占位符(方括号或大写字母标示)替换为你的具体需求。

参考资料

分类:other| twitter| ai-cost-optimization| prompt-caching

讨论