Kimi K3接入Amazon Bedrock,企业需重新核算长上下文调用成本
2026-09-18,AWS披露,Moonshot AI的Kimi K3已在Amazon Bedrock上线,可通过US Geo和Global跨区域推理配置调用,并支持显式提示缓存。此次事件是Kimi K3进入Bedrock托管API体系,不等同于模型首次发布。
2026-09-18,AWS披露,Moonshot AI的Kimi K3已在Amazon Bedrock上线,可通过US Geo和Global跨区域推理配置调用,并支持显式提示缓存。此次事件是Kimi K3进入Bedrock托管API体系,不等同于模型首次发布。(AWS 官方公告)
事件摘要与时间线
AWS在其机器学习博客中宣布,Kimi K3已接入Amazon Bedrock,面向编程和知识工作负载提供新的托管模型选择。AWS引用Moonshot AI的说法称,Kimi K3是其最强模型,也是首个达到2.8万亿参数的开放模型;该模型具备原生视觉能力、百万Token上下文窗口,并相较Kimi K2带来约2.5倍的扩展效率提升。需要注意的是,来源披露的是Kimi K3在Amazon Bedrock上线这一平台事件,未披露Kimi K3模型本身首次发布。(AWS 官方公告)

在可用性方面,AWS称Kimi K3可通过跨区域推理配置调用。对没有区域限制的工作负载,AWS建议使用global.moonshotai.kimi-k3这一Global配置,请求可路由至全球受支持的商业AWS区域;对于有数据驻留要求的场景,us.moonshotai.kimi-k3这一US地理配置会将处理保持在美国地理范围内。AWS还表示,Global跨区域推理成本约比地理配置低10%,但来源未给出绝对单价、不同地区价目,也未说明促销期限。(AWS 官方公告)
调用方式上,AWS称开发者可以使用bedrock-runtime端点,支持OpenAI兼容的Responses和Chat Completions API,也支持Amazon Bedrock的Invoke和Converse API。企业如果已经把内部工具、编码助手,或代理框架接到Bedrock,新增模型更像是现有云账号和权限体系内的一项模型选择,与单独采购一个完全独立的SaaS订阅有区别。(AWS 官方公告)
行业背景
AWS将此次上线放在开放权重模型进入生产环境的背景下解释,称开放权重模型正在改变大规模构建和部署AI的经济性,企业可以按工作负载在能力、速度和成本之间做匹配。AWS还披露,自2025年以来,Bedrock已加入来自DeepSeek、Google、MiniMax、Mistral AI、Moonshot AI、NVIDIA、OpenAI和Qwen等提供方的数十个开放权重模型。(AWS 官方公告)
平台能力也在扩展。AWS称,2026年Bedrock增加了工具调用、结构化输出、推理、响应流,以及Responses和Chat Completions API支持;AWS将这些能力描述为平台能力,不按逐个模型的单点集成处理,因此新的开放权重模型在Bedrock可用后也可受益。对企业团队而言,这意味着模型切换、代理工具接入和输出格式约束可能更多发生在同一托管平台内。(AWS 官方公告)
安全和数据边界是AWS重点强调的背景。AWS称,和Bedrock上的所有开放权重模型一样,使用Kimi K3不需要改变安全姿态;数据在AWS数据边界内处理,不会与模型提供方共享,也不会用于训练底层模型。AWS还称推理请求始终启用零数据保留,零操作员访问可防止AWS操作员在推理期间访问提示和补全内容。(AWS 官方公告)
对行业与企业团队的影响
此次变化对企业API和云账单的直接影响,主要来自长上下文与提示缓存的组合。AWS称,Kimi K3是Amazon Bedrock上首个支持显式提示缓存的开放权重模型;在长时间编码和知识工作流中,团队常会反复发送仓库说明、工具定义,或参考文档等稳定上下文。显式缓存允许开发者标记可复用提示前缀,后续请求命中缓存时,Amazon Bedrock可降低响应延迟和输入Token成本。(AWS 官方公告)
缓存并不等同于免费输入。AWS披露,开发者可在至少1,024个Token之后标记可复用提示前缀的准确结束位置;在显式模式下,写入缓存的Token按更高费率计费,并至少保留30分钟。对于后续匹配且命中缓存的请求,输入Token会按折扣费率计费,且不会计入输入Token每分钟配额。企业做预算时,需要把“缓存写入的溢价”“命中后的输入折扣”和“输入Token每分钟配额”分开核算,不能把配额不占用理解为账单不产生。(AWS 官方公告)
Remio作为具名商业博客的观点认为,百万Token窗口只有在应用能避免每次请求重复处理同一大段前缀时,才会在经济上更有用。其举例称,编码助手可能在每轮对话中携带仓库规范、架构文档,工具模式和相关源文件;研究系统也可能反复提交同一组报告,只改变分析师问题。如果没有缓存,模型会每次重新处理重复上下文,应用也会再次承担延迟和输入Token成本。该观点不是第三方性能实测,但有助于解释为什么缓存机制比单纯上下文长度更直接影响企业费用。(Remio 相关解读)
对团队落地而言,Kimi K3可能更适合需要持续上下文的长周期任务,例如大型代码库分析、文档问答、政策库检索后的多轮解释等。但账单是否下降取决于稳定前缀占比、请求间隔、缓存命中率,以及跨区域路由和输出Token规模。来源只披露Global配置相较地理配置约低10%、缓存命中后输入Token折扣和配额处理规则,并未披露完整价目表中的绝对单价;因此企业不能仅凭“长上下文”或“缓存”判断总支出一定下降。(AWS 官方公告)
风险边界与待确认信息
目前来源没有给出Kimi K3在Bedrock上的输入和输出、缓存写入与缓存读取的具体单价,也没有列出支持区域完整清单;AWS仅提示查看Bedrock文档中的受支持区域列表,以及查看Amazon Bedrock价格页面获取定价信息。因此,企业若要估算月度预算,需要以自身实际地区、推理配置,Token结构和价格页为准,不能把文中约10%的跨区域差异换算成固定节省额。(AWS 官方公告)
缓存也存在工程边界。Remio指出,团队需要决定哪些指令保持稳定、何时创建新的缓存键,以及如何处理仓库文件或参考文档更新;前缀发生变化可能导致缓存未命中并需要新的写入。显式缓存适合稳定材料较多、会话持续且重复调用的场景,如果每次请求的前缀频繁变化,缓存写入溢价可能先于读取折扣出现。(Remio 相关解读)
跨区域推理还可能影响缓存观测。Remio提醒,AWS通过路由提升容量和可用性,但分布式路由可能影响可复用缓存状态被找到的位置;应用应查看缓存读取和写入用量,不能假设每个重复请求都会命中。该说法属于商业博客基于AWS机制的评估,不是AWS对命中率作出的保证。(Remio 相关解读)
本文来源也没有披露企业订阅额度和API余额,发票周期和免费试用,以及服务等级协议或监管结论。AWS披露的安全边界说明有助于企业合规评估,但是否满足特定行业、地区,或客户合同要求,仍需企业结合法务、数据驻留和内部云治理要求单独确认。(AWS 官方公告)
后续观察指标
企业后续应重点观察三类指标:一是Global与US Geo配置下的实际调用占比和单位成本差异,尤其是有无数据驻留限制;二是显式缓存的写入Token、读取Token和命中情况,因为写入按更高费率计费,而命中读取才可能降低后续输入成本;三是输入Token每分钟配额的压力是否因缓存命中而缓解,但仍需独立追踪输出Token和总请求量。(AWS 官方公告)
从应用设计看,后续信号不只是模型能否接入工具链,还包括开发团队是否能把稳定上下文放在可控边界之前,并把变化内容留在边界之后。Remio认为,缓存不会替代检索:检索决定哪些信息应该进入请求,缓存则在应用组装出有用且稳定的上下文之后,减少重复处理。若企业把所有文档无差别塞入百万Token窗口,未必能得到更好的成本结构。(Remio 相关解读)
还应关注生态工具的接入深度。AWS提到,Kimi K3不仅可直接通过API使用,也可通过支持Amazon Bedrock或OpenAI兼容模型提供方的编码助手、个人代理和代理框架使用,并举出OpenCode和Hermes Agent等例子。对企业而言,真正影响采用速度的可能是现有开发、研究和自动化流程能否在权限和日志、成本归因和模型切换上保持一致。(AWS 官方公告)
VMCardio 观察
对企业支付管理而言,Kimi K3进入Bedrock后,预算重点不只是付款卡额度,而是把模型调用和缓存写入读取、跨区域配置和AWS账单归因分开核对。
相关阅读
参考资料
- 来源 1:Introducing Kimi K3 on Amazon Bedrock | Amazon Web Services,Amazon Web Services,2026-09-18T16:52:01.000Z
- 来源 2:Introducing Kimi K3 on Amazon Bedrock Puts Open Weights Behind a Managed API,Remio,2026-09-19T04:49:35.664Z