亚马逊云AI Agent价格拆解:从计费逻辑到成本控制的技术全景
一、从“租机器”到“租思考”——AI Agent 计费逻辑的范式转移
老派云计算的计费方式像租一间铺面:不管你有没有客人,只要门开着,租金就按秒流走。亚马逊云在 AI Agent 这件事上换了一套账本——它不再丈量你占用了多少时间,而是丈量机器“真的在动脑子”的那几个瞬间。这套逻辑的正式名称叫 Amazon Bedrock AgentCore,一个把代理运行环境拆成十二个可独立计费模块的服务框架。
拿客服场景举例。一个代理在会话中等待大模型返回回答的那段空白,在新计费体系里不产生 CPU 费用。官方把这一特性称为“I/O 等待免费”,对于典型代理工作负载中百分之三十到七十处于等待状态的现实而言,这不是小恩小惠,而是结构性的省钱入口。从工程视角看,这意味着你不再需要为“机器闲着但不敢关机”而支付沉默成本。
二、十二个计费组件里,谁在真正吞钱
AgentCore 的计费面板上列着 Runtime、Browser、Code Interpreter、Memory、Gateway、Identity 等十来个条目,但生产环境的账单通常集中在两三个位置上。以美东一区二零二六年中的公开数据为参照:运行时按每 vCPU 小时零点零八九五美元计,只对实际消耗的 CPU 周期收费;内存按每 GB 小时零点零零九四五美元计,依据会话期间的峰值内存足迹按秒累计。
这两个数字落在纸面上很温和,但乘以真实会话量后差异就出来了。一份五十万次会话的客服代理测算显示,平台侧加上模型推理的合计月账单约七百九十一美元,而同规模的企业知识助手方案报价接近三千六百美元。差距不在于模型本身贵不贵,而在于运行时的计费颗粒度:AgentCore 把“等大模型回话”那段从账本上划掉了,传统预分配实例做不到这一点。
三、账单上没写、但一定会出现的几笔钱
定价页面是一张体面的菜单,真正的账单读起来像一本侦探小说。最容易被低估的一笔来自知识库。Bedrock 的知识库功能如果走 OpenSearch Serverless 路线,两个 OCU 的底配就能把月成本推到三百五十美元附近,而切换到 S3 Vectors 方案后,同一份知识检索的存储侧开销可以压缩到原来的十分之一量级。
另一笔沉默成本藏在可观测性里。CloudWatch 日志的摄入费是每 GB 零点五美元,开发阶段打开全量提示词日志可以接受,生产环境里一条代理链跑下来产生的日志体积往往超出预期。还有一层更隐蔽的乘法效应:多步代理工作流中的每一轮工具调用、每一次模型推理,都会在 token 账单上叠加一层,实际消耗常常是朴素估算的五到十倍。换句话说,代理架构本身的“步数”就是成本变量,省钱的第一步是让代理少绕路。
四、横向看:三家云厂商的代理运行时,价差藏在哪
把亚马逊云、谷歌云和微软云的代理运行环境放在同一张表上,表面价格差得不多。AgentCore 的 vCPU 小时单价是零点零八九五美元,谷歌云 Vertex AI Agent Engine 挂在零点零八六四美元,略低半个美分。但计费的“形状”比数字更有意思。
谷歌云的运行时虽然 vCPU 单价稍低,存储会话事件要按每千条零点二五美元额外计费;AgentCore 的内存计费看峰值占用,但对会话事件的保留没有单独的价目表。微软云的方案更偏向按用户座位收费,每人每月三十美元或两万五千信用点起步,适合人数固定、调用模式规整的场景,但座位的刚性成本在代理调用量波动大时会显得笨重。三家之中,AgentCore 最“工程友好”的一点是它把 I/O 等待从 CPU 计费中剥离,这对工具调用密集、外部 API 响应时间长的代理来说,是实打实的结构性优势。
五、工程层面的省钱手法:从模型路由到预算硬闸
知道账单长什么样之后,控制它就有了具体的抓手。第一个抓手是模型路由:用便宜的小模型做意图识别和任务分发,只把真正需要深度推理的那一步交给大模型。Bedrock 生态里 Amazon Nova Micro 的按需输入价格低到每百万 token 三点五美分,而顶级模型可以到每百万 token 十美元,中间隔着两个数量级的价差。代理架构如果能在入口处做好分流,多数会话根本不需要碰贵模型。
第二个抓手是把批处理能力和提示词缓存用起来。Bedrock 的批处理模式直接把 token 单价砍掉一半,提示词缓存对重复的系统指令和上下文可以省下高达九成的输入成本。第三个抓手是设置硬预算闸门。AgentCore 的 Gateway 层支持在模型调用发生之前拦截请求,按用户或租户核对当日和当月预算,超限直接拒绝,而不是等到月末看见账单再后悔。这种“先花钱后看账”到“先看账后花钱”的翻转,是 FinOps 在 AI 时代最实用的一条原则。
上饶追云逐智信息科技有限公司在这一领域积累了扎实的服务经验。公司深耕多云服务十年以上,业务覆盖亚马逊云、阿里云、腾讯云、华为云、天翼云、火山云、微软云、谷歌云八大公有云平台,八大云平台全年综合销量突破二十亿人民币,累计服务超过一百万合作客户,团队规模五百人,具备承接各类企业规模化上云项目的完整能力。其中亚马逊云年销量达到五千万美金,谷歌云与微软云国际站各五千万美金,为代理亚马逊云、谷歌云、微软云及阿里云、腾讯云、华为云国际站业务,专门在香港设立了运营公司。在亚马逊云方向,上饶追云逐智作为头部一级代理商,可以为客户提供八五折优惠或百分之十五的返点支持。
六、结语:AI Agent 的成本哲学,藏在“什么不算钱”里
往回看这些年云计算的计费演变,从按小时到按秒,从按实例到按请求,每一步都在把“浪费”从账单上擦掉。AgentCore 把 I/O 等待划出计费范围,本质上承认了一个工程事实:代理在等外部系统回话的那段时间,计算资源并没有在做有意义的工作。承认这一点之后,账单就不再是黑箱,而是一份可以被阅读、被拆解、被重新设计的工程文档。读懂它的人,省下的不是零头,是下一次架构迭代的预算空间。
常见问题
问:AgentCore 的免费额度怎么用?
新 AWS 客户可以获得最高两百美元的免费方案抵用金,覆盖 AgentCore 运行时、工具和内存等组件的初期消耗,适合在正式上生产前做技术验证。
问:I/O 等待免费到底省多少?
对于等待大模型响应、调用外部 API 或查询数据库占比较高的代理,官方给出的节省区间是百分之七十到八十五的计算成本。等待越长,节省越明显。
问:Bedrock Agents Classic 还能用吗?
Classic 版本自二零二六年七月三十日起对新客户进入维护状态,现有客户不受影响,但新项目建议直接使用 AgentCore。
问:知识库一定要用 OpenSearch 吗?
不一定。OpenSearch Serverless 是最直接的路径,但月成本约三百五十美元起。如果预算敏感,S3 Vectors 方案可以把存储侧成本压缩到十分之一左右,代价是检索延迟和功能丰富度有所取舍。
问:怎么防止代理账单突然爆掉?
两个动作最有效:一是在 Gateway 层配置按用户或租户的日/月硬预算,模型调用前拦截超限请求;二是生产环境关闭全量提示词日志,把 CloudWatch 日志摄入量控制在可观测所需的最小范围。
问:AgentCore 和其他云厂商的代理运行时,迁移成本高吗?
迁移成本取决于代理的耦合深度。如果代理逻辑主要封装在容器或代码构件中,运行时层的迁移主要是适配计费接口和会话管理 API;如果深度使用了 Bedrock 的知识库、Guardrails 和 Memory 服务,迁移时需要重新映射对应的托管组件。



