如果你是一名 Token 高消耗用户,过去一年,应该对 AI Agent 最核心的演进感同身受:
除了底层大模型本身的智力跃升,它开始越来越像一个真正的「工作者」。
从最早的聊天机器人,到 MCP、Skills、Harness 等基础设施逐渐成熟,Agent 开始获得越来越多「手脚」,它可以打开网页、读取实时数据、操作软件,甚至连接钱包和交易账户。
但走到这一步,新现实问题也随之出现:会使用工具,和真正能完成一个工作任务,其实是两回事。
一个真正能够承担任务的 Agent,不应该只是收到指令以后调用一次 API,而是需要在一个持续变化的环境中,根据结果不断调整下一步行动。
金融市场恰好把这种差异体现得尤其明显。
你可以告诉一个 Agent「帮我判断某场比赛谁更可能获胜」,它几秒钟就能给出一份看起来不错的分析,但如果要求变成「给你一笔资金,在未来一个月里持续参与预测市场,在控制最大回撤的前提下提高收益」,就完全变成了另一类问题。
它必须不断读取实时新闻、赔率和订单簿,判断市场是否已经充分定价,决定何时建仓、加仓或退出,并在自己的判断出错以后及时调整策略。
而近期密集出现的一系列基础设施创新,似乎正在将这块此前相对缺失的拼图,逐一补齐。
一、AI Agent 需要一个「模拟训练场」?
8 月中旬,SKALE 推出了一个颇有意思的新产品,AgentPit。
简单来说,它是一座专门为预测市场 AI Agent 搭建的「模拟交易沙盒」,同步真实 Polymarket 的市场信息并兼容其 API,同时采用接近生产环境的 CLOB 订单簿、CTF Token 与结算机制,只是将真实资金替换成了模拟 USDC。
开发者可以让 Agent 在其中实时读取盘口、下单撮合、管理仓位,并在完全没有资金损失风险的前提下测试策略,同时也可以观察多个 Agent 在同一订单簿中博弈所涌现出的群体行为。
这看起来有些类似传统量化交易里的回测和模拟盘,但对于 AI Agent 而言,其意义要深远得多。
因为 Agent 面临的一个长期问题在于,你究竟怎么知道一个 Agent「真的会交易」?
众所周知,过去评估大模型能力,行业严重依赖静态的基准测试(Benchmarks)——做几道数学题、修复一段代码、或者总结一篇长文本。
但真实世界中的复杂决策不存在预设的标准答案,尤其在金融市场,假设 Agent 判断某个预测事件的「YES」公允价值应为 0.7 美元,而当前市价为 0.55 美元。当它买入之后,价格可能继续下探到 0.45 美元,也可能因为突发新闻迅速拉升,此外订单簿的瞬时流动性也会直接影响实际成交均价。
那就意味着 Agent 不能给出一次预测就结束任务,它必须持续面对自己上一次决策带来的真实后果,这正是 Agent Pit 的核心价值所在。它为智能体提供了一个逼近真实生产环境的动态反馈闭环:
观察 → 判断 → 执行 → 获得反馈 → 调整 → 再执行。
当然,这里的「训练」并不一定意味着 Agent 每完成一笔交易,就会自动修改底层模型参数,它提供的是一个能够反复运行策略、评估结果和迭代工作流的环境。
就像自动驾驶系统真正走上公路之前,需要在模拟器中经历大量极端场景一样,一个未来可能管理真实资金的金融 Agent,也很难仅凭几次 Prompt 测试就直接获得资产控制权,它需要先证明,自己在连续决策环境里究竟表现如何。
但问题也随之而来。
模拟环境里表现不错,并不意味着可以立刻把真钱交给 AI,中间还需要有更关键的一层。
二、基础设施并轨:当支付与交易成为 Agent 的原生组件
如果观察过去数月主流云巨头与头部交易平台的动作,不难发现,Agent 的运行轨道正在以惊人的速度完成标准化打通。
首先是机器原生支付协议的落地。
8 月 18 日,Amazon Bedrock AgentCore Payments 正式 GA,该服务允许运行在 AgentCore 上的智能体自主发现并付费调用第三方 API、MCP 服务或专业数据源,并集成了 Coinbase 与 Stripe / Privy 的钱包基础设施,原生支持稳定币以及 x402 等机器支付协议。
这就解决了一个极度切中痛点的断点问题——如果 Agent 在分析市场时,发现一份高质量的实时数据需要付费,在以往,工作流必须中断,等待人类手动刷卡购买、配置 API Key 后才能继续。
而在 AgentCore Payments 的框架下,支付被直接封装为工作流内的一个自动化节点,用户只需预先设定预算和策略,Agent 便能在遇到付费壁垒时自主发起微支付完成调用,整个过程无需人工介入,且钱包私钥与凭证对模型本身保持隔离。
紧接着,两天后的 8 月 20 日,Binance 又推出了 Agent OS,开放了 Agent 原生接口。
与单纯提供某一个 AI 功能不同,Agent OS 更像一层专门面向 Agent 的金融基础设施接口,把 Binance API、Wallet Agentic Hub、x402、Skills Hub 和 MCP 等组件整合在了一起。
它允许兼容的 AI 应用通过 MCP 获取行情、查看账户信息,并在用户授权后执行支持的交易操作,更关键的是,它在机制层面强调了权限边界与隔离:
用户可以为 Agent 分配专门的子账户,将资金与交易活动同主账户隔离,并为 Agent 配置具体权限;相关访问权限也可以随时撤销。
如果把 AgentPit、AWS AgentCore Payments 和 Binance Agent OS 放在一起,就会发现一个越来越清晰的变化:
AgentPit 提供了策略测试与持续反馈的环境,x402 和 AWS AgentCore Payments 开始打通机器原生支付,而 Binance Agent OS 则进一步把行情、账户、交易与链上能力开放给 Agent,使得原本分散的能力,正在被逐渐串成一条完整的工作流。
不过,金融场景尤其特殊的一点在于,代码写错了,大不了重新运行,但 Agent 一旦执行了一笔错误交易,资产可能已经真正离开钱包。
这意味着,从模拟环境走向真实世界时,还有一个角色无法被绕过去。
那就是钱包。
三、Agent Wallet 的真正价值到底是什么?
如果勾勒出未来 AI Agent 的完整工作流,它将呈现出一条清晰的链路:
- 先在 AgentPit 这样的模拟环境中训练和测试策略;
- 再通过 MCP、Skills 和各种 API 获得信息与工具;
- 通过 x402 等协议购买数据和计算资源(延伸阅读《当 AI Agent 开始拥有「钱包」:经济自主权之后,谁来守住控制权?》);
- 随后进入真实市场执行交易;
- 再根据实际结果继续调优策略;
到了执行这一步,钱包所承担的角色将与今天截然不同。
毕竟传统 Web3 钱包的交互逻辑是为人机交互设计的——每一笔签名,都依赖人类在屏幕前肉眼核对并手动点击确认,但如果一个高频 Agent 每秒需要读取多组盘口数据、持续微调仓位,仍然要求人类逐笔签名,自动化的意义将荡然无存。
然而,如果直接把私钥交由 AI 保管,又等同于放弃了所有安全底线。
因此,Agent Wallet 真正要解决的,从来不是「如何让 AI 拿到私钥」,而是「如何在不让渡最终资产控制权的前提下,为 Agent 提供安全可控的执行权」。
这也是 imToken 在 Agent Wallet 设计框架中给出的核心解法:
- 账户隔离与会话密钥(Session Keys):在 imToken 的 Agent Wallet 设计构想中,每一个获得执行权限的 Agent 都对应独立的 Agent Account,其 Session Key 在可信执行环境(TEE)中生成并隔离,且不会离开这一安全环境。
- 策略规则(Policy)的硬约束:每个 Agent Account 都需要绑定明确的 Policy,包括允许交互的协议白名单、单笔交易上限、每日额度、操作频率以及授权有效期等限制。换言之,Agent 获得的并不是一个不受约束的钱包,而是被规则包围起来的执行账户。
- 用户保留最终控制权:Agent 只能在用户预先授权的 Policy 范围内自主执行,超出边界的操作必须重新交由用户确认,用户则始终可以调整 Policy,暂停或恢复 Agent、撤销权限并收回资金;对于被识别为异常或超出预设策略的交易,自动执行也会暂停,并重新要求用户进行身份认证。
从这个维度再审视整个生态,就会发现模拟训练(如 AgentPit)与智能钱包(如 imToken Agent Wallet)其实是在解决同一个命题的两个阶段。
前者负责提升 Agent 的决策能力上限,后者负责筑牢 Agent 的行动安全底线。
二者缺一不可。
这可能才是 Agent Wallet 相比传统 Wallet 最重要的变化。
写在最后
从这个意义上说,AgentPit 出现之后,一个值得关注的新阶段正在到来。
AI Agent 正在从「学会使用工具」,进入「学习如何工作」。
而当它最终走出模拟训练场、迈入波谲云诡的真实交易世界时,决定这一步能否走得稳、走得远的,往往不仅取决于底层大模型有多聪明,更取决于我们为其构筑的账户与授权边界有多坚固。
毕竟,在真实复杂的经济体系中,我们真正需要的从来不是一个永远不犯错的 Agent,而是一个即便可能失误,其风险依然在可控边界之内的 Agent。