海量资金即将涌入芯片与数据中心赛道,各家企业持续大手笔投入AI技术自研 ,几乎所有相关参与方都在想方设法,提升自身投入与收益的可预测性 。

市场已经诞生GPU交易平台与合约工具,方便买卖双方锁定算力租赁价格。本周二 ,芝加哥商业交易所(CME Group)宣布,待监管审批完成后,将于10月推出两份场内GPU期货合约,并披露相关细则。
如今这类金融创新开始瞄准词元(Token)—— 企业调用AI模型时实际付费结算的计量单位 。
据报道 ,初创算力交易平台Compute Exchange原本业务是撮合GPU持有方与短期租用者,现在拓展同类撮合业务,推出词元远期合约(Token forwards)。这属于场外私下协商合约 ,允许企业最长锁定未来六个月的词元采购价格,对冲后续AI使用成本波动风险。
词元远期合约的定价模式和GPU合约存在区别:GPU合约一般锁定运行AI模型所需算力的小时单价;词元合约则在更长周期内锁定统一价格,交易标的也是企业日常业务真正消耗的资源。
客户可选择六家签约推理服务商提供的多款主流开源权重模型 。远期合约和CME筹备的标准化场内期货并不完全等同 ,但标志着金融市场套保机制,进一步延伸到更多类型AI成本项目。
词元就是送入AI模型 、以及模型生成回复时拆分出的文字片段,这个处理流程被称作推理。全球绝大多数AI交互行为发生在推理环节 ,而非新模型训练 。随着智能体承接越来越多AI流量,推理业务规模即将迎来爆发。
德勤预测,到2026年末 ,推理任务将占到整体AI算力负载的三分之二,2023年这一比例仅为三分之一。
AI应用早期阶段,不少企业放开权限,允许员工不受限制使用AI 。Meta等大厂开启了词元最大化风潮:搭建内部排行榜 ,鼓励员工尽早、高频测试AI,消耗海量词元资源。随后优步、ServiceNow等企业曝出,短短数月就耗尽全年AI预算 ,各大公司随即出台新规,限制员工AI资源消耗。
AI数据与内存基础设施企业WEKA首席AI官瓦尔・贝尔科维奇表示,任何能够锁定词元采购价格的工具 ,都有助于各类企业与初创公司更好管控开支 。WEKA主要帮助AI系统提升GPU显存利用效率。
“所有人都焦头烂额梳理云账单, ”贝尔科维奇称,“登上词元消耗排行榜榜首 ,从曾经引以为傲的荣誉标签,迅速沦为负面信号。”
他表示,模型规模持续扩大 、上下文窗口不断拉长、可自主运行数日乃至数周的智能体落地 ,叠加新兴网络安全威胁,多重因素共同推高词元消耗量 。这使得企业很难掌握完整信息,难以理性制定成本管控方案。
“这个市场过于复杂、透明度不足,需要清算机构来提升信息公开水平。”
在推出词元远期合约的同时 ,Compute Exchange还将打造标准化词元单位体系,建立一套基准方法,用于对标各类报价方案与模型性能。
Compute Exchange首席执行官李卡门表示 ,平台的核心价值在于,词元远期合约提供了另一种选择,替代当下主流的AI调用模式——通过通用API接口访问模型 。
依靠API调用模式 ,用户很难管控成本、衡量性能。原因在于模型厂商按照词元用量计费,同时保留调控词元处理速度的权限:例如在不对外告知的情况下调整用户排队优先级 、限制调用速率。用户只能被动接受现货价格,无法锁定长期成本 ,贝尔科维奇将这类市价称作保留价 。
贝尔科维奇提到,近几个月词元现货价格波动显著加剧。OpenRouter平台可以直观体现这一变化:以往新上线模型报价能稳定数小时、数日甚至数周,如今价格可能每小时变动。
与Compute Exchange签约的推理服务商 ,主要运营DeepSeek、月之暗面 、阿里巴巴等厂商开发的模型;相比Anthropic、OpenAI等前沿闭源模型,这些方案性价比更高,性能竞争力也持续增强 。
有采购需求的企业登录Compute Exchange平台,提交需求清单 ,包含意向模型、目标价格 、吞吐速率与其他指标;平台合作服务商相互竞价争取订单。
一旦撮合成功,词元采购方将知晓供货方信息,并且在合约周期内 ,有义务消化约定数量的词元。Compute Exchange将抽取4%交易服务费 。
不少企业不愿一次性锁定数月固定模型,毕竟几乎每周都有性能更强的新模型问世。李卡门称,平台与合作服务商允许客户在合约框架内切换不同模型。
当然 ,和所有新兴金融市场一样,词元远期合约发挥作用的前提是拥有足够多买方与卖方 。远期合约同时自带交易对手风险:一旦一方无力履约,另一方将承受损失。
但贝尔科维奇认为 ,对于想要落地AI业务的企业而言,稳定可控的词元定价,或许是在瞬息万变的行业环境中维持经营的关键。
“如果你尝试做预算规划、算力容量规划 ,只会不断被动追赶波动。 ”