今年用 AI 搞钱的路子不少,但说起来, 卖课、上门装龙虾,都不如卖 Token 来得火爆。
就在昨天,干支付聚合的 Stripe 花了超过 70 亿美元,把干模型聚合的 OpenRouter 给收购了。

要知道今年 5 月,OpenRouter的估值还只有 13 亿美元,结果短短三个月时间,就变成百亿身价了。
你就说这生意有没有搞头吧?
而且今年,又流行起了一个叫 “ Token 工厂” 的概念。
不是我瞎掰啊,今年 WAIC 上,世超就在不少展台上看到过这个词。概念听起来唬人,但说白了干的还是卖 Token 的生意。
可能有差友还记得,咱们之前聊过一些游走在灰色地带的私人中转站。
这些野路子平台往往靠反向代理来提供服务,价格确实便宜,但 API 从哪来、接口哪天会断,中途会不会偷摸给你换模型,基本全靠老板的良心。
但这次的 Token 工厂不太一样,人家可是正儿八经、合法合规的生意,也就是另外一个,大家可能更加陌生的MaaS(模型即服务)。

像火山方舟、阿里云百炼和百度千帆这些大厂平台都有MaaS服务,你不光能调用他们家的模型,也能接入其他厂商或者开源模型。

随着 Token 的需求越来越大,盯上这门生意的公司自然也越来越多。
不过,虽然大家嘴上喊的都是“Token 工厂”,但各家公司手里的资源和提供的服务不完全相同,咱们今天说的第三方 Token 服务,主要有两种模式。
一种是自己部署模型,再把Token卖出去。
这种要么自己买算力,要么租算力,接着部署各种开源模型,再通过推理引擎和调度系统折腾一通,最后把模型封装成 API,按 Token 对外收费。
里面比较具代表性的是硅基流动, 他们家靠着卖 Token 都快上市了。
硅基流动的官网上面,有很多咱们熟悉的老面孔,像什么智谱GLM-5.2,DeepSeek-V4-Pro还有Kimi-K3。

但显然,硅基流动不负责训练出这些模型,世超顺手扒了扒硅基流动的上市申请书,他们家主要是提供 公有云服务和本地部署解决方案。
说人话就是,充钱之后 170 个模型你想调用哪个模型就调用哪个,Token消耗量更大的企业,可以包下他们家的专属算力。像那些自己有算力的公司,还能把他们家的整套服务搬进自家的机房。
这种玩法没毛病,就是成本高,硅基流动 2024 年的租赁成本只有不到 500 万,但 2025 年就飙到 6000 万了。
相比之下,另外一种聚合的模式就轻松很多了,国外的OpenRouter就是这么玩的。
OpenRouter的核心模式不是租GPU和数据中心,再把几百款模型挨个部署一遍,而是把模型原厂、云厂商和第三方Token服务商全都塞进一个平台, 大伙儿可以理解为淘宝、天猫。
像Claude Opus 5这种闭源模型,在 OpenRouter 上就只有 Anthropic 这一家原厂。
但如果是MiniMax M3,可以看到有包括MiniMax官方在内的好几家Token服务商,同一个模型,有些服务商的价格能干到比原厂还低。
在这上边儿,你能看到不同服务商的价格、延迟、吞吐量,同一个模型,有些服务商的价格能干到比原厂还低,还能通过模型最近 3 天正常运行的时间,对比哪家提供的模型服务更稳定。

有意思的是,国内做模型服务聚合的硅基流动,也被聚合在了Openrouter上。

所以, OpenRouter更像一个 Token 大型交易市场。
截至 2026 年 5 月,OpenRouter已经接入了 400 多款模型,每周处理的 Token 数量,也从半年前的 5 万亿增长到 25 万亿,妥妥的行业Top。
其实这种聚合的玩法国内也有,清程极智的AI Ping上边儿就聚合了很多家服务商,有点中国版 OpenRouter 的意思。

不过聊到这儿,可能有差友会疑惑,大家提供的都是同一款模型,但是 Token 不应该像矿泉水一样,在哪买都差不多吗?
还真不是。
同样一款模型,放在不同服务商手里,价格、跑出来的速度和稳定性都有可能不同。
你像开源模型发布之后,服务商拿到的只是模型权重,除了准备算力、部署模型,还要做一整套工程优化。
这中间的技术水平不同,提供的服务自然也不一样。
举个例子,推理引擎对模型服务商来说就很关键。如果推理引擎调得好,同样一批显卡就能处理更多请求,模型吐字更快,高峰期也不容易卡住,单个 Token 的成本还能跟着降下来。
隔壁知危在专访清程极智创始人师天麾的文章里,就提到了这一点。
“推理引擎不仅决定了效率、成本、稳定性,还决定了模型到底“聪不聪明”,同样的机器、同样的模型,不同的人部署出来,效果可以差很多,能把模型顺利部署好、发挥出原厂水平,这件事本身就有很高的技术门槛”。
换句话说,在不同服务商那里调用同一个模型,你可能用到的是高并发、不掉线、智商在线的满血版,也有可能是动不动就报429、被暗中降智的缩水版。

但问题又来了,既然这帮卖Token的水平参差不齐,那我直接找原厂直销不就好了。
世超之前跟一家 Token 服务商聊的时候发现,他们提供的部分模型 API,卖得甚至比官方还贵,这就很离谱。
不过仔细研究之后,我发现一个很重要的原因是,官方卖Token,不等于这些Token能满足需求。
几百上千个请求同时进来,压力直接给到并发额度,Rate Limit(速率限制)也跟着亮红灯,到时候喜提报错不是没可能。要是遇到高峰期算力紧张,官方肯定优先保障自家的核心业务和大客户,一般的中小企业你就只能往后稍稍了。
但如果换第三方服务商就是另外一种思路了, 大厂眼里的小卡拉米在他们那可能就是VIC,价格可能是贵点,但你的需求都会尽可能满足。

所以,有些第三方 Token 明明卖得比官方贵,还是会有人买单。说到底,官方卖的是模型能力,这些中间商卖的,是让模型能力能够稳定进入生产环境。
照这么看,这门生意是不是还挺小而美的。
但世超也注意到,有些服务商 Token 越卖越多,也越卖越亏。
咱们还是以硅基流动为例,根据上市申请书,2025年硅基流动的公有云服务收入大概是2926万元,毛利率却是-119%。
不能说薄利多销吧,完全就是赔本赚吆喝了。
因为除了算力租赁的成本外,硅基流动为了吸引开发者,还提供免费模型、体验额度和代金券。2025年,硅基流动光发放免费 Token代金券就花了 5421 万元,快赶上当年的总收入了。
而且比暂时亏损更麻烦的是,Token 正在变成一种高度同质化的东西。卖Token的服务商那么多,我到底选哪家?
如果只卷价格,你今天便宜两毛,明天隔壁又做个折扣,这样留下的也是一些散客。
所以单纯卖Token,天花板其实很有限。
真正能拉开差距的,是高并发的时候会不会崩,以及有没有调试、评测、成本管理和智能体编排等配套的工具。
对于Token工厂来说,更重要的是,除了Token你还有什么。
撰文:西西
编辑:江江&面线
美编:焕妍
图片、资料来源:
火山方舟、硅基流动、OpenRouter
IDC,中国MaaS市场进入高速增长期,Token经济从概念走向规模化实践
部分图源网络
下一篇:没有了