AI 模型供应商调研:质量、价格、隐私和延迟
我调研了 8 家 API 大模型的聚合平台:OpenRouter、B.AI、EasyRouter、硅基流动、Novita、DeepInfra、Groq、Together。核对了它们的定价页、隐私政策、机房披露,以及 2026 年的三篇审计论文,想搞清楚同一个模型跨平台的价差里,哪些是真实的成本差异,哪些只是平台定位不同。
排出来的顺序和大多数人的直觉相反:价格应该是最后一关。依据是 CISPA 那篇论文的回归分析——在他们审计的中转站样本里,价格比率对准确率下降没有预测力。[18] 多付的钱,买不到「至少模型是真的」这个保证。
本文所有价格和政策条款都是 2026 年 9 月 9 日的快照。这个行业三天就能改一次价,使用前请以各平台官网为准。
十倍价差来自平台定位,不是模型
先把价差本身拆开。它是模型的差异,还是别的东西。
| 模型 | 最低 | 最高 | 倍数 |
|---|---|---|---|
| DeepSeek V4-Flash | DeepInfra $0.06 | 硅基流动高峰 $0.42 | 7x |
| Llama 3.3 70B | OpenRouter / DeepInfra $0.10 | Together $1.04 | 10x |
| Qwen3 32B 级 | OpenRouter / DeepInfra $0.08 | Groq $0.29 | 3.6x |
单位是 USD / 百万输入 token,2026-09-09 快照。[1] 这三行是我从十八行的完整表里挑出来的,倍数最悬殊的三个,完整的表放在价格那一节。
闭源旗舰没有套利空间
GPT-5.x、Claude、Gemini 这三条线,八家里只有 OpenRouter 和 B.AI 供应,而且两家同价——Claude Opus 5 都是 $5.00 / $25.00,GPT-5.4 都是 $2.50 / $15.00,走的是 pass-through 原价。[1] 剩下六家根本买不到。
所以在闭源旗舰这一侧,「同一个模型的跨平台价差」这个问题只有一组样本,而这组样本的答案是零。
价差全在开源和国产模型这一侧
倍数全部出现在开源与国产模型上。这一侧的平台各自在做不同的生意,价格反映的是生意的形态:
DeepInfra 和 OpenRouter 处在最低价那一端,前者是专做开源模型的推理云,后者靠聚合多个供应商后挑最便宜的端点。Groq 的 Llama 3.3 是别家的六倍,因为它卖的是 LPU 硬件带来的低延迟,速度是定价理由。Together 的 Llama 3.3 全市场最贵,它面对的是企业开源方案的客户,附带 dedicated 部署和合规配置。硅基流动按官方价折人民币,不加价也不补贴,另有低谷时段半价。B.AI 的主流型号按官方原价一比一,差价来自促销——快照日 GLM-5.3-Flash、腾讯混元 Hy3、小米 MiMo-V2.5 都是免费,DeepSeek V4-Flash 打五折。[1]
价差几乎全部来自平台定位,不来自模型本身。同一份权重,在低价推理云上跑和在专用硬件上跑,成本结构差得很远。
这一步只说明了价差的来源。它没有回答另一个问题:最便宜的那一端,卖的是不是同一个东西。
价格对模型真假没有预测力
2026 年有三篇论文对这个市场做了系统性审计,它们分别测了三类不同的失效。
德国 CISPA 的《Real Money, Fake Models》做的是模型身份审计。研究者识别出 17 个被 187 篇正式论文引用过的「影子 API」,也就是声称能复现官方模型输出、以更低价格提供兼容端点的第三方服务。结果是 45.83% 的指纹测试没有通过模型身份验证——后台跑的不是它宣称的那个模型。性能偏差最高 47.21%。[18]
一个具体的数字:Gemini-2.5-flash 在 MedQA 医学问答上,官方 API 准确率 83.82%,所有被测影子 API 平均约 37%。法律推理基准上的落差也类似,三个被测服务对同一模型的一致性分别是 53.06%、52.36% 和 54.64%。[18]
这个偏差的下游影响论文也算了一笔账。那 187 篇引用了影子 API 的论文里,保守假设三成需要重跑,按每篇 50 到 500 美元的 API 成本加上研究者约 40 小时的时间估算,直接成本在 11.5 万到 14 万美元之间;而引用这些论文的下游研究有 5,966 篇,可能被无声地污染。[18] 一个跑在别人后台的、没人验证过的模型,代价会沿着引用链传下去。
这篇论文里对本文最关键的一条在附录 G。研究者做了回归分析,检查价格比率能否预测准确率下降,结论是完全没有预测力。[18][30] 贵的中转站不比便宜的中转站更可能给到真模型。
这条结论直接否掉了「按价格排序,然后在预算内挑最贵的」这个策略。价格不是质量的代理变量,在这个市场里它连弱相关都不是。
顺带说一句证据强度。有一句流传较广的话,说中转站的暴利数量几乎等于它省下的合规成本。我在 CISPA 原文里没有检索到这个表述,论文里能找到的只有「这些卖家同时违反服务合同与监管要求」。[18] 那句话疑似中文媒体的转述,本文按未核实处理。
三篇论文测的是三类不同的失效
三篇覆盖的是三类不同的问题,混在一起引用会出错。
| 论文 | 机构 | 测的是 | 核心数字 |
|---|---|---|---|
| Real Money, Fake Models | CISPA | 模型身份是否一致 | 45.83% 指纹测试未通过 [18] |
| Your Agent Is Mine | 加州大学尔湾分校 | 中间人是否有恶意行为 | 428 站中 9 站注入恶意代码 [19] |
| GateScope | UMass Boston + ASU | 计费与上下文是否诚实 | 单站计费溢价 62.8% [20] |
这组数字我原先记在 CISPA 名下,翻论文时才发现「428 个中转站」出自加州大学尔湾分校的另一篇,CISPA 对应的是 45.83% 那一组。两篇经常被中文报道并列引用,机构归属容易串。[19]
排序依据:不可逆乘以不可观测
六道关口按两个可以判断的性质排序:选错了能不能撤回,以及事后会不会知道自己选错了。重要性排不出来,这两项排得出来。
| 关口 | 选错了能撤回吗 | 会知道自己选错了吗 | 位次 |
|---|---|---|---|
| 数据能不能出去 | 不能,发出去就收不回 | 不会,没有通知机制 | 1 |
| 链路上有几跳 | 换供应商可以,已发出的请求不能 | 不会,明文转发不留痕 | 2 |
| 模型是不是宣称的那个 | 能换 | 只有主动做指纹测试才知道 | 3 |
| 计费与上下文是否诚实 | 能换,已付的钱要不回 | 需要专门设计测试 | 4 |
| 延迟与区域 | 能换 | 会,第一天就知道 | 5 |
| 价格 | 能换 | 会,价目页上写着 | 6 |
越不可逆、越不可观测的越靠前。价格排在最后,因为它是六项里唯一一个完全透明、当天就能改回来的。先比价再看别的,这个直觉顺序恰好是倒过来的。
下面六节按这个次序展开。
隐私政策:Together 最规范,B.AI 和 EasyRouter 几乎空白
请求发出去之后,谁可以留存它、用它训练、把它转给谁。这一关排第一,因为发出去的提示词收不回来,而且不会有任何人通知发生了什么。
八家的隐私政策我是逐条读下来的。这一项上的差距比价格表那一项大得多——价格差的是倍数,政策差的是有没有。
| 平台 | 用数据训练 | 提示词保留期 | 数据位置 | 最需要注意的一条 |
|---|---|---|---|---|
| Together | 需显式 opt-in,默认不训练 | 提供 Zero Data Retention 选项 | 跨境需同意 | ZDR 仅向前生效 |
| OpenRouter | 平台自身不训练 | 文本输入输出无固定期限 | 由所选供应商决定 | 无法阻止上游供应商训练 |
| Groq | 客户数据由 DPA 规定 | 同左,不在公开政策内 | 国际传输经 SCC / DPF | 提示词条款需另查 DPA |
| 硅基流动 | 明确否认 | 推理后立即销毁 | 中国境内 | 需实名,输入输出过内容审核 |
| Novita | 声明不用于训练 | 账户 7 年 / 通信 3 年 / 技术 2 年 | 跨境受 SCC、DPF 保障 | 分析类共享在 CCPA 下可能算「出售」 |
| DeepInfra | 未经同意不存储、不训练 | 销户后 30 天移除 | 可能在美国 | 政策为通用模板化文本 |
| B.AI | 无训练条款 | 未规定 | 未披露 | 政策承认会收集、记录、存储输入 |
| EasyRouter | 无政策 | 无政策 | 无政策 | 没有隐私政策,也没有用户协议 |
来源为各家公开隐私政策,2026-09-09 抓取。[6][8][9][11][12][13][15][16]
政策最细的三家:Together、OpenRouter、硅基流动
Together 是八家里唯一提供 Zero Data Retention 选项的,默认不训练,要训练得用户显式 opt-in。[16] 它的代价写在政策里:ZDR 只向前生效,开启之后平台自己也无法再访问、导出或删除此前的数据。
OpenRouter 的结构值得单独说。平台自身不训练,GDPR、SCC、CCPA 条款齐全,还会对声明「不训练」的供应商打标。[6] 但它是聚合器,输入输出最终传给所选的上游供应商,而供应商可以保留并使用这些数据,包括用于训练。平台层的承诺和上游层的行为是两件事,中间这道缝 OpenRouter 自己在政策里写明了。
硅基流动走的是另一条路:明确否认用于预训练和微调,推理完成后立即销毁且不可恢复,数据存在中国境内,框架是《个人信息保护法》而不是 GDPR。[11] 代价是需要实名认证,输入输出都要过内容安全审核管线。
政策最薄的两家:B.AI 和 EasyRouter
B.AI 的隐私政策里没有 GDPR 条款,没有保留期,没有训练条款,也没有披露数据位置。同时政策本身承认会「collect, log, and store」用户输入,并以匿名化形式用于优化其基础设施与 API 网络。[8] 条款少不等于风险低——在这里它意味着没有任何书面约束。
EasyRouter 这一栏最后记下的东西比我预计的少。站内没有隐私政策,没有用户协议,数据收集、保留、训练、共享全部没有公开约束。[9] 顺带查到的另一件事是官方域名归属也无法确认:easyrouter.ai 不解析,唯一在线的 easyrouter.tech 注册于 2026-07-07,比宣称的上线时间晚了两个月,站内没有价目表,也找不到媒体转述过的「八五折、零平台费」表述。
这张表是政策对读,不是审计结论
必须写清楚的边界:上面整张表的依据是各家公开的政策文字,不是第三方审计。
「政策未提及 SOC2」的意思是那份政策正文里没有出现相关主张,不等于该平台没有这项认证。DeepInfra 的政策自称符合 SOC2 与 ISO27001,但那份政策是通用模板化文本,措辞与 Novita 高度相似,认证本身本文没有独立核实。[13] Novita 的 SOC2 只出现在页脚徽标,没有进入政策正文。[12] OpenRouter 和 Together 的政策则完全没提。
换句话说,这一关能筛掉的是「书面承诺明显不足」的候选,筛不出「书面承诺充分且确实做到了」的候选。
转卖风险是行业级主张
行业报道称部分中转站会采集并转卖提示词数据。[30] 这是行业层面的主张,不是针对具体某家的既证事实,本文也没有找到针对 B.AI 或 EasyRouter 的个案实证。
但机制上的判断可以成立:中转平台位于用户与上游模型之间,请求明文经它转发,因此天然具备采集、留存、转售提示词的能力。政策约束缺位时,这项能力不受限制。B.AI 承认收集存储输入,EasyRouter 没有政策,两端都落在这个区间里。
合规侧还有两条框架性事实。向境内用户提供境外未备案模型的服务,不满足《生成式人工智能服务管理暂行办法》的备案与安全评估要求。[25] 而把境内用户的个人信息传输到境外并留存,累计超过十万人时可能触发《数据出境安全评估办法》的申报义务。[26] 这两条约束的是平台,不是个人开发者,但它们决定了一条链路能不能长期存在。
网关路由:自建算力跳数最少,中转站最不透明
从发出请求到模型之间,经过了几个能读写明文的节点。这一关排在模型真实性之前,因为跳数决定了后面那几关能不能被验证——链路越长,任何一个节点被攻破都会沿链污染,终端拿到的响应是否被篡改,从外部看不出来。
加州大学尔湾分校那篇论文的做法很直接:研究者从淘宝、闲鱼和 Shopify 店铺买了 28 个付费路由器,从公开社区收集了 400 个免费的,一共 428 个,然后挨个测。[19]
结果是 9 个正在主动注入恶意代码,17 个触发了研究者预埋的 AWS 蜜罐凭证盗用,1 个直接抽走了研究者私钥钱包里的 ETH。
其中 2 个部署了自适应规避:前 50 次请求正常返回,第 51 次才激活注入。[19] 这个细节说明一件事——跑几次冒烟测试看着没问题,不构成证据。
研究者还做了一组污染实验。一个被故意泄露的 OpenAI key 产生了一亿 token 的 GPT-5.4 流量和七次以上 Codex 会话;一个弱配置的蜜罐产生了二十亿计费 token、99 组凭证、440 次 Codex 会话,其中 401 个会话已经运行在自主模式下。[19]
跳数没有公开数字,只能靠代理指标估算
平台不会公布这个数字,能查的是几个代理指标:
是否自研网关。CISPA 论文里被审计的中转站有一家基于开源项目 NewAPI 搭建,它的模型市场中部分模型直接标注为「Unknown sources」。[18][31] NewAPI 和 OneAPI 这两个开源网关被大量中转站直接拿去二次开发,是这个市场实际的底层基础设施,OneAPI 的 GitHub 星标超过三万。[32] 平台是否自研网关,是真伪与合规的一道分水岭。
是否公开机房位置,以及有没有 ICP 备案或可查的企业主体。B.AI 的中继架构已被媒体证实——用户请求经 B.AI 转发到上游官方 API 的境外账号再返回,官方还提示入口不稳定需要多入口切换。[29] EasyRouter 的架构没有披露。
428 这个样本不是这八家
边界要写准。那 428 个样本来自淘宝、闲鱼和公开社区,不是本文覆盖的这八家。这一节的结论是「多跳是结构性风险」,不是「这八家里有九家在注入代码」。
八家里,硅基流动、Novita、DeepInfra、Groq、Together 是自建算力或直连上游的原生推理平台,不属于这类研究的审计对象。OpenRouter 是聚合器,路由到的是各家正规供应商的端点。B.AI 和 EasyRouter 属于中转转售模式,继承这个类别的结构性问题,但本文没有找到针对它们的个案实证。
是否私自替换模型:八家暂无实锤,OpenRouter 被学界当基准
跳数估完了,接下来是能不能验证。这一关的特点是可检测但不会自己暴露——不主动去测,永远不会知道。
CISPA 论文给出的方法有三类。[18]
指纹测试:用可复现的行为指纹比对官方端点和候选端点,这是 45.83% 那个失败率的直接测量手段。行为基准测试:在 MedQA、LegalBench、GPQA 这类标准化基准上跑对照,注意价格高的服务不代表准确率高。元信息分析:核查运营主体、ICP 备案、企业注册,以及是否基于 NewAPI、OneAPI 这类开源管理系统搭建,模型标注里出现「Unknown sources」是危险信号。
后续几篇论文把成本又降了一些。IRIS 只依赖返回文本,让端点生成随机数或字符串做指纹,可以同时检测「每次都替换」和「按比例稀释路由」两种模式。[34] IMMACULATE 用密码学审计少量请求,能检测模型替换、量化滥用和 token 超收。[21]
一个自己能跑的最小测试
不需要复现论文。固定一批标准化问题,同时打官方 API 和候选平台,比对两边的答案,同时记录 token 计数。
token 计数这一项容易被忽略。CISPA 表 11 显示,影子 API 的 token 数标准差与官方的差异可以达到 0.36 倍到 2.3 倍以上。[18] 答案看起来差不多而 token 分布明显偏移,本身就是一个信号。
这套测试我自己没有实跑,上面写的是论文给的方法加上我认为成本最低的那个版本。所以这一节的结论强度到此为止:它说明验证是可行的,没有说明某一家实测下来是什么结果。
这八家的直接证据
截至快照日,八家都没有已核实的模型替换指控。这句话要写准,不能滑成暗示。
五家直连推理平台没有替换证据,它们的风险在别处——亏本卖 token 的可持续性,以及对开源模型生态的依赖。OpenRouter 的情况更特殊一些:CISPA 论文选模型时用的是 OpenRouter 2025 年 11 月的 token 使用排行榜,也就是说学界把它当作可信参照而不是怀疑对象。[18]
B.AI 和 EasyRouter 属于中转转售模式,两者都没有被点名指控替换模型。36 氪那篇报道点的是「名人入场」这个现象,没有指控替换行为。[30] 它们继承的是整个类别的验证困难,而不是个案罪名。
计费与上下文:溢价和截断都不会自己暴露
模型是真的,也不代表账单是真的。
GateScope 对 10 个真实商业网关做了黑盒测量,检查模型降级、静默截断、计费不准确和延迟不稳定四类问题。[20] 其中一个匿名网关的计费偏差达到 62.8%——按公开牌价加上网关自己上报的 token 数计算,实际账单多出这么多,而上报的用量看不出任何异常。另一家偏差 7.6%。
静默截断是另一类。测试设计了 25 轮对话,部分网关到第 24 轮已经无法复述第 10 轮设定的信息,说明它在历史消息超过某个隐性阈值之后悄悄丢掉了早期内容。[20][30]
上下文缩水这件事比计费溢价更难察觉。模型仍然在回答,语气也正常,只是它忘了二十轮之前定下的设定。长对话和 Agent 场景里,这类退化会被误判成模型能力不行。
这类偏差有利可图,因为计费全靠网关自报
IMMACULATE 那篇把 token 超收单独列为黑盒 LLM API 的一类结构性经济动机偏差,并给出了基于可验证计算的审计框架。[21] 逻辑很直白:计费依据是网关自己上报的 token 数,而调用方没有独立的计数来源。
同一个结构下还有两类操作,行业报道提到过但本文没有找到点名的实证案例:趁模型迭代把后台悄悄切到更便宜的版本而价格不降,以及对免费和低价租户做排队、限流、降级。[30] GateScope 测到了跨平台延迟稳定性的显著差异,这类多租户策略普遍存在,但从外部不可观测。[20]
排在延迟之前,因为不专门测就发现不了
理由和上一关一样:需要专门设计测试才能发现。账单页面不会标红,返回值也是正常的一段文本,上下文丢了也没有报错。
延迟则相反。慢了第一天就知道,换掉的成本只是改一个 base URL。
延迟与区域:亚太没有平台覆盖,Groq 数据最实
到这里才轮到性能。原因是性能问题会自己暴露——接上去跑一天,快慢一目了然,换掉的成本也低。
| 平台 | 类型 | 可核实的机房 | 区域路由 | 官方延迟数据 |
|---|---|---|---|---|
| OpenRouter | 聚合路由网关 | 随供应商分散全球 | EU / US,仅企业版 | 不公布绝对值,提供延迟排序参数 |
| Groq | 第一方 LPU 推理 | GCP 美国 | 无 | 分模型 tokens/s 表 |
| Together | 开源模型推理云 | 北美,EU 仅企业 dedicated | 无 | 无 |
| 硅基流动 | 推理云 + 网关 | 北京主体,国内 ICP | 无公开 PoP | 自述延迟降 70%,无绝对值 |
| DeepInfra | 推理云 | 子处理方 AWS + GCP,美国 | 无 | 无 |
| Novita | 推理云 | 未公开 | 无 | 标称 200ms,无方法学 |
| B.AI | 加密原生中转 | 未公开 | 无 | 无 |
| EasyRouter | 中转 | 未公开 | 无 | 标称 12ms P99 首字,无方法学 |
数据为 2026-09-09 快照。[3][4][9][11][12][13][14][17]
就近路由基本是个伪命题
八家里唯一提供区域路由的是 OpenRouter,而且只有 EU 和 US 两个区域,只在 Business 和 Enterprise 版本开放,目的是数据驻留合规——它的实现是 fail-closed 强制区域内,宁可失败也不出区。[4] 默认路由也不按地理就近,而是按供应商分散。
其余七家要么单机房,要么不公开。Groq 官方确认数据在 GCP 美国,只有一个 API 入口。[14][15] Together 的 serverless 在北美,EU 只给企业 dedicated 或 VPC 方案,serverless 不提供区域选择。[17] B.AI、EasyRouter、DeepInfra、Novita 的机房位置没有公开信息。
「按地区就近接入」是我列调研提纲时单独拎出来的一项。八家查完,这一项的结论比其他几项都干脆:亚太用户目前没有对应选项。唯一的区域路由是为合规设计的,不是为加速设计的,而且不在亚太。
能用的延迟数字:Groq 的官方吞吐表
Groq 公布的分模型吞吐是全市场最可量化的一组:Llama 3.3 70B 是 280 tokens/s,GPT OSS 20B 是 1000,Qwen3.6-27B 是 500。[14] 有模型、有数值、可复测。
OpenRouter 不公布绝对值,但提供了 sort=latency 和 preferred_max_latency 两个参数,基于五分钟窗口的 p50 到 p99 分位数选路。[3] 它给的是一个筛选机制,让调用方按自己的延迟上限挑端点。
不能用的延迟数字:EasyRouter、Novita、硅基流动的宣传口径
EasyRouter 的「12ms P99 首字延迟」和「99.99% SLA」、Novita 的「200ms latency」、硅基流动的「延迟最高降 70%、吞吐 3 到 5 倍」,这三组都没有方法学,也没有绝对基线。[9][12][11] 「降 70%」这种表述缺了分母就无法验证,本文按未核实处理。
推理模型的延迟被思考时间主导
还有一类数字容易误用。Artificial Analysis 的模型级中位数是跨所有供应商聚合出来的,同时包含快的和慢的托管方,不能用于平台之间直接比较。[22]
举几个数:DeepSeek V4-Flash 约 125.7 tokens/s,首字约 0.92 秒;Llama 3.3 70B 约 87.4 tokens/s,首字约 1.64 秒;而 Claude Opus 4.7 的首字是 18.5 秒,GPT-5.5 是 52.4 秒。[22] 后两个数看着离谱,是因为它们是推理模型,首字延迟被思考时间主导,和非推理模型不在一个口径上。
同一份聚合数据里,Llama 3.3 70B 的 87.4 tokens/s 和 Groq 官方的 280 tokens/s 差了三倍多——前者是跨供应商中位数,后者是单一硬件实测。这两个数字不冲突,它们回答的不是同一个问题。
最后一条和网关路由是同一件事的另一面:多跳本身就是结构性的延迟风险。B.AI 的中继架构已经证实,官方还提示入口不稳定需要多入口切换。[29] 本文没有找到第三方的延迟量化数据,也没有找到可量化的用户投诉证据,社区检索受反爬限制,这里不臆造结论。
价格:最低价里有一半是补贴,不是成本优势
前五关筛完,剩下的候选才有比价的意义。
输入价,USD / 百万 token:
| 模型 | OpenRouter | B.AI | 硅基流动 | Novita | DeepInfra | Groq | Together |
|---|---|---|---|---|---|---|---|
| GPT-5.4 | 2.50 | 2.50 | — | — | — | — | — |
| GPT-5.6 Terra | 2.00 | 2.00 | — | — | — | — | — |
| Claude Opus 5 | 5.00 | 5.00 | — | — | — | — | — |
| Claude Sonnet 5 | 2.00 | 2.00 | — | — | — | — | — |
| Gemini 2.5 Pro | 1.25 | 改供 3.x | — | — | — | — | — |
| DeepSeek V4-Flash | 0.065 | 0.22 | 0.21 | 0.14 | 0.06 | — | 0.14 |
| DeepSeek V4-Pro | 0.58 | 0.66 | 1.67 | 1.32 | 1.30 | — | 1.32 |
| DeepSeek V3.2 | 0.269 | 0.29 | 0.56 | 0.269 | 0.26 | — | — |
| DeepSeek R1-0528 | 0.50 | — | — | 0.70 | 0.50 | — | — |
| Llama 3.3 70B | 0.10 | — | — | 0.135 | 0.10 | 0.59 | 1.04 |
| Qwen3 235B 级 | 0.09 | 2.00 | 0.17 | 0.60 | 0.09 | — | 0.20 |
| Qwen3 32B 级 | 0.08 | — | 0.08 | 0.30 | 0.08 | 0.29 | — |
| GLM-5.3 | 1.40 | 1.40 | 1.11 | 1.40 | — | — | 1.40 |
| GLM-5.3-Flash | 0.075 | 免费 | — | 0.15 | — | — | 0.15 |
| Kimi K3 | 3.00 | 3.00 | — | 3.00 | 2.85 | — | 3.00 |
| Kimi K2.6 | 0.95 | 0.95 | 0.90 | 0.80 | 0.75 | — | — |
| MiniMax M3 | — | 0.30 | 0.29 | 0.30 | — | 企业版 | 0.30 |
| 腾讯混元 Hy3 | 0.132 | 免费 | 仅 A13B | 0.14 | — | — | — |
输出价,同样单位:
| 模型 | OpenRouter | B.AI | 硅基流动 | Novita | DeepInfra | Groq | Together |
|---|---|---|---|---|---|---|---|
| GPT-5.4 | 15.00 | 15.00 | — | — | — | — | — |
| GPT-5.6 Terra | 12.00 | 12.00 | — | — | — | — | — |
| Claude Opus 5 | 25.00 | 25.00 | — | — | — | — | — |
| Claude Sonnet 5 | 10.00 | 10.00 | — | — | — | — | — |
| Gemini 2.5 Pro | 10.00 | — | — | — | — | — | — |
| DeepSeek V4-Flash | 0.18 | 0.66 | 0.63 | 0.28 | 0.18 | — | 0.28 |
| DeepSeek V4-Pro | 1.74 | 1.98 | 3.33 | 3.96 | 2.60 | — | 3.96 |
| DeepSeek V3.2 | 0.40 | 0.44 | 0.83 | 0.40 | 0.38 | — | — |
| DeepSeek R1-0528 | 2.15 | — | — | 2.50 | 2.15 | — | — |
| Llama 3.3 70B | 0.32 | — | — | 0.40 | 0.32 | 0.79 | 1.04 |
| Qwen3 235B 级 | 0.55 | 6.00 | 1.00 | 3.60 | 0.55 | — | 0.60 |
| Qwen3 32B 级 | 0.28 | — | 0.67 | 2.40 | 0.28 | 0.59 | — |
| GLM-5.3 | 4.40 | 4.40 | 3.89 | 4.40 | — | — | 4.40 |
| GLM-5.3-Flash | 0.25 | 免费 | — | 0.50 | — | — | 0.50 |
| Kimi K3 | 15.00 | 15.00 | — | 15.00 | 14.25 | — | 15.00 |
| Kimi K2.6 | 4.00 | 4.00 | 3.75 | 3.40 | 3.50 | — | — |
| MiniMax M3 | — | 1.20 | 1.17 | 1.20 | — | 企业版 | 1.20 |
| 腾讯混元 Hy3 | 0.528 | 免费 | — | 0.58 | — | — | — |
2026-09-09 快照,硅基流动按 7.2 汇率折算,EasyRouter 无公开价目表整列略去。[1] B.AI 那一列是标价,快照日另有促销:DeepSeek V4-Flash 五折、GLM-5.3 九折。硅基流动的 DeepSeek 取的是低谷价,高峰翻倍。
读这两张表要注意三点
三个容易踩的地方。
一格里的单价背后可能是多个版本号。DeepSeek V4-Flash 在 OpenRouter 上有 0423 和 0731 两个版本,输入价分别是 $0.0886 和 $0.065,表里取的是 0731;DeepInfra 的 $0.06 也是 0731。[1] 跨平台比价必须先对齐版本,否则比的是两个模型。
时段也要对齐。DeepSeek 官方分高峰和低谷,硅基流动跟着分时段计价,低谷半价,B.AI 则按 Idle 和 Busy 两档报价。两张表取的都是低谷或标准档,高峰时段要自己乘回去。
模型名相近不代表同一份权重。Qwen3 235B 那一行里,OpenRouter 和 DeepInfra 给的是 235B-A22B-2507,硅基流动和 Novita 给的是 Qwen3.5-397B,B.AI 给的是 Qwen3.8-Max。它们的价格不可直接相除。
计费结构比单价更重要
单价之外还有一层,很多时候它比单价影响更大:
OpenRouter 推理本身不加价,但充值有手续费——信用卡 5.5%,加密 5%,另有 BYOK 月超 $25k 收 5%。[5] DeepInfra 有服务档,Priority 是 1.5 倍,Flex 是 0.8 倍。硅基流动按时段计价。Groq 和 Novita 的 Batch 模式打五折。B.AI 是积分制加订阅,Pro 每月 $200,Max 每月 $2,000。[7]
把手续费和服务档算进去之后,标价最低的那家不一定是实付最低的那家。
补贴价撑不了多久:硅基流动亏本卖,B.AI 靠促销
表里最便宜的几格,有一部分不是成本优势,是补贴。
硅基流动 2025 年营收 5,533 万元,毛利率 -24%,净亏损 3.45 亿元,销售成本是营收的 124%,其中算力成本占 86.9%,而且主要靠租赁。[27] 它在 2026 年 6 月 30 日递交了港股上市申请。亏本卖 token 这件事,招股书里写着。
B.AI 的免费和折扣是限时促销,官方自报日均 token 吞吐 1.33 万亿。[7] 以这个量级做免费转售,上游账单是实打实的。
今天的价格不等于明年的价格。如果生产流量已经迁过去,改价或关停的迁移成本要提前算进来。
写到这一节我的判断比开头保守了一些:表里最亮眼的那几格,有一半是有人在替我付钱,而这件事有期限。
八家平台的定位与短板
过完六关,把八家各自的样子摆一遍。
先说这一节的证据强度:下面的融资、估值和用户规模数字来自第三方报道与平台自报,各家口径有差异,本文没有逐条拿到一手文本。它们可以用来判断量级,不适合拿去做精确比较。
OpenRouter 是全球最大的聚合器,400 多个模型,官方称 800 万用户、每月约 100 万亿 token,2026 年 8 月被 Stripe 以约 70 到 80 亿美元收购(各家口径有差异)。[28] 短板是延迟和隐私最终取决于上游供应商。
DeepInfra 专做开源模型推理,开源模型价格最低的一家,2026 年 5 月拿到 1.07 亿美元 B 轮,Nvidia 参投。短板是数据可能落在美国,隐私政策是模板化文本。
Together 是开源模型的 Neocloud,2026 年 7 月完成 8 亿美元 C 轮,估值 83 亿美元,Aramco Ventures 领投。八家里隐私配置最灵活。短板是 Llama 3.3 全市场最贵,速度也没有亮点。
硅基流动是中国最大的独立生态 token 供应商,注册用户 1,028 万,170 多个模型,境内合规,大陆可直连。[27] 短板是负毛利。
Groq 靠 LPU 做速度,官方吞吐数据是全市场最透明的。短板是模型少,2026 年被 Nvidia 大规模挖角核心团队后重组,8 月的一轮融资估值砍半。
Novita 是 GPU 云加模型 API,第三方估算 ARR 约 110 万美元,规模在八家里最小,也没检索到公开融资记录。价格尚可,透明度有限。
B.AI 是孙宇晨和 TRON 生态的加密原生聚合站,2026 年 4 月上线,官方自报 230 万以上用户。模型覆盖全,支持加密支付,促销力度大。短板是隐私条款最薄,并且处在 Anthropic 不支持地区销售限制的夹缝里。[23][24][29]
EasyRouter 是傅盛和猎豹移动的项目,官方称 50 多个模型、200 多个团队在用。[9] 目前口号大于实锤——域名归属、价目表、宣传中的折扣三项都无法证实,另有 NewAPI 代码抄袭与 AGPLv3 违规的指控,但一手文本已无法访问,本文按未核实处理。[31]
规模算的是迁移成本,不是道德分
把融资和毛利算进评估,不是道德评价,是迁移成本的估计。
烧钱补贴的平台可能在流量迁过去之后改价或关停。这件事的代价不是差价,是切换供应商的工程时间。同理,所有权变更会改变风险的形态。OpenRouter 被 Stripe 收购之后浮上来的争议是路由决策在新所有权下还中不中立,这和替换模型是两类不同的问题。[28]
行业背景可以解释这些钱从哪来。中国的日 token 调用量从 2024 年初的约 1000 亿涨到 2026 年 3 月的约 140 万亿,两年多增长超过一千倍。[33] 同一时期,网关这一层本身也在被收购和被攻击:Portkey 被 Palo Alto Networks 收购并整合进其 AI 安全产品线,而 LiteLLM 在 2026 年 3 月遭遇依赖包漏洞攻击,波及四万六千多个开发环境。[30]
一份排行榜和它的口径:综合分 OpenRouter 第一
口径先写在表前面。下面是五个维度各 1 到 10 分的加权结果,权重为价格 25%、模型覆盖与真实性 25%、延迟与路由 15%、隐私与合规 20%、生态与信任 15%。这是我基于快照数据的主观加权,不是第三方评级,换一组权重就会换一个排序。
| 名次 | 平台 | 价格 | 模型/真实性 | 延迟/路由 | 隐私/合规 | 生态/信任 | 综合 |
|---|---|---|---|---|---|---|---|
| 1 | OpenRouter | 8.5 | 10 | 7.0 | 8.5 | 9.5 | 8.8 |
| 2 | DeepInfra | 9.0 | 8.0 | 6.0 | 7.5 | 7.5 | 7.8 |
| 3 | Together | 6.5 | 8.5 | 6.0 | 9.0 | 8.5 | 7.7 |
| 4 | 硅基流动 | 7.5 | 8.5 | 6.5 | 7.5 | 7.5 | 7.6 |
| 5 | Groq | 5.0 | 7.0 | 9.5 | 8.0 | 6.5 | 7.0 |
| 6 | Novita | 7.0 | 7.5 | 5.5 | 7.0 | 5.5 | 6.7 |
| 7 | B.AI | 8.0 | 7.5 | 5.0 | 3.5 | 5.5 | 6.2 |
| 8 | EasyRouter | 6.0 | 5.5 | 5.0 | 2.0 | 4.0 | 4.6 |
排在后面的三家有一个共同点:关键信息不透明——机房位置、价目表、隐私政策、融资情况,缺的项各不相同但都缺。在一个黑盒类别里,信息透明度本身就该扣分。这是我打分时用的一条显式规则,不同意的话可以把它去掉重算。
打分和排除顺序不是一回事
这张表里价格占 25% 的最高权重,而全文的论点是价格该排最后。这两件事不矛盾,因为它们回答的是不同的问题。
加权排的是综合体验:在所有维度都合格的前提下,哪一家整体更划算。排除顺序排的是决策次序:先看哪一项、后看哪一项,才不会在不可逆的地方出错。一家平台可以在加权里得高分,同时在隐私政策那一关就该被某个具体场景排除掉——比如需要数据不出境时,OpenRouter 的 8.8 分帮不上忙。
落地到场景,以及四种要重新选的情况
先把六关的结论落到具体场景。
| 诉求 | 落点 | 理由 |
|---|---|---|
| 通用聚合、模型最全 | OpenRouter | 400+ 模型,价格透明,隐私政策的短板在上游而不在平台 |
| 开源模型极致低价 | DeepInfra | DeepSeek V4-Flash 约为官方价四分之一 |
| 速度优先 | Groq | 官方分模型吞吐数据最硬,但模型少、数据在美国 |
| 国内直连加合规 | 硅基流动 | 境内存储、否认训练、备案主体;需接受实名与内容审核 |
| 隐私最敏感 | Together | 唯一提供 ZDR 且默认不训练 |
| 加密支付、无国界访问 | B.AI,谨慎 | 唯一的加密原生聚合站,但隐私政策最弱,不适合承载敏感数据 |
| 其他 | EasyRouter 暂不评估 | 价目表、隐私政策、域名归属三项均未证实 |
这套顺序会在四种情况下失效。
价格是快照,三天就可能变,政策条款也会改。本文里每一个数字都带 2026-09-09 这个日期,过了这个窗口就要重查。
合规环境变化。上游对转售和不支持地区的限制如果收紧,中转链路会突然失效——Anthropic 的商业条款里已经写明未经批准不得转售,也不得支持第三方规避这项限制。[23][24] 这类失效不给缓冲期。
所有权变化。收购会改变一家平台的激励结构,技术指标可以一项没变,而需要重新判断的是它还有没有动机保持中立。
最后,这套顺序是给个人和小团队用的。企业采购有自己的 DPA、审计和供应商评估流程,隐私和网关这两项在那里会变成合同条款,而不是逐条读政策文本。
把八家的资料翻完,我最确定的一条反而最不像结论:这六项里,价格是唯一一个查错了还能当天改回来的。也正因为它最容易比,它最容易被排到第一个看。
这是我根据公开资料整理的快照笔记,数据截至 2026 年 9 月 9 日。价格、政策条款和平台状态变化很快,使用前请以各平台官网为准。文中涉及的合规判断是对公开法规文本的理解,不构成法律建议。标注为未核实的条目表示本文没有找到可核实的一手来源,不代表相关说法一定不成立。
参考资料
- DeepSeek 官方 API 定价
- OpenRouter Models API(全量价格 JSON)
- OpenRouter — Provider Routing
- OpenRouter — In-Region Routing
- OpenRouter — FAQ
- OpenRouter — Privacy Policy
- B.AI — Pricing and Usage
- B.AI — Privacy Policy
- EasyRouter(easyrouter.tech,域名归属未证实)
- ComputeUnion — EasyRouter 平台档案
- 硅基流动 — 用户指南
- Novita AI — Docs
- DeepInfra — Docs
- Groq — Models(含分模型 tokens/s)
- Groq — Your Data
- Together AI — Privacy and Security
- Together AI — Serverless Overview
- Real Money, Fake Models: Deceptive Model Claims in Shadow APIs(CISPA,arXiv:2603.01919)
- Your Agent Is Mine: Measuring Malicious Intermediary Attacks on the LLM Supply Chain(UC Irvine,arXiv:2604.08407)
- Behavioral Consistency and Transparency Analysis on LLM API Gateways(GateScope,arXiv:2604.21083)
- IMMACULATE(arXiv:2602.22700)
- Artificial Analysis — Models
- Anthropic — Commercial Terms of Service
- Anthropic — Updating restrictions of sales to unsupported regions
- 《生成式人工智能服务管理暂行办法》
- 《数据出境安全评估办法》
- KrASIA — 硅基流动招股书:用户激增、亏损扩大与租赁算力
- TechCrunch — OpenRouter more than doubles valuation to $1.3B in a year
- The Crypto Times — Justin Sun’s B.AI Draws Attention Amid Anthropic’s Crackdown
- 36 氪 / APPSO — 川普、孙宇晨都来当 AI 黄牛了,这门暴利生意的水有多深?
- NewAPI(QuantumNous/new-api,AGPLv3)
- One API(songquanpeng/one-api)
- IT 之家 — 信通院:中国日均 token 调用量达 140 万亿
- IRIS — 预算内黑盒模型身份审计(arXiv:2607.20860)