Ben 的博客
归档关于简历
    目录
    1. 十倍价差来自平台定位,不是模型
    2. 闭源旗舰没有套利空间
    3. 价差全在开源和国产模型这一侧
    4. 价格对模型真假没有预测力
    5. 三篇论文测的是三类不同的失效
    6. 排序依据:不可逆乘以不可观测
    7. 隐私政策:Together 最规范,B.AI 和 EasyRouter 几乎空白
    8. 政策最细的三家:Together、OpenRouter、硅基流动
    9. 政策最薄的两家:B.AI 和 EasyRouter
    10. 这张表是政策对读,不是审计结论
    11. 转卖风险是行业级主张
    12. 网关路由:自建算力跳数最少,中转站最不透明
    13. 跳数没有公开数字,只能靠代理指标估算
    14. 428 这个样本不是这八家
    15. 是否私自替换模型:八家暂无实锤,OpenRouter 被学界当基准
    16. 一个自己能跑的最小测试
    17. 这八家的直接证据
    18. 计费与上下文:溢价和截断都不会自己暴露
    19. 这类偏差有利可图,因为计费全靠网关自报
    20. 排在延迟之前,因为不专门测就发现不了
    21. 延迟与区域:亚太没有平台覆盖,Groq 数据最实
    22. 就近路由基本是个伪命题
    23. 能用的延迟数字:Groq 的官方吞吐表
    24. 不能用的延迟数字:EasyRouter、Novita、硅基流动的宣传口径
    25. 推理模型的延迟被思考时间主导
    26. 价格:最低价里有一半是补贴,不是成本优势
    27. 读这两张表要注意三点
    28. 计费结构比单价更重要
    29. 补贴价撑不了多久:硅基流动亏本卖,B.AI 靠促销
    30. 八家平台的定位与短板
    31. 规模算的是迁移成本,不是道德分
    32. 一份排行榜和它的口径:综合分 OpenRouter 第一
    33. 打分和排除顺序不是一回事
    34. 落地到场景,以及四种要重新选的情况
    35. 参考资料

    AI 模型供应商调研:质量、价格、隐私和延迟

    文章

    我调研了 8 家 API 大模型的聚合平台:OpenRouter、B.AI、EasyRouter、硅基流动、Novita、DeepInfra、Groq、Together。核对了它们的定价页、隐私政策、机房披露,以及 2026 年的三篇审计论文,想搞清楚同一个模型跨平台的价差里,哪些是真实的成本差异,哪些只是平台定位不同。

    排出来的顺序和大多数人的直觉相反:价格应该是最后一关。依据是 CISPA 那篇论文的回归分析——在他们审计的中转站样本里,价格比率对准确率下降没有预测力。[18] 多付的钱,买不到「至少模型是真的」这个保证。

    本文所有价格和政策条款都是 2026 年 9 月 9 日的快照。这个行业三天就能改一次价,使用前请以各平台官网为准。

    十倍价差来自平台定位,不是模型

    先把价差本身拆开。它是模型的差异,还是别的东西。

    模型最低最高倍数
    DeepSeek V4-FlashDeepInfra $0.06硅基流动高峰 $0.427x
    Llama 3.3 70BOpenRouter / DeepInfra $0.10Together $1.0410x
    Qwen3 32B 级OpenRouter / DeepInfra $0.08Groq $0.293.6x

    单位是 USD / 百万输入 token,2026-09-09 快照。[1] 这三行是我从十八行的完整表里挑出来的,倍数最悬殊的三个,完整的表放在价格那一节。

    闭源旗舰没有套利空间

    GPT-5.x、Claude、Gemini 这三条线,八家里只有 OpenRouter 和 B.AI 供应,而且两家同价——Claude Opus 5 都是 $5.00 / $25.00,GPT-5.4 都是 $2.50 / $15.00,走的是 pass-through 原价。[1] 剩下六家根本买不到。

    所以在闭源旗舰这一侧,「同一个模型的跨平台价差」这个问题只有一组样本,而这组样本的答案是零。

    价差全在开源和国产模型这一侧

    倍数全部出现在开源与国产模型上。这一侧的平台各自在做不同的生意,价格反映的是生意的形态:

    DeepInfra 和 OpenRouter 处在最低价那一端,前者是专做开源模型的推理云,后者靠聚合多个供应商后挑最便宜的端点。Groq 的 Llama 3.3 是别家的六倍,因为它卖的是 LPU 硬件带来的低延迟,速度是定价理由。Together 的 Llama 3.3 全市场最贵,它面对的是企业开源方案的客户,附带 dedicated 部署和合规配置。硅基流动按官方价折人民币,不加价也不补贴,另有低谷时段半价。B.AI 的主流型号按官方原价一比一,差价来自促销——快照日 GLM-5.3-Flash、腾讯混元 Hy3、小米 MiMo-V2.5 都是免费,DeepSeek V4-Flash 打五折。[1]

    价差几乎全部来自平台定位,不来自模型本身。同一份权重,在低价推理云上跑和在专用硬件上跑,成本结构差得很远。

    这一步只说明了价差的来源。它没有回答另一个问题:最便宜的那一端,卖的是不是同一个东西。

    价格对模型真假没有预测力

    2026 年有三篇论文对这个市场做了系统性审计,它们分别测了三类不同的失效。

    德国 CISPA 的《Real Money, Fake Models》做的是模型身份审计。研究者识别出 17 个被 187 篇正式论文引用过的「影子 API」,也就是声称能复现官方模型输出、以更低价格提供兼容端点的第三方服务。结果是 45.83% 的指纹测试没有通过模型身份验证——后台跑的不是它宣称的那个模型。性能偏差最高 47.21%。[18]

    一个具体的数字:Gemini-2.5-flash 在 MedQA 医学问答上,官方 API 准确率 83.82%,所有被测影子 API 平均约 37%。法律推理基准上的落差也类似,三个被测服务对同一模型的一致性分别是 53.06%、52.36% 和 54.64%。[18]

    这个偏差的下游影响论文也算了一笔账。那 187 篇引用了影子 API 的论文里,保守假设三成需要重跑,按每篇 50 到 500 美元的 API 成本加上研究者约 40 小时的时间估算,直接成本在 11.5 万到 14 万美元之间;而引用这些论文的下游研究有 5,966 篇,可能被无声地污染。[18] 一个跑在别人后台的、没人验证过的模型,代价会沿着引用链传下去。

    这篇论文里对本文最关键的一条在附录 G。研究者做了回归分析,检查价格比率能否预测准确率下降,结论是完全没有预测力。[18][30] 贵的中转站不比便宜的中转站更可能给到真模型。

    这条结论直接否掉了「按价格排序,然后在预算内挑最贵的」这个策略。价格不是质量的代理变量,在这个市场里它连弱相关都不是。

    顺带说一句证据强度。有一句流传较广的话,说中转站的暴利数量几乎等于它省下的合规成本。我在 CISPA 原文里没有检索到这个表述,论文里能找到的只有「这些卖家同时违反服务合同与监管要求」。[18] 那句话疑似中文媒体的转述,本文按未核实处理。

    三篇论文测的是三类不同的失效

    三篇覆盖的是三类不同的问题,混在一起引用会出错。

    论文机构测的是核心数字
    Real Money, Fake ModelsCISPA模型身份是否一致45.83% 指纹测试未通过 [18]
    Your Agent Is Mine加州大学尔湾分校中间人是否有恶意行为428 站中 9 站注入恶意代码 [19]
    GateScopeUMass Boston + ASU计费与上下文是否诚实单站计费溢价 62.8% [20]

    这组数字我原先记在 CISPA 名下,翻论文时才发现「428 个中转站」出自加州大学尔湾分校的另一篇,CISPA 对应的是 45.83% 那一组。两篇经常被中文报道并列引用,机构归属容易串。[19]

    排序依据:不可逆乘以不可观测

    六道关口按两个可以判断的性质排序:选错了能不能撤回,以及事后会不会知道自己选错了。重要性排不出来,这两项排得出来。

    关口选错了能撤回吗会知道自己选错了吗位次
    数据能不能出去不能,发出去就收不回不会,没有通知机制1
    链路上有几跳换供应商可以,已发出的请求不能不会,明文转发不留痕2
    模型是不是宣称的那个能换只有主动做指纹测试才知道3
    计费与上下文是否诚实能换,已付的钱要不回需要专门设计测试4
    延迟与区域能换会,第一天就知道5
    价格能换会,价目页上写着6

    越不可逆、越不可观测的越靠前。价格排在最后,因为它是六项里唯一一个完全透明、当天就能改回来的。先比价再看别的,这个直觉顺序恰好是倒过来的。

    下面六节按这个次序展开。

    隐私政策:Together 最规范,B.AI 和 EasyRouter 几乎空白

    请求发出去之后,谁可以留存它、用它训练、把它转给谁。这一关排第一,因为发出去的提示词收不回来,而且不会有任何人通知发生了什么。

    八家的隐私政策我是逐条读下来的。这一项上的差距比价格表那一项大得多——价格差的是倍数,政策差的是有没有。

    平台用数据训练提示词保留期数据位置最需要注意的一条
    Together需显式 opt-in,默认不训练提供 Zero Data Retention 选项跨境需同意ZDR 仅向前生效
    OpenRouter平台自身不训练文本输入输出无固定期限由所选供应商决定无法阻止上游供应商训练
    Groq客户数据由 DPA 规定同左,不在公开政策内国际传输经 SCC / DPF提示词条款需另查 DPA
    硅基流动明确否认推理后立即销毁中国境内需实名,输入输出过内容审核
    Novita声明不用于训练账户 7 年 / 通信 3 年 / 技术 2 年跨境受 SCC、DPF 保障分析类共享在 CCPA 下可能算「出售」
    DeepInfra未经同意不存储、不训练销户后 30 天移除可能在美国政策为通用模板化文本
    B.AI无训练条款未规定未披露政策承认会收集、记录、存储输入
    EasyRouter无政策无政策无政策没有隐私政策,也没有用户协议

    来源为各家公开隐私政策,2026-09-09 抓取。[6][8][9][11][12][13][15][16]

    政策最细的三家:Together、OpenRouter、硅基流动

    Together 是八家里唯一提供 Zero Data Retention 选项的,默认不训练,要训练得用户显式 opt-in。[16] 它的代价写在政策里:ZDR 只向前生效,开启之后平台自己也无法再访问、导出或删除此前的数据。

    OpenRouter 的结构值得单独说。平台自身不训练,GDPR、SCC、CCPA 条款齐全,还会对声明「不训练」的供应商打标。[6] 但它是聚合器,输入输出最终传给所选的上游供应商,而供应商可以保留并使用这些数据,包括用于训练。平台层的承诺和上游层的行为是两件事,中间这道缝 OpenRouter 自己在政策里写明了。

    硅基流动走的是另一条路:明确否认用于预训练和微调,推理完成后立即销毁且不可恢复,数据存在中国境内,框架是《个人信息保护法》而不是 GDPR。[11] 代价是需要实名认证,输入输出都要过内容安全审核管线。

    政策最薄的两家:B.AI 和 EasyRouter

    B.AI 的隐私政策里没有 GDPR 条款,没有保留期,没有训练条款,也没有披露数据位置。同时政策本身承认会「collect, log, and store」用户输入,并以匿名化形式用于优化其基础设施与 API 网络。[8] 条款少不等于风险低——在这里它意味着没有任何书面约束。

    EasyRouter 这一栏最后记下的东西比我预计的少。站内没有隐私政策,没有用户协议,数据收集、保留、训练、共享全部没有公开约束。[9] 顺带查到的另一件事是官方域名归属也无法确认:easyrouter.ai 不解析,唯一在线的 easyrouter.tech 注册于 2026-07-07,比宣称的上线时间晚了两个月,站内没有价目表,也找不到媒体转述过的「八五折、零平台费」表述。

    这张表是政策对读,不是审计结论

    必须写清楚的边界:上面整张表的依据是各家公开的政策文字,不是第三方审计。

    「政策未提及 SOC2」的意思是那份政策正文里没有出现相关主张,不等于该平台没有这项认证。DeepInfra 的政策自称符合 SOC2 与 ISO27001,但那份政策是通用模板化文本,措辞与 Novita 高度相似,认证本身本文没有独立核实。[13] Novita 的 SOC2 只出现在页脚徽标,没有进入政策正文。[12] OpenRouter 和 Together 的政策则完全没提。

    换句话说,这一关能筛掉的是「书面承诺明显不足」的候选,筛不出「书面承诺充分且确实做到了」的候选。

    转卖风险是行业级主张

    行业报道称部分中转站会采集并转卖提示词数据。[30] 这是行业层面的主张,不是针对具体某家的既证事实,本文也没有找到针对 B.AI 或 EasyRouter 的个案实证。

    但机制上的判断可以成立:中转平台位于用户与上游模型之间,请求明文经它转发,因此天然具备采集、留存、转售提示词的能力。政策约束缺位时,这项能力不受限制。B.AI 承认收集存储输入,EasyRouter 没有政策,两端都落在这个区间里。

    合规侧还有两条框架性事实。向境内用户提供境外未备案模型的服务,不满足《生成式人工智能服务管理暂行办法》的备案与安全评估要求。[25] 而把境内用户的个人信息传输到境外并留存,累计超过十万人时可能触发《数据出境安全评估办法》的申报义务。[26] 这两条约束的是平台,不是个人开发者,但它们决定了一条链路能不能长期存在。

    网关路由:自建算力跳数最少,中转站最不透明

    从发出请求到模型之间,经过了几个能读写明文的节点。这一关排在模型真实性之前,因为跳数决定了后面那几关能不能被验证——链路越长,任何一个节点被攻破都会沿链污染,终端拿到的响应是否被篡改,从外部看不出来。

    加州大学尔湾分校那篇论文的做法很直接:研究者从淘宝、闲鱼和 Shopify 店铺买了 28 个付费路由器,从公开社区收集了 400 个免费的,一共 428 个,然后挨个测。[19]

    结果是 9 个正在主动注入恶意代码,17 个触发了研究者预埋的 AWS 蜜罐凭证盗用,1 个直接抽走了研究者私钥钱包里的 ETH。

    其中 2 个部署了自适应规避:前 50 次请求正常返回,第 51 次才激活注入。[19] 这个细节说明一件事——跑几次冒烟测试看着没问题,不构成证据。

    研究者还做了一组污染实验。一个被故意泄露的 OpenAI key 产生了一亿 token 的 GPT-5.4 流量和七次以上 Codex 会话;一个弱配置的蜜罐产生了二十亿计费 token、99 组凭证、440 次 Codex 会话,其中 401 个会话已经运行在自主模式下。[19]

    跳数没有公开数字,只能靠代理指标估算

    平台不会公布这个数字,能查的是几个代理指标:

    是否自研网关。CISPA 论文里被审计的中转站有一家基于开源项目 NewAPI 搭建,它的模型市场中部分模型直接标注为「Unknown sources」。[18][31] NewAPI 和 OneAPI 这两个开源网关被大量中转站直接拿去二次开发,是这个市场实际的底层基础设施,OneAPI 的 GitHub 星标超过三万。[32] 平台是否自研网关,是真伪与合规的一道分水岭。

    是否公开机房位置,以及有没有 ICP 备案或可查的企业主体。B.AI 的中继架构已被媒体证实——用户请求经 B.AI 转发到上游官方 API 的境外账号再返回,官方还提示入口不稳定需要多入口切换。[29] EasyRouter 的架构没有披露。

    428 这个样本不是这八家

    边界要写准。那 428 个样本来自淘宝、闲鱼和公开社区,不是本文覆盖的这八家。这一节的结论是「多跳是结构性风险」,不是「这八家里有九家在注入代码」。

    八家里,硅基流动、Novita、DeepInfra、Groq、Together 是自建算力或直连上游的原生推理平台,不属于这类研究的审计对象。OpenRouter 是聚合器,路由到的是各家正规供应商的端点。B.AI 和 EasyRouter 属于中转转售模式,继承这个类别的结构性问题,但本文没有找到针对它们的个案实证。

    是否私自替换模型:八家暂无实锤,OpenRouter 被学界当基准

    跳数估完了,接下来是能不能验证。这一关的特点是可检测但不会自己暴露——不主动去测,永远不会知道。

    CISPA 论文给出的方法有三类。[18]

    指纹测试:用可复现的行为指纹比对官方端点和候选端点,这是 45.83% 那个失败率的直接测量手段。行为基准测试:在 MedQA、LegalBench、GPQA 这类标准化基准上跑对照,注意价格高的服务不代表准确率高。元信息分析:核查运营主体、ICP 备案、企业注册,以及是否基于 NewAPI、OneAPI 这类开源管理系统搭建,模型标注里出现「Unknown sources」是危险信号。

    后续几篇论文把成本又降了一些。IRIS 只依赖返回文本,让端点生成随机数或字符串做指纹,可以同时检测「每次都替换」和「按比例稀释路由」两种模式。[34] IMMACULATE 用密码学审计少量请求,能检测模型替换、量化滥用和 token 超收。[21]

    一个自己能跑的最小测试

    不需要复现论文。固定一批标准化问题,同时打官方 API 和候选平台,比对两边的答案,同时记录 token 计数。

    token 计数这一项容易被忽略。CISPA 表 11 显示,影子 API 的 token 数标准差与官方的差异可以达到 0.36 倍到 2.3 倍以上。[18] 答案看起来差不多而 token 分布明显偏移,本身就是一个信号。

    这套测试我自己没有实跑,上面写的是论文给的方法加上我认为成本最低的那个版本。所以这一节的结论强度到此为止:它说明验证是可行的,没有说明某一家实测下来是什么结果。

    这八家的直接证据

    截至快照日,八家都没有已核实的模型替换指控。这句话要写准,不能滑成暗示。

    五家直连推理平台没有替换证据,它们的风险在别处——亏本卖 token 的可持续性,以及对开源模型生态的依赖。OpenRouter 的情况更特殊一些:CISPA 论文选模型时用的是 OpenRouter 2025 年 11 月的 token 使用排行榜,也就是说学界把它当作可信参照而不是怀疑对象。[18]

    B.AI 和 EasyRouter 属于中转转售模式,两者都没有被点名指控替换模型。36 氪那篇报道点的是「名人入场」这个现象,没有指控替换行为。[30] 它们继承的是整个类别的验证困难,而不是个案罪名。

    计费与上下文:溢价和截断都不会自己暴露

    模型是真的,也不代表账单是真的。

    GateScope 对 10 个真实商业网关做了黑盒测量,检查模型降级、静默截断、计费不准确和延迟不稳定四类问题。[20] 其中一个匿名网关的计费偏差达到 62.8%——按公开牌价加上网关自己上报的 token 数计算,实际账单多出这么多,而上报的用量看不出任何异常。另一家偏差 7.6%。

    静默截断是另一类。测试设计了 25 轮对话,部分网关到第 24 轮已经无法复述第 10 轮设定的信息,说明它在历史消息超过某个隐性阈值之后悄悄丢掉了早期内容。[20][30]

    上下文缩水这件事比计费溢价更难察觉。模型仍然在回答,语气也正常,只是它忘了二十轮之前定下的设定。长对话和 Agent 场景里,这类退化会被误判成模型能力不行。

    这类偏差有利可图,因为计费全靠网关自报

    IMMACULATE 那篇把 token 超收单独列为黑盒 LLM API 的一类结构性经济动机偏差,并给出了基于可验证计算的审计框架。[21] 逻辑很直白:计费依据是网关自己上报的 token 数,而调用方没有独立的计数来源。

    同一个结构下还有两类操作,行业报道提到过但本文没有找到点名的实证案例:趁模型迭代把后台悄悄切到更便宜的版本而价格不降,以及对免费和低价租户做排队、限流、降级。[30] GateScope 测到了跨平台延迟稳定性的显著差异,这类多租户策略普遍存在,但从外部不可观测。[20]

    排在延迟之前,因为不专门测就发现不了

    理由和上一关一样:需要专门设计测试才能发现。账单页面不会标红,返回值也是正常的一段文本,上下文丢了也没有报错。

    延迟则相反。慢了第一天就知道,换掉的成本只是改一个 base URL。

    延迟与区域:亚太没有平台覆盖,Groq 数据最实

    到这里才轮到性能。原因是性能问题会自己暴露——接上去跑一天,快慢一目了然,换掉的成本也低。

    平台类型可核实的机房区域路由官方延迟数据
    OpenRouter聚合路由网关随供应商分散全球EU / US,仅企业版不公布绝对值,提供延迟排序参数
    Groq第一方 LPU 推理GCP 美国分模型 tokens/s 表
    Together开源模型推理云北美,EU 仅企业 dedicated
    硅基流动推理云 + 网关北京主体,国内 ICP无公开 PoP自述延迟降 70%,无绝对值
    DeepInfra推理云子处理方 AWS + GCP,美国
    Novita推理云未公开标称 200ms,无方法学
    B.AI加密原生中转未公开
    EasyRouter中转未公开标称 12ms P99 首字,无方法学

    数据为 2026-09-09 快照。[3][4][9][11][12][13][14][17]

    就近路由基本是个伪命题

    八家里唯一提供区域路由的是 OpenRouter,而且只有 EU 和 US 两个区域,只在 Business 和 Enterprise 版本开放,目的是数据驻留合规——它的实现是 fail-closed 强制区域内,宁可失败也不出区。[4] 默认路由也不按地理就近,而是按供应商分散。

    其余七家要么单机房,要么不公开。Groq 官方确认数据在 GCP 美国,只有一个 API 入口。[14][15] Together 的 serverless 在北美,EU 只给企业 dedicated 或 VPC 方案,serverless 不提供区域选择。[17] B.AI、EasyRouter、DeepInfra、Novita 的机房位置没有公开信息。

    「按地区就近接入」是我列调研提纲时单独拎出来的一项。八家查完,这一项的结论比其他几项都干脆:亚太用户目前没有对应选项。唯一的区域路由是为合规设计的,不是为加速设计的,而且不在亚太。

    能用的延迟数字:Groq 的官方吞吐表

    Groq 公布的分模型吞吐是全市场最可量化的一组:Llama 3.3 70B 是 280 tokens/s,GPT OSS 20B 是 1000,Qwen3.6-27B 是 500。[14] 有模型、有数值、可复测。

    OpenRouter 不公布绝对值,但提供了 sort=latencypreferred_max_latency 两个参数,基于五分钟窗口的 p50 到 p99 分位数选路。[3] 它给的是一个筛选机制,让调用方按自己的延迟上限挑端点。

    不能用的延迟数字:EasyRouter、Novita、硅基流动的宣传口径

    EasyRouter 的「12ms P99 首字延迟」和「99.99% SLA」、Novita 的「200ms latency」、硅基流动的「延迟最高降 70%、吞吐 3 到 5 倍」,这三组都没有方法学,也没有绝对基线。[9][12][11] 「降 70%」这种表述缺了分母就无法验证,本文按未核实处理。

    推理模型的延迟被思考时间主导

    还有一类数字容易误用。Artificial Analysis 的模型级中位数是跨所有供应商聚合出来的,同时包含快的和慢的托管方,不能用于平台之间直接比较。[22]

    举几个数:DeepSeek V4-Flash 约 125.7 tokens/s,首字约 0.92 秒;Llama 3.3 70B 约 87.4 tokens/s,首字约 1.64 秒;而 Claude Opus 4.7 的首字是 18.5 秒,GPT-5.5 是 52.4 秒。[22] 后两个数看着离谱,是因为它们是推理模型,首字延迟被思考时间主导,和非推理模型不在一个口径上。

    同一份聚合数据里,Llama 3.3 70B 的 87.4 tokens/s 和 Groq 官方的 280 tokens/s 差了三倍多——前者是跨供应商中位数,后者是单一硬件实测。这两个数字不冲突,它们回答的不是同一个问题。

    最后一条和网关路由是同一件事的另一面:多跳本身就是结构性的延迟风险。B.AI 的中继架构已经证实,官方还提示入口不稳定需要多入口切换。[29] 本文没有找到第三方的延迟量化数据,也没有找到可量化的用户投诉证据,社区检索受反爬限制,这里不臆造结论。

    价格:最低价里有一半是补贴,不是成本优势

    前五关筛完,剩下的候选才有比价的意义。

    输入价,USD / 百万 token:

    模型OpenRouterB.AI硅基流动NovitaDeepInfraGroqTogether
    GPT-5.42.502.50
    GPT-5.6 Terra2.002.00
    Claude Opus 55.005.00
    Claude Sonnet 52.002.00
    Gemini 2.5 Pro1.25改供 3.x
    DeepSeek V4-Flash0.0650.220.210.140.060.14
    DeepSeek V4-Pro0.580.661.671.321.301.32
    DeepSeek V3.20.2690.290.560.2690.26
    DeepSeek R1-05280.500.700.50
    Llama 3.3 70B0.100.1350.100.591.04
    Qwen3 235B 级0.092.000.170.600.090.20
    Qwen3 32B 级0.080.080.300.080.29
    GLM-5.31.401.401.111.401.40
    GLM-5.3-Flash0.075免费0.150.15
    Kimi K33.003.003.002.853.00
    Kimi K2.60.950.950.900.800.75
    MiniMax M30.300.290.30企业版0.30
    腾讯混元 Hy30.132免费仅 A13B0.14

    输出价,同样单位:

    模型OpenRouterB.AI硅基流动NovitaDeepInfraGroqTogether
    GPT-5.415.0015.00
    GPT-5.6 Terra12.0012.00
    Claude Opus 525.0025.00
    Claude Sonnet 510.0010.00
    Gemini 2.5 Pro10.00
    DeepSeek V4-Flash0.180.660.630.280.180.28
    DeepSeek V4-Pro1.741.983.333.962.603.96
    DeepSeek V3.20.400.440.830.400.38
    DeepSeek R1-05282.152.502.15
    Llama 3.3 70B0.320.400.320.791.04
    Qwen3 235B 级0.556.001.003.600.550.60
    Qwen3 32B 级0.280.672.400.280.59
    GLM-5.34.404.403.894.404.40
    GLM-5.3-Flash0.25免费0.500.50
    Kimi K315.0015.0015.0014.2515.00
    Kimi K2.64.004.003.753.403.50
    MiniMax M31.201.171.20企业版1.20
    腾讯混元 Hy30.528免费0.58

    2026-09-09 快照,硅基流动按 7.2 汇率折算,EasyRouter 无公开价目表整列略去。[1] B.AI 那一列是标价,快照日另有促销:DeepSeek V4-Flash 五折、GLM-5.3 九折。硅基流动的 DeepSeek 取的是低谷价,高峰翻倍。

    读这两张表要注意三点

    三个容易踩的地方。

    一格里的单价背后可能是多个版本号。DeepSeek V4-Flash 在 OpenRouter 上有 0423 和 0731 两个版本,输入价分别是 $0.0886 和 $0.065,表里取的是 0731;DeepInfra 的 $0.06 也是 0731。[1] 跨平台比价必须先对齐版本,否则比的是两个模型。

    时段也要对齐。DeepSeek 官方分高峰和低谷,硅基流动跟着分时段计价,低谷半价,B.AI 则按 Idle 和 Busy 两档报价。两张表取的都是低谷或标准档,高峰时段要自己乘回去。

    模型名相近不代表同一份权重。Qwen3 235B 那一行里,OpenRouter 和 DeepInfra 给的是 235B-A22B-2507,硅基流动和 Novita 给的是 Qwen3.5-397B,B.AI 给的是 Qwen3.8-Max。它们的价格不可直接相除。

    计费结构比单价更重要

    单价之外还有一层,很多时候它比单价影响更大:

    OpenRouter 推理本身不加价,但充值有手续费——信用卡 5.5%,加密 5%,另有 BYOK 月超 $25k 收 5%。[5] DeepInfra 有服务档,Priority 是 1.5 倍,Flex 是 0.8 倍。硅基流动按时段计价。Groq 和 Novita 的 Batch 模式打五折。B.AI 是积分制加订阅,Pro 每月 $200,Max 每月 $2,000。[7]

    把手续费和服务档算进去之后,标价最低的那家不一定是实付最低的那家。

    补贴价撑不了多久:硅基流动亏本卖,B.AI 靠促销

    表里最便宜的几格,有一部分不是成本优势,是补贴。

    硅基流动 2025 年营收 5,533 万元,毛利率 -24%,净亏损 3.45 亿元,销售成本是营收的 124%,其中算力成本占 86.9%,而且主要靠租赁。[27] 它在 2026 年 6 月 30 日递交了港股上市申请。亏本卖 token 这件事,招股书里写着。

    B.AI 的免费和折扣是限时促销,官方自报日均 token 吞吐 1.33 万亿。[7] 以这个量级做免费转售,上游账单是实打实的。

    今天的价格不等于明年的价格。如果生产流量已经迁过去,改价或关停的迁移成本要提前算进来。

    写到这一节我的判断比开头保守了一些:表里最亮眼的那几格,有一半是有人在替我付钱,而这件事有期限。

    八家平台的定位与短板

    过完六关,把八家各自的样子摆一遍。

    先说这一节的证据强度:下面的融资、估值和用户规模数字来自第三方报道与平台自报,各家口径有差异,本文没有逐条拿到一手文本。它们可以用来判断量级,不适合拿去做精确比较。

    OpenRouter 是全球最大的聚合器,400 多个模型,官方称 800 万用户、每月约 100 万亿 token,2026 年 8 月被 Stripe 以约 70 到 80 亿美元收购(各家口径有差异)。[28] 短板是延迟和隐私最终取决于上游供应商。

    DeepInfra 专做开源模型推理,开源模型价格最低的一家,2026 年 5 月拿到 1.07 亿美元 B 轮,Nvidia 参投。短板是数据可能落在美国,隐私政策是模板化文本。

    Together 是开源模型的 Neocloud,2026 年 7 月完成 8 亿美元 C 轮,估值 83 亿美元,Aramco Ventures 领投。八家里隐私配置最灵活。短板是 Llama 3.3 全市场最贵,速度也没有亮点。

    硅基流动是中国最大的独立生态 token 供应商,注册用户 1,028 万,170 多个模型,境内合规,大陆可直连。[27] 短板是负毛利。

    Groq 靠 LPU 做速度,官方吞吐数据是全市场最透明的。短板是模型少,2026 年被 Nvidia 大规模挖角核心团队后重组,8 月的一轮融资估值砍半。

    Novita 是 GPU 云加模型 API,第三方估算 ARR 约 110 万美元,规模在八家里最小,也没检索到公开融资记录。价格尚可,透明度有限。

    B.AI 是孙宇晨和 TRON 生态的加密原生聚合站,2026 年 4 月上线,官方自报 230 万以上用户。模型覆盖全,支持加密支付,促销力度大。短板是隐私条款最薄,并且处在 Anthropic 不支持地区销售限制的夹缝里。[23][24][29]

    EasyRouter 是傅盛和猎豹移动的项目,官方称 50 多个模型、200 多个团队在用。[9] 目前口号大于实锤——域名归属、价目表、宣传中的折扣三项都无法证实,另有 NewAPI 代码抄袭与 AGPLv3 违规的指控,但一手文本已无法访问,本文按未核实处理。[31]

    规模算的是迁移成本,不是道德分

    把融资和毛利算进评估,不是道德评价,是迁移成本的估计。

    烧钱补贴的平台可能在流量迁过去之后改价或关停。这件事的代价不是差价,是切换供应商的工程时间。同理,所有权变更会改变风险的形态。OpenRouter 被 Stripe 收购之后浮上来的争议是路由决策在新所有权下还中不中立,这和替换模型是两类不同的问题。[28]

    行业背景可以解释这些钱从哪来。中国的日 token 调用量从 2024 年初的约 1000 亿涨到 2026 年 3 月的约 140 万亿,两年多增长超过一千倍。[33] 同一时期,网关这一层本身也在被收购和被攻击:Portkey 被 Palo Alto Networks 收购并整合进其 AI 安全产品线,而 LiteLLM 在 2026 年 3 月遭遇依赖包漏洞攻击,波及四万六千多个开发环境。[30]

    一份排行榜和它的口径:综合分 OpenRouter 第一

    口径先写在表前面。下面是五个维度各 1 到 10 分的加权结果,权重为价格 25%、模型覆盖与真实性 25%、延迟与路由 15%、隐私与合规 20%、生态与信任 15%。这是我基于快照数据的主观加权,不是第三方评级,换一组权重就会换一个排序。

    名次平台价格模型/真实性延迟/路由隐私/合规生态/信任综合
    1OpenRouter8.5107.08.59.58.8
    2DeepInfra9.08.06.07.57.57.8
    3Together6.58.56.09.08.57.7
    4硅基流动7.58.56.57.57.57.6
    5Groq5.07.09.58.06.57.0
    6Novita7.07.55.57.05.56.7
    7B.AI8.07.55.03.55.56.2
    8EasyRouter6.05.55.02.04.04.6

    排在后面的三家有一个共同点:关键信息不透明——机房位置、价目表、隐私政策、融资情况,缺的项各不相同但都缺。在一个黑盒类别里,信息透明度本身就该扣分。这是我打分时用的一条显式规则,不同意的话可以把它去掉重算。

    打分和排除顺序不是一回事

    这张表里价格占 25% 的最高权重,而全文的论点是价格该排最后。这两件事不矛盾,因为它们回答的是不同的问题。

    加权排的是综合体验:在所有维度都合格的前提下,哪一家整体更划算。排除顺序排的是决策次序:先看哪一项、后看哪一项,才不会在不可逆的地方出错。一家平台可以在加权里得高分,同时在隐私政策那一关就该被某个具体场景排除掉——比如需要数据不出境时,OpenRouter 的 8.8 分帮不上忙。

    落地到场景,以及四种要重新选的情况

    先把六关的结论落到具体场景。

    诉求落点理由
    通用聚合、模型最全OpenRouter400+ 模型,价格透明,隐私政策的短板在上游而不在平台
    开源模型极致低价DeepInfraDeepSeek V4-Flash 约为官方价四分之一
    速度优先Groq官方分模型吞吐数据最硬,但模型少、数据在美国
    国内直连加合规硅基流动境内存储、否认训练、备案主体;需接受实名与内容审核
    隐私最敏感Together唯一提供 ZDR 且默认不训练
    加密支付、无国界访问B.AI,谨慎唯一的加密原生聚合站,但隐私政策最弱,不适合承载敏感数据
    其他EasyRouter 暂不评估价目表、隐私政策、域名归属三项均未证实

    这套顺序会在四种情况下失效。

    价格是快照,三天就可能变,政策条款也会改。本文里每一个数字都带 2026-09-09 这个日期,过了这个窗口就要重查。

    合规环境变化。上游对转售和不支持地区的限制如果收紧,中转链路会突然失效——Anthropic 的商业条款里已经写明未经批准不得转售,也不得支持第三方规避这项限制。[23][24] 这类失效不给缓冲期。

    所有权变化。收购会改变一家平台的激励结构,技术指标可以一项没变,而需要重新判断的是它还有没有动机保持中立。

    最后,这套顺序是给个人和小团队用的。企业采购有自己的 DPA、审计和供应商评估流程,隐私和网关这两项在那里会变成合同条款,而不是逐条读政策文本。

    把八家的资料翻完,我最确定的一条反而最不像结论:这六项里,价格是唯一一个查错了还能当天改回来的。也正因为它最容易比,它最容易被排到第一个看。


    这是我根据公开资料整理的快照笔记,数据截至 2026 年 9 月 9 日。价格、政策条款和平台状态变化很快,使用前请以各平台官网为准。文中涉及的合规判断是对公开法规文本的理解,不构成法律建议。标注为未核实的条目表示本文没有找到可核实的一手来源,不代表相关说法一定不成立。

    参考资料

    1. DeepSeek 官方 API 定价
    2. OpenRouter Models API(全量价格 JSON)
    3. OpenRouter — Provider Routing
    4. OpenRouter — In-Region Routing
    5. OpenRouter — FAQ
    6. OpenRouter — Privacy Policy
    7. B.AI — Pricing and Usage
    8. B.AI — Privacy Policy
    9. EasyRouter(easyrouter.tech,域名归属未证实)
    10. ComputeUnion — EasyRouter 平台档案
    11. 硅基流动 — 用户指南
    12. Novita AI — Docs
    13. DeepInfra — Docs
    14. Groq — Models(含分模型 tokens/s)
    15. Groq — Your Data
    16. Together AI — Privacy and Security
    17. Together AI — Serverless Overview
    18. Real Money, Fake Models: Deceptive Model Claims in Shadow APIs(CISPA,arXiv:2603.01919)
    19. Your Agent Is Mine: Measuring Malicious Intermediary Attacks on the LLM Supply Chain(UC Irvine,arXiv:2604.08407)
    20. Behavioral Consistency and Transparency Analysis on LLM API Gateways(GateScope,arXiv:2604.21083)
    21. IMMACULATE(arXiv:2602.22700)
    22. Artificial Analysis — Models
    23. Anthropic — Commercial Terms of Service
    24. Anthropic — Updating restrictions of sales to unsupported regions
    25. 《生成式人工智能服务管理暂行办法》
    26. 《数据出境安全评估办法》
    27. KrASIA — 硅基流动招股书:用户激增、亏损扩大与租赁算力
    28. TechCrunch — OpenRouter more than doubles valuation to $1.3B in a year
    29. The Crypto Times — Justin Sun’s B.AI Draws Attention Amid Anthropic’s Crackdown
    30. 36 氪 / APPSO — 川普、孙宇晨都来当 AI 黄牛了,这门暴利生意的水有多深?
    31. NewAPI(QuantumNous/new-api,AGPLv3)
    32. One API(songquanpeng/one-api)
    33. IT 之家 — 信通院:中国日均 token 调用量达 140 万亿
    34. IRIS — 预算内黑盒模型身份审计(arXiv:2607.20860)
    标签aillm-apiengineering