PLENUM — 充实,充盈

充盈的推理算力,
随取随用。

300+ 开源顶尖模型,装进一个 OpenAI 兼容的 API:改一行完成迁移,成本减半,延迟以毫秒计。全球弹性 GPU 池随你的负载伸缩。

免费获取 API Key浏览模型库
42 msP50 首字延迟
300+在线开源模型
99.95%API 可用性 SLA
-52%对比主流闭源 API 成本
迁移只改一行 ↓
from openai import OpenAI

client = OpenAI(
    base_url="https://api.plenumcloud.com/v1",
    api_key="pln-...",
)

resp = client.chat.completions.create(
    model="deepseek-v3.2",
    messages=[{"role": "user",
               "content": "你好,Plenum"}],
)
200 OK · 41.8 ms · us-west / tokyo / frankfurt 自动路由
模型

开源顶尖模型,上线即可调用

全部 300+ 模型 →
DeepSeek-V3.2NEW

通用对话与代码,MoE 685B,128K 上下文

¥1.9 输入/1M¥7.0 输出/1M
Qwen3-235B-A22BREASONING

深度推理与 Agent 工作流,思维链可控

¥1.5 输入/1M¥6.1 输出/1M
Llama 4 MaverickMULTIMODAL

图文多模态,1M 上下文,长文档理解

¥1.3 输入/1M¥4.3 输出/1M
Kimi K2AGENTIC

工具调用与自主任务执行,1T 参数 MoE

¥4.0 输入/1M¥15.8 输出/1M
GLM-4.6CODING

代码生成与中文场景优化,200K 上下文

¥2.5 输入/1M¥10.1 输出/1M
FLUX.1 [dev]IMAGE

文生图,摄影级质感与准确排版文字

¥0.06 / 张
平台

为什么是 Plenum

plenum /ˈpliːnəm/,充盈。算力池永远有你的位置——这是产品承诺,也是命名由来。

弹性 GPU 池,全球调度

跨区域的 H100 / B200 算力池按需聚合,请求自动路由到最近、最空闲的集群。峰值流量不排队,闲时不为空转付费。

Elastic pool · Auto routing

兼容 OpenAI,改一行即迁

完全兼容 OpenAI SDK 与协议:改一个 base_url 即完成迁移。流式输出、函数调用、结构化 JSON、批量接口全部对齐。

OpenAI-compatible · Zero rewrite

合规与私有部署

SOC 2 Type II,零日志推理选项,数据不出境的区域锁定。企业可选 VPC 专属集群或全私有化部署。

SOC 2 · Zero retention · VPC
同模型每百万 token 成本对比 Llama 4 Maverick · 输出2026-08 公开牌价
Plenum Cloud
¥4.3
推理云 A
¥6.1
推理云 B
¥7.9
主流闭源 API
¥18.0
算力接入

闲置的算力,变成流水

GPU 云、智算中心、有闲置集群的企业,都可以把算力挂到平台上对外出租。平台按实测表现分配推理流量——跑得稳,流量就多;每一笔调用按 token 独立计量、可逐条对账,按月结算。

接入算力 →
01
挂牌接入提供 OpenAI 兼容端点与机时报价
02
探测评分平台持续实测首字延迟与稳定性,按分调度
03
接流量结算按实测分配流量,token 级对账,按月结算
定价

按 token 计费,没有底价与合约

Serverless
¥0起 · 按用量

共享算力池,按 token 结算。注册即送 ¥50 额度,无需绑卡。

立即开始
Dedicated最受欢迎
¥13.5/ GPU·小时 起

专属实例,吞吐与延迟可保障。分钟级扩缩容,按秒计费。

配置实例
Enterprise
定制

VPC / 私有化部署,区域数据锁定,专属 SLA 与解决方案团队。

联系销售

五分钟,把推理迁到 Plenum

注册即送 ¥50 额度 · 无需绑卡 · base_url = api.plenumcloud.com/v1

免费获取 API Key阅读文档