让每一种模型算力,
都有清晰航路

把模型厂商、合作渠道和自托管接口汇入一个兼容 OpenAI 的入口,再通过独立密钥分发给不同用户。蜂葵LLM API 统一管理会员、额度、流量开关与结算,从差价或渠道返佣中获得收益。

统一协议
OpenAI Compatible
实时响应
JSON / SSE
会员与结算
鱼坞通卡 · 差价 / 返佣
LIVE ROUTE / 01

模型航路

3 个泊位待命

选择请求
31°14′ N
121°29′ E
INGRESS统一 API请求入口
ROUTER蜂葵策略调度
BERTH A通用对话READY
BERTH B深度推理READY
BERTH C多模态READY
  1. 验证凭证
  2. 检查额度
  3. 比较泊位
  4. 建立响应

一条请求的航次

  1. 接入使用统一模型名称提交请求
  2. 判断按健康度、负载与优先级择路
  3. 靠泊转译并送达匹配的模型上游
  4. 结算流式返回并核算用户应收与渠道成本

蜂葵LLM API 会员系统

鱼坞通卡决定谁能调用,
以及调用到什么程度

开通鱼坞通卡后,下游用户获得独立密钥、调用额度、流量开关和结算规则。基础版用于接入联调,专业版覆盖团队日常流量,企业版面向高并发与对公结算。

开通鱼坞通卡
STARTER

基础版

个人接入、联调与小流量试运行

  • 60 RPM
  • 10 万 Token
  • 标准调度
ENTERPRISE

企业版

高并发、专属渠道与对公结算

  • 2,000 RPM
  • 2,000 万 Token
  • 专属支持

公开模型目录

先看清模型与价格,
再决定怎么接入

每个逻辑模型都有公开单价。密钥签发后用同一名称调用,路由、故障回退和结算由蜂葵LLM API 完成。

fengkui-chat

蜂葵对话模型

对话 / 流式

输入
¥1.50 / 百万 Token
输出
¥6.00 / 百万 Token

兼容 OpenAI Chat Completions

上游可以改变,
你的调用方式不必改变

沿用熟悉的 Chat Completions 请求结构。模型映射、渠道密钥和故障切换都留在蜂葵LLM API 内部。

  1. 1为下游用户开通鱼坞通卡并生成调用密钥
  2. 2把 SDK 的 base URL 指向蜂葵LLM API
  3. 3使用逻辑模型名发起 JSON 或 SSE 请求
生成调用密钥
POST /v1/chat/completions
curl http://127.0.0.1:8787/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "fengkui-chat",
    "messages": [
      {"role": "user", "content": "你好"}
    ],
    "stream": true
  }'
SSE STREAM逻辑模型 → 最优泊位

调度依据与安全边界

知道每次请求去了哪里,
也知道何时该换一条路

RTE

可解释路由

过滤离线渠道,再按优先级和当前负载排序候选泊位。

健康度 · 优先级 · 在途量
FBK

响应前故障回退

上游限流、服务异常或网络失败时,在响应开始前安全切换渠道。

429 · 5xx · Network
OBS

用量可观测

追踪请求、尝试次数与 Token 用量,不保存提示词和模型正文。

调用元数据 · Token · 延迟
PASS

用户与鱼坞通卡

每位下游用户拥有独立密钥、会员等级、调用额度、流量开关和结算规则。

会员管理 · 用户停复机 · 差价 / 返佣

本地演示泊位已就绪

把一次模型调用,
交给蜂葵LLM API。

先接入上游模型接口,再为不同用户开通鱼坞通卡。蜂葵LLM API 负责分发、控制与结算每一条模型调用。

完成第一条请求