Kimi K3 API 接入测评:OpenAI SDK、流式输出与真实成本怎么算
Kimi K3 API 接入测评:OpenAI SDK、流式输出与真实成本怎么算
最近我在维护的接口平台里接入了 Kimi K3。与其只看“1M 上下文”“旗舰模型”这些标签,我更关心三个实际问题:原来的 OpenAI SDK 要改多少代码、流式输出是否容易处理,以及一次长文档或代码任务到底要花多少钱。
先说明测评边界:本文核对的是截至 2026 年 7 月 29 日公开页面上的接口、参数和价格,并给出可复现的测速脚本。不同地区、网络和并发时段的首 token 延迟会变化,因此不编造一个看似精确、实际不可复现的速度数字。
一、模型和价格
平台中的模型 ID 是 kimi-k3,采用 OpenAI Chat Completions 兼容格式,支持 SSE 流式输出。页面标注 100 万 token 上下文,价格为:
| 项目 | 价格(每 100 万 token) |
|---|---|
| 输入 | $1.95 |
| 输出 | $9.75 |
| 缓存创建 | $1.95 |
| 缓存读取 | $1.95 |
这组价格不能只看输出单价。比如一次请求包含 10 万输入 token、生成 2 万输出 token,估算费用是:
0.1 x $1.95 + 0.02 x $9.75 = $0.39
如果是 100 万 token 的长文档首次输入,再生成 1 万 token,费用约为 $2.0475。实际账单仍以服务端返回的 token 用量为准。
二、最小接入方式
先安装 SDK,并把密钥放在环境变量中,不要直接写进代码仓库。
pip install -U openai
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MAIZI_API_KEY"],
base_url="https://www.maizitech.xyz/v1",
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[
{"role": "user", "content": "用三点说明这段代码的潜在并发问题。"}
],
)
print(response.choices[0].message.content)
print(response.usage)
已有 OpenAI SDK 项目通常只要替换 base_url、API Key 和模型名。首次验证建议只传 model、messages、stream 等基础字段,确认代理层支持后再逐步加入工具调用或结构化输出参数。
三、流式输出和首 token 测试
Kimi K3 是推理模型。下面的脚本同时兼容普通内容增量和可能出现的 reasoning_content,并记录本机到接口的首 token 时间。
import os
import time
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MAIZI_API_KEY"],
base_url="https://www.maizitech.xyz/v1",
)
started = time.perf_counter()
first_token_at = None
stream = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "设计一个带重试的任务队列,并解释取舍。"}],
stream=True,
)
for chunk in stream:
delta = chunk.choices[0].delta
text = getattr(delta, "reasoning_content", None) or delta.content
if text:
if first_token_at is None:
first_token_at = time.perf_counter()
print(f"TTFT: {first_token_at - started:.2f}s")
print(text, end="", flush=True)
print(f"\nTotal: {time.perf_counter() - started:.2f}s")
测速时至少连续运行 5 次,分别记录中位数和最慢一次。单次结果很容易被冷启动、网络抖动或长推理过程影响。
四、与两种公开渠道的价格对比
按同一模型、每 100 万 token 的公开标价比较:
| 渠道 | 普通输入 | 输出 | 缓存命中 |
|---|---|---|---|
| MaiziAI | $1.95 | $9.75 | $1.95 |
| Kimi 官方开放平台 | $2.85 | $14.28 | $0.28 |
| OpenRouter | $3 | $15 | $0.15 |
若只为便于比较,按 $1 = ¥7.2 固定换算,官方普通输入约 $2.78,输出约 $13.89。MaiziAI 的普通输入和输出大约低 30%,相对 OpenRouter 标价低 35%。但缓存场景结论相反:Kimi 官方缓存命中仅 ¥2/M,而 MaiziAI 的缓存读取是 $1.95/M。大量重复系统提示词、知识库前缀或代码仓库上下文时,官方渠道可能更省。
五、结论
这次接入的优点是迁移成本低,普通输入和输出价格也有竞争力;短板是缓存读取价格不占优势。我的选择标准很简单:一次性长任务或已有 OpenAI SDK 的应用,可以把它列入候选;重复前缀比例很高的 Agent,要先拿自己的 token 结构算账,再决定走哪条渠道。价格之外,还应观察错误率、首 token 延迟和高峰期稳定性,不能用一次成功调用代替完整评估。
数据来源:MaiziAI 对话接口文档、Kimi K3 官方定价、OpenRouter Kimi K3。价格会调整,正式使用前应再次核对。
更多推荐
所有评论(0)