Kimi K3 API 接入测评:OpenAI SDK、流式输出与真实成本怎么算

最近我在维护的接口平台里接入了 Kimi K3。与其只看“1M 上下文”“旗舰模型”这些标签,我更关心三个实际问题:原来的 OpenAI SDK 要改多少代码、流式输出是否容易处理,以及一次长文档或代码任务到底要花多少钱。

先说明测评边界:本文核对的是截至 2026 年 7 月 29 日公开页面上的接口、参数和价格,并给出可复现的测速脚本。不同地区、网络和并发时段的首 token 延迟会变化,因此不编造一个看似精确、实际不可复现的速度数字。

一、模型和价格

平台中的模型 ID 是 kimi-k3,采用 OpenAI Chat Completions 兼容格式,支持 SSE 流式输出。页面标注 100 万 token 上下文,价格为:

项目 价格(每 100 万 token)
输入 $1.95
输出 $9.75
缓存创建 $1.95
缓存读取 $1.95

这组价格不能只看输出单价。比如一次请求包含 10 万输入 token、生成 2 万输出 token,估算费用是:

0.1 x $1.95 + 0.02 x $9.75 = $0.39

如果是 100 万 token 的长文档首次输入,再生成 1 万 token,费用约为 $2.0475。实际账单仍以服务端返回的 token 用量为准。

二、最小接入方式

先安装 SDK,并把密钥放在环境变量中,不要直接写进代码仓库。

pip install -U openai
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["MAIZI_API_KEY"],
    base_url="https://www.maizitech.xyz/v1",
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {"role": "user", "content": "用三点说明这段代码的潜在并发问题。"}
    ],
)

print(response.choices[0].message.content)
print(response.usage)

已有 OpenAI SDK 项目通常只要替换 base_url、API Key 和模型名。首次验证建议只传 modelmessagesstream 等基础字段,确认代理层支持后再逐步加入工具调用或结构化输出参数。

三、流式输出和首 token 测试

Kimi K3 是推理模型。下面的脚本同时兼容普通内容增量和可能出现的 reasoning_content,并记录本机到接口的首 token 时间。

import os
import time
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["MAIZI_API_KEY"],
    base_url="https://www.maizitech.xyz/v1",
)

started = time.perf_counter()
first_token_at = None

stream = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "设计一个带重试的任务队列,并解释取舍。"}],
    stream=True,
)

for chunk in stream:
    delta = chunk.choices[0].delta
    text = getattr(delta, "reasoning_content", None) or delta.content
    if text:
        if first_token_at is None:
            first_token_at = time.perf_counter()
            print(f"TTFT: {first_token_at - started:.2f}s")
        print(text, end="", flush=True)

print(f"\nTotal: {time.perf_counter() - started:.2f}s")

测速时至少连续运行 5 次,分别记录中位数和最慢一次。单次结果很容易被冷启动、网络抖动或长推理过程影响。

四、与两种公开渠道的价格对比

按同一模型、每 100 万 token 的公开标价比较:

渠道 普通输入 输出 缓存命中
MaiziAI $1.95 $9.75 $1.95
Kimi 官方开放平台 $2.85 $14.28 $0.28
OpenRouter $3 $15 $0.15

若只为便于比较,按 $1 = ¥7.2 固定换算,官方普通输入约 $2.78,输出约 $13.89。MaiziAI 的普通输入和输出大约低 30%,相对 OpenRouter 标价低 35%。但缓存场景结论相反:Kimi 官方缓存命中仅 ¥2/M,而 MaiziAI 的缓存读取是 $1.95/M。大量重复系统提示词、知识库前缀或代码仓库上下文时,官方渠道可能更省。

五、结论

这次接入的优点是迁移成本低,普通输入和输出价格也有竞争力;短板是缓存读取价格不占优势。我的选择标准很简单:一次性长任务或已有 OpenAI SDK 的应用,可以把它列入候选;重复前缀比例很高的 Agent,要先拿自己的 token 结构算账,再决定走哪条渠道。价格之外,还应观察错误率、首 token 延迟和高峰期稳定性,不能用一次成功调用代替完整评估。

数据来源:MaiziAI 对话接口文档Kimi K3 官方定价OpenRouter Kimi K3。价格会调整,正式使用前应再次核对。

更多推荐