Kimi K3 实测:2.8万亿参数开源模型,没 8 张 H100 也能跑(附免费 API)
上个月月之暗面把 K3(Kimi K2)的完整权重放出来了。2.8 万亿参数 MoE,前端编程榜一度冲到全球第一,还带 1M 上下文和原生视觉。朋友圈一片"终于能自己跑了",但我得泼盆冷水:大部分人其实是跑不起的。
我自己的机器肯定不行。官方给的最低自部署配置是 8 张 H100,想要像样吞吐得上 NVL72 超节点。光显存这一条,个人开发者基本劝退——这不是买张消费级显卡能解决的事。
所以我把 K3 接到了一个托管网关上:一个 OpenAI 兼容的 endpoint,换 model 名就能调,全程不用碰 GPU、不用调 vLLM。下面是我实际跑通的步骤,代码都能直接抄。
先说清楚:K3 不在免费档,但有"永久免费"的平替
很多人一上来就想直接调 K3,结果卡在计费上。其实网关给了一套永远免费的模型,用来验证接入链路完全够:
glm-4-flash(128K 上下文)
glm-4.7-flash(200K 上下文,写代码够用)
Qwen/Qwen2.5-7B-Instruct
免费档权益:100 次调用、5 次/分钟、0 元。领 key 只要邮箱,不用信用卡。
领 key 入口:搜"盈算智服"进官网 API 页(yingsuan.top/api),填邮箱秒发。文末也放了带参数的直达链接,如果被折叠,去评论区置顶取。
第一步:用免费模型把链路跑通
先别急着上 K3,用 glm-4-flash 确认你的 key 和调用姿势是对的。
curl 版:
curl https://yingsuan.top/v1/chat/completions
-H “Authorization: Bearer YOUR_API_KEY”
-H “Content-Type: application/json”
-d ‘{
“model”: “glm-4-flash”,
“messages”: [{“role”: “user”, “content”: “用大白话讲讲 JavaScript Promise”}],
“max_tokens”: 300
}’
Python 版(我更常用这个):
from openai import OpenAI
client = OpenAI(api_key=“YOUR_API_KEY”, base_url=“https://yingsuan.top/v1”)
resp = client.chat.completions.create(
model=“glm-4-flash”,
messages=[{“role”: “user”, “content”: “写一个 TypeScript 防抖函数”}],
max_tokens=400,
)
print(resp.choices[0].message.content)
能正常返回,说明 base_url、key、openai 库三件套 OK。这步通了,后面换模型只是改个字符串。
第二步:调 K3(需要升级一次)
K3 是付费模型。网关走的是 Wise 银行转账,一次性 $50 解锁全部 10 个模型(含 K3),不用绑信用卡。转账后传凭证,key 秒级开通。
代码姿势完全一样,只改 model:
curl 调 K3:
curl https://yingsuan.top/v1/chat/completions
-H “Authorization: Bearer YOUR_API_KEY”
-H “Content-Type: application/json”
-d ‘{
“model”: “kimi-k3”,
“messages”: [{“role”: “user”, “content”: “把下面这段代码重构成 async/await 形式…”}],
“max_tokens”: 800,
“stream”: true
}’
Python 流式调用(做 agent / 聊天最合适):
from openai import OpenAI
client = OpenAI(api_key=“YOUR_API_KEY”, base_url=“https://yingsuan.top/v1”)
stream = client.chat.completions.create(
model=“kimi-k3”,
messages=[{“role”: “user”, “content”: “写一个小 agent,用 tool-calling 查天气”}],
stream=True,
)
for chunk in stream:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end=“”)
stream: true 会实时吐 token,做对话和 agent 体感好很多。
几个我踩过才确认的细节
1M 上下文是真的能打:整份代码文件或长文档直接丢进 prompt,不用自己切片。
OpenAI 兼容是 drop-in:你项目里已经在用 openai 库,只换 base_url 就能切过来,原有业务逻辑不动。
多模型一把 key:K3 不够用?换 glm-4.7-flash 或 DeepSeek,key 不用换,适合做 A/B。
东南亚 / 南亚友好:支付走 Wise 银行转账,没有信用卡也能用,这点对很多地区的开发者是刚需。
价格和支付(实测)
档位
价格
包含
免费
¥0
100 次、3 个永久免费模型
Starter
$50 一次性
解锁全部 10 模型、10 次/分
升级走 Wise 转账,传凭证后秒发 key。详细页:yingsuan.top/payment(文末带参数链接)。
靠不靠谱
这点我特意查过:盈算智服 AI 网关上了云南省数据流通交易平台(双节点机制),数据源、计量、交易、合规申报都公开可查。你调的是有清晰法律身份的服务,不是匿名中转——对个人项目试水和对企业做合规接入,差别很大。
小结
如果你想不折腾一堆厂商账号就试 K3,这个网关挺省事:一把 key、一个 endpoint、OpenAI 形状。建议路径是——免费档先起,用 glm-4-flash 验证通了,真要用 K3 再升级。
👉 直达(带来源参数,若被折叠见评论区):https://yingsuan.top/api.html?utm_source=csdn&utm_medium=community&utm_campaign=k3_launch
注:本文代码均为实测可跑。CSDN 对外部链接有折叠机制,若上方直达链接不可见,请到评论区置顶取完整地址。
更多推荐


所有评论(0)