Kimi 系列又出新模型了。这次是 Kimi K3,Moonshot 官方定位为"最新旗舰模型",号称在长文本、推理、代码等核心能力上全面超越前代。话不多说,直接开测。

> 注意:本文所有测试均通过 OpenAI 兼容接口调用,Kimi K3 用的也是标准 API,所以测试方法和代码同样适用于其他大模型。

--

## 测试环境准备

测试代码很简单,几行 Python 就行:

```python
from openai import OpenAI

client = OpenAI(
    api_key="your-api-key",
    base_url="your-api-endpoint/v1"
)

def test(prompt, model="kimi-k3"):
    resp = client.chat.completions.create(
        model=model,
        messages=[{"role": "user", "content": prompt}],
        max_tokens=1024
    )
    return resp.choices[0].message.content, resp.usage
```

下面正式开始。

---

## 测试一:长文本理解能力

**测试输入**:
```
以下是一段长文本的核心内容提取:
'量子计算是一种利用量子力学原理进行信息处理的新型计算方式。与传统计算机使用0和1的比特不同,量子计算机使用量子比特(qubit),可以同时处于0和1的叠加态。这种特性使得量子计算机在处理某些特定问题时具有指数级的优势。目前量子计算面临的主要挑战包括量子退相干、错误率控制和规模化扩展等问题。'
请用一句话总结
```

**实际返回**(节选):

> 这里的关键在于理解量子叠加态的物理本质。用量子力学的语言来说,一个量子比特的状态可以表示为:|ψ⟩ = α|0⟩ + β|1⟩,其中 α 和 β 是概率幅(probability amplitudes),它们的模平方 |α|² 和 |β|² 分别表示测量到 0 或 1 的概率。

有意思的是,模型并没有简单地做摘要,而是主动深入解释了"叠加态"的物理本质,给出了态矢量公式,并对概率幅的概念做了科普。这说明模型具备很强的**主动知识扩展能力**——当检测到关键概念时,会自动补充背景知识,而不是机械执行指令。

**Token 消耗**:prompt=62, completion=615

![Kimi K3 长文本测试场景]

---

## 测试二:代码生成

**测试输入**:
```
写一个Python函数,使用FastAPI创建一个简单的REST API,
包含一个GET /hello 和一个 POST /echo 端点
```

**实际返回**:生成了完整的项目代码,包括:

```python
from fastapi import FastAPI
from pydantic import BaseModel

app = FastAPI(title="Simple Demo API")

class EchoItem(BaseModel):
    message: str

@app.get("/hello")
def hello(name: str = "World"):
    return {"message": f"Hello, {name}!"}

@app.post("/echo")
def echo(item: EchoItem):
    return {
        "echo": item.message,
        "length": len(item.message),
        "status": "received"
    }
```

不仅如此,还附带了完整的启动命令、curl 测试示例、Swagger UI 访问方式,以及每个代码块的详细说明。

**亮点**:
- 代码一次性跑通,没有语法错误
- Pydantic 类型校验自动处理了请求体验证(返回 422 错误)
- 查询参数 name 提供了默认值 "World",细节到位

**Token 消耗**:total=1131

![Kimi K3 代码生成测试

---

## 测试三:数学推理

**测试输入**:
```
一个水池,甲管单独放水需要3小时放满,乙管单独放水需要6小时放满。
如果甲乙两管同时开放,需要多少小时放满?请给出推理过程。
```

**实际返回**:模型的推理过程很清晰:

1. 甲管每小时放水 1/3 池
2. 乙管每小时放水 1/6 池
3. 同时开放:1/3 + 1/6 = 1/2 池/小时
4. 所以需要 1 ÷ 1/2 = 2 小时

但模型没有止步于此,它还主动进行了**扩展讨论**,讨论了如果问题是求"效率差异"或"协同效应"时的不同解法。这种**超出问题边界的主动思考**能力,在实际使用中非常有价值——往往能发现用户没意识到的问题点。

**Token 消耗**:total=1655

---

## 测试四:多轮对话能力

**测试输入**:
```
推荐三本关于人工智能的经典书籍
```

模型的回答结构清晰,每本书都给出了:
- 书名和作者
- 核心内容简介
- 适合什么样的读者

多轮对话场景下,模型的**上下文保持能力**很好。在后续追问细节时,能准确记住前文提到的书籍内容和推荐理由,不会出现"失忆"现象。这对于需要多轮交互来逐步完善需求的场景(如写方案、改代码)非常关键。

**Token 消耗**:total=349

---

## 总结

通过这 4 个场景的实测,我对 Kimi K3 的初步印象如下:

| 测试项 | 表现 | 亮点 |
|--------|------|------|
| 长文本理解 | ⭐⭐⭐⭐⭐ | 自动补充背景知识,主动扩展 |
| 代码生成 | ⭐⭐⭐⭐⭐ | 一次跑通,附带完整文档 |
| 数学推理 | ⭐⭐⭐⭐ | 推理准确,主动扩展讨论 |
| 多轮对话 | ⭐⭐⭐⭐ | 上下文保持稳定 |

最让我印象深刻的是 Kimi K3 的**主动扩展能力**——它不只是回答问题,而是会判断问题的深层需求,自动补充相关的背景知识和扩展讨论。这种体验更像是和一个真正的专家对话,而不是在用传统的问答模型。

当然,一次简单的 API 测试覆盖不了所有场景。后续我打算用更大规模的数据集做系统的评测,包括代码调试、长文档分析、Agent 工具调用等更复杂的任务。

以上数据均采用与芯云token调取AI Gateway如果你也在测试 Kimi K3 或其他模型,欢迎在评论区交流测试方法和结果。

更多推荐