谷歌云 Vertex AI 教程:Gemini Enterprise Agent Platform 迁移说明与核心功能使用
如果你最近打开 Google Cloud Console 搜索”Vertex AI”,发现入口消失了,这不是 bug。2026 年 4 月 22 日,Google 在 Cloud Next 大会上宣布将 Vertex AI 更名为 Gemini Enterprise Agent Platform,2026 年 5 月 21 日完成迁移,控制台中 Vertex AI 页面已重定向到新的 Agent Platform。
这篇文章把这次变化说清楚,同时覆盖模型调用、自定义训练、RAG 检索增强生成的完整使用流程。
Vertex AI 更名为 Gemini Enterprise Agent Platform
什么变了,什么没变
没有变的: API 端点完全不变,仍然是 aiplatform.googleapis.com。所有调用 Vertex AI 的现有代码,无论是模型推理、训练作业还是端点部署,不需要修改任何一行代码,继续正常运行。原有的 Model Garden、Custom Training、AutoML、Model Registry、Endpoints、Pipelines 等功能,全部保留在新控制台的”Models”菜单下。
变了的: 控制台入口和产品名称。在 GCP 控制台中,原来的”Vertex AI”页面重定向到”Agent Platform”,产品全名为 Gemini Enterprise Agent Platform。功能组织方式从”模型为中心”变为”Agent 为中心”——原来的模型和 MLOps 功能成为子功能,新增的 Agent 构建和编排功能成为一级入口。
SDK 的重要变化(2026 年 6 月起生效): Vertex AI SDK(google-cloud-aiplatform)2026 年 6 月之后的版本将不再支持 Gemini 新功能。调用 Gemini 模型的代码应迁移到 Gen AI SDK(google-genai),新的 Gemini 功能只在 Gen AI SDK 中提供。已有的 Vertex AI SDK 代码在 2026 年 6 月前的版本中仍然可用,不需要立即迁移,但新项目建议直接使用 Gen AI SDK。
为什么 Google 做这个变化
Vertex AI 于 2021 年发布时,定位是”企业级 ML 平台”,核心价值是模型训练和 MLOps。到 2025 年,Google 在 AI 领域同时运营三个有重叠的产品:Vertex AI(模型和 MLOps)、Agentspace(企业 Agent 平台)、Gemini API(生成式 AI 调用)。三者功能交叉,客户选择时容易困惑。
Gemini Enterprise Agent Platform 把这三条产品线合并为一个统一品牌,同时将战略重心从”提供模型”转向”构建、部署和治理 Agent”。模型是 Agent 的基础组件,而不再是产品的核心。这个转变反映了 Google 对企业 AI 应用形态的判断:2026 年企业真正需要的不只是能对话的大模型,而是能自主执行多步骤任务的 Agent 系统。
核心功能概览
Gemini Enterprise Agent Platform(原 Vertex AI)当前提供以下几类核心能力,理解这个分层有助于选择正确的工具:
模型访问(Model Garden): 通过统一 API 调用 200+ 预训练基础模型,包括 Gemini 3.5 系列、Claude(Anthropic)、Llama 4(Meta)、Gemma 和 Mistral。不需要自己部署模型,按 Token 用量付费。
自定义训练(Custom Training): 在 GCP 的 GPU/TPU 上运行自定义机器学习训练代码,支持 TensorFlow、PyTorch、JAX 和 XGBoost,按训练时长和硬件规格计费。
AutoML: 无需编写训练代码,上传结构化数据、图片或文本数据集,AutoML 自动完成特征工程和模型训练,适合没有 ML 工程能力的团队。
Agent 构建(Agent Garden / Agent Studio): 2026 年新增的核心功能。Agent Garden 提供预制 Agent 模板库,Agent Studio 是可视化的无代码 Agent 构建界面,Agent Engine(原 Vertex AI Agent Builder 中的部署运行时)是托管的 Agent 运行环境。
RAG Engine 和 Vector Search: 检索增强生成(RAG)的托管方案,将企业私有文档导入向量数据库,模型在生成回答时自动检索相关内容,减少幻觉,让模型的回答有文档依据。
Memory Bank 和 Sessions(2026 年新增,已开始计费): Sessions 管理单次对话的状态和上下文,Memory Bank 跨多次对话存储长期记忆,让 Agent 在不同会话中保持对用户偏好和历史的记忆。两者从 2026 年 1 月 28 日开始计费。
调用 Gemini 模型:Gen AI SDK 的使用方式
2026 年 6 月后,新的 Gemini 功能只在 Gen AI SDK 中提供,新项目应直接使用 Gen AI SDK 而不是旧版的 Vertex AI SDK。
安装和认证
# 安装 Gen AI SDK
pip install google-genai
# 安装 gcloud CLI 并配置认证
gcloud auth application-default login
基础文本调用
from google import genai
from google.genai import types
# 通过 Vertex AI(Agent Platform)调用 Gemini
client = genai.Client(
vertexai=True,
project=’my-project’,
location=’us-central1′
)
response = client.models.generate_content(
model=’gemini-2.5-pro’,
contents=’请用中文简要说明谷歌云的主要产品线。’,
config=types.GenerateContentConfig(
temperature=0.3,
max_output_tokens=1000,
system_instruction=’你是一个专业的谷歌云顾问,回答简洁准确。’
)
)
print(response.text)
流式输出
# 流式输出适合需要实时显示生成内容的场景
for chunk in client.models.generate_content_stream(
model=’gemini-2.5-pro’,
contents=’详细介绍谷歌云的 AI 产品演进历程。’
):
print(chunk.text, end=”, flush=True)
多模态调用(图片 + 文本)
import base64
# 读取图片并编码
with open(‘architecture_diagram.png’, ‘rb’) as f:
image_data = base64.b64encode(f.read()).decode(‘utf-8’)
response = client.models.generate_content(
model=’gemini-2.5-pro’,
contents=[
types.Part.from_bytes(
data=base64.b64decode(image_data),
mime_type=’image/png’
),
‘请分析这张架构图,指出潜在的性能瓶颈。’
]
)
print(response.text)
自定义模型训练
对于需要在私有数据上训练自定义模型的场景,Agent Platform 提供托管训练作业,在指定的 GPU 或 TPU 硬件上运行训练代码,按实际使用时长计费。
提交训练作业
from google.cloud import aiplatform
aiplatform.init(project=’my-project’, location=’us-central1′)
# 提交自定义训练作业
job = aiplatform.CustomTrainingJob(
display_name=’my-training-job’,
script_path=’trainer/task.py’,
container_uri=’us-docker.pkg.dev/vertex-ai/training/pytorch-gpu.2-1:latest’,
requirements=[‘torch’, ‘transformers’],
)
model = job.run(
dataset=None,
replica_count=1,
machine_type=’n1-standard-8′,
accelerator_type=’NVIDIA_TESLA_V100′,
accelerator_count=1,
args=[‘–epochs=10’, ‘–batch_size=32’]
)
训练完成后,模型自动注册到 Model Registry,可以直接部署到推理端点,也可以导出到 Cloud Storage 用于其他推理框架。
部署模型到推理端点
# 从 Model Registry 部署模型
endpoint = model.deploy(
machine_type=’n1-standard-4′,
min_replica_count=1,
max_replica_count=5,
accelerator_type=’NVIDIA_TESLA_T4′,
accelerator_count=1,
traffic_split={‘0’: 100}
)
# 发起在线预测
prediction = endpoint.predict(
instances=[{‘input’: ‘sample text to classify’}]
)
print(prediction.predictions)
端点支持自动扩缩容,流量低时缩到最小副本数,流量高时自动扩容到最大副本数,按实际运行的副本数量和机型计费。
RAG Engine:企业私有知识库
RAG(Retrieval-Augmented Generation,检索增强生成)是目前企业 AI 应用中使用最广泛的架构模式:将企业内部文档(产品手册、技术文档、合规规定)导入向量数据库,用户提问时先从知识库检索相关内容,再将检索结果和问题一起发送给模型生成有依据的回答。
RAG Engine 是 Agent Platform 提供的全托管 RAG 方案,不需要自建向量数据库或手动实现 Embedding 和检索逻辑。
from google.cloud import aiplatform_v1beta1 as vertex_ai
# 创建 RAG 语料库
rag_client = vertex_ai.VertexRagDataServiceClient()
corpus = rag_client.create_rag_corpus(
parent=f’projects/my-project/locations/us-central1′,
rag_corpus={
‘display_name’: ‘企业知识库’,
‘description’: ‘内部产品文档和技术规范’
}
)
# 导入 Cloud Storage 中的文档
import_response = rag_client.import_rag_files(
parent=corpus.name,
import_rag_files_config={
‘gcs_source’: {
‘uris’: [‘gs://my-bucket/docs/’]
},
‘rag_file_chunking_config’: {
‘chunk_size’: 512,
‘chunk_overlap’: 100
}
}
)
文档导入后,在调用 Gemini 时附加 RAG 检索配置,模型自动从语料库中检索相关内容:
from google.genai import types
response = client.models.generate_content(
model=’gemini-2.5-pro’,
contents=’我们产品的退款政策是什么?’,
config=types.GenerateContentConfig(
tools=[
types.Tool(
retrieval=types.Retrieval(
vertex_rag_store=types.VertexRagStore(
rag_resources=[
types.RagResource(rag_corpus=corpus.name)
]
)
)
)
]
)
)
RAG Engine 适合企业内部问答、客服知识库和合规文档查询场景。对于需要分析和查询结构化数据的场景,BigQuery 配合 Gemini 的文本到 SQL 能力是更合适的方案,参考 谷歌云 BigQuery 指南的 AI 集成部分。
计费方式
Agent Platform(原 Vertex AI)的计费按功能类型分层:
基础模型调用(按 Token 计费): 调用 Model Garden 中的 Gemini、Claude 等预训练模型,按输入和输出 Token 数量计费。以 Gemini 2.5 Pro 为例,输入 $1.25/百万 Token,输出 $10/百万 Token(以 GCP 控制台当期报价为准)。
自定义训练(按机器时长计费): 训练作业按实际运行时间和硬件规格(机型 + GPU/TPU 数量)计费,无论是否有实际进展都产生费用,训练完成后应立即结束作业。GPU 实例价格参考 Compute Engine 的加速器附加费,A100 约 $3.28/GPU-小时,H100 更高。
推理端点(按运行时长计费): 部署到端点的模型按实际运行的副本数和机型计费,没有请求时端点仍然计费。如果推理流量不稳定,考虑使用 Cloud Run 部署模型服务,可以缩容到零,只在有请求时计费。
RAG Engine(按检索和存储计费): 文档向量化(Embedding)按 Token 计费,向量存储按数据量计费,检索操作按调用次数计费。
Memory Bank 和 Sessions(2026 年 1 月 28 日开始计费): Memory Bank 按存储的记忆数量和查询次数计费,Sessions 按活跃会话数计费,新功能建议在正式使用前在 GCP 账单中确认具体费率。
| 功能 | 计费方式 | 说明 |
| 预训练模型调用 | 按 Token | 输入输出分别计费 |
| 自定义训练 | 按机器时长 | 包含 GPU/TPU 附加费 |
| 推理端点 | 按副本运行时长 | 无请求仍计费 |
| RAG Engine | 按存储和检索次数 | Embedding 按 Token |
| Memory Bank | 按记忆数量和查询 | 2026 年 1 月起计费 |
账号开通与代理充值
使用 Agent Platform(原 Vertex AI)需要有效的 GCP 账号,且 GPU 训练资源(A100、H100)的配额在新账号下默认为零,需要单独提交配额申请,审批周期从 1–5 个工作日不等,新账号申请高规格 GPU 的通过率明显低于有历史消费记录的账号。
通过 代理商 渠道获取的稳定账号,配额更宽松,适合直接用于 AI 训练和模型部署,1 分钟交付,免实名免绑卡。对于月均 GCP 消耗在 $500 以上的 AI 团队(GPU 训练费用通常远超这个量级),通过 代理商 充值享赠金返点(充值 $1000 到账 $1150,充值 $3000 到账 $3500),叠加 GCP 的 Spot VM 训练折扣(最高 60% off),年度实际 AI 训练成本明显低于官网按需计费价格,付款支持 USDT 和对公转账。
更多推荐


所有评论(0)