如果你最近打开 Google Cloud Console 搜索”Vertex AI”,发现入口消失了,这不是 bug。2026 年 4 月 22 日,Google 在 Cloud Next 大会上宣布将 Vertex AI 更名为 Gemini Enterprise Agent Platform,2026 年 5 月 21 日完成迁移,控制台中 Vertex AI 页面已重定向到新的 Agent Platform。

这篇文章把这次变化说清楚,同时覆盖模型调用、自定义训练、RAG 检索增强生成的完整使用流程。

Vertex AI 更名为 Gemini Enterprise Agent Platform

什么变了,什么没变

没有变的: API 端点完全不变,仍然是 aiplatform.googleapis.com。所有调用 Vertex AI 的现有代码,无论是模型推理、训练作业还是端点部署,不需要修改任何一行代码,继续正常运行。原有的 Model Garden、Custom Training、AutoML、Model Registry、Endpoints、Pipelines 等功能,全部保留在新控制台的”Models”菜单下。

变了的: 控制台入口和产品名称。在 GCP 控制台中,原来的”Vertex AI”页面重定向到”Agent Platform”,产品全名为 Gemini Enterprise Agent Platform。功能组织方式从”模型为中心”变为”Agent 为中心”——原来的模型和 MLOps 功能成为子功能,新增的 Agent 构建和编排功能成为一级入口。

SDK 的重要变化(2026 年 6 月起生效): Vertex AI SDK(google-cloud-aiplatform)2026 年 6 月之后的版本将不再支持 Gemini 新功能。调用 Gemini 模型的代码应迁移到 Gen AI SDK(google-genai),新的 Gemini 功能只在 Gen AI SDK 中提供。已有的 Vertex AI SDK 代码在 2026 年 6 月前的版本中仍然可用,不需要立即迁移,但新项目建议直接使用 Gen AI SDK。

为什么 Google 做这个变化

Vertex AI 于 2021 年发布时,定位是”企业级 ML 平台”,核心价值是模型训练和 MLOps。到 2025 年,Google 在 AI 领域同时运营三个有重叠的产品:Vertex AI(模型和 MLOps)、Agentspace(企业 Agent 平台)、Gemini API(生成式 AI 调用)。三者功能交叉,客户选择时容易困惑。

Gemini Enterprise Agent Platform 把这三条产品线合并为一个统一品牌,同时将战略重心从”提供模型”转向”构建、部署和治理 Agent”。模型是 Agent 的基础组件,而不再是产品的核心。这个转变反映了 Google 对企业 AI 应用形态的判断:2026 年企业真正需要的不只是能对话的大模型,而是能自主执行多步骤任务的 Agent 系统。

核心功能概览

Gemini Enterprise Agent Platform(原 Vertex AI)当前提供以下几类核心能力,理解这个分层有助于选择正确的工具:

模型访问(Model Garden): 通过统一 API 调用 200+ 预训练基础模型,包括 Gemini 3.5 系列、Claude(Anthropic)、Llama 4(Meta)、Gemma 和 Mistral。不需要自己部署模型,按 Token 用量付费。

自定义训练(Custom Training): 在 GCP 的 GPU/TPU 上运行自定义机器学习训练代码,支持 TensorFlow、PyTorch、JAX 和 XGBoost,按训练时长和硬件规格计费。

AutoML: 无需编写训练代码,上传结构化数据、图片或文本数据集,AutoML 自动完成特征工程和模型训练,适合没有 ML 工程能力的团队。

Agent 构建(Agent Garden / Agent Studio): 2026 年新增的核心功能。Agent Garden 提供预制 Agent 模板库,Agent Studio 是可视化的无代码 Agent 构建界面,Agent Engine(原 Vertex AI Agent Builder 中的部署运行时)是托管的 Agent 运行环境。

RAG Engine 和 Vector Search: 检索增强生成(RAG)的托管方案,将企业私有文档导入向量数据库,模型在生成回答时自动检索相关内容,减少幻觉,让模型的回答有文档依据。

Memory Bank 和 Sessions(2026 年新增,已开始计费): Sessions 管理单次对话的状态和上下文,Memory Bank 跨多次对话存储长期记忆,让 Agent 在不同会话中保持对用户偏好和历史的记忆。两者从 2026 年 1 月 28 日开始计费。

调用 Gemini 模型:Gen AI SDK 的使用方式

2026 年 6 月后,新的 Gemini 功能只在 Gen AI SDK 中提供,新项目应直接使用 Gen AI SDK 而不是旧版的 Vertex AI SDK。

安装和认证

# 安装 Gen AI SDK

pip install google-genai

# 安装 gcloud CLI 并配置认证

gcloud auth application-default login

基础文本调用

from google import genai

from google.genai import types

# 通过 Vertex AI(Agent Platform)调用 Gemini

client = genai.Client(

    vertexai=True,

    project=’my-project’,

    location=’us-central1′

)

response = client.models.generate_content(

    model=’gemini-2.5-pro’,

    contents=’请用中文简要说明谷歌云的主要产品线。’,

    config=types.GenerateContentConfig(

        temperature=0.3,

        max_output_tokens=1000,

        system_instruction=’你是一个专业的谷歌云顾问,回答简洁准确。’

    )

)

print(response.text)

流式输出

# 流式输出适合需要实时显示生成内容的场景

for chunk in client.models.generate_content_stream(

    model=’gemini-2.5-pro’,

    contents=’详细介绍谷歌云的 AI 产品演进历程。’

):

    print(chunk.text, end=”, flush=True)

多模态调用(图片 + 文本)

import base64

# 读取图片并编码

with open(‘architecture_diagram.png’, ‘rb’) as f:

    image_data = base64.b64encode(f.read()).decode(‘utf-8’)

response = client.models.generate_content(

    model=’gemini-2.5-pro’,

    contents=[

        types.Part.from_bytes(

            data=base64.b64decode(image_data),

            mime_type=’image/png’

        ),

        ‘请分析这张架构图,指出潜在的性能瓶颈。’

    ]

)

print(response.text)

自定义模型训练

对于需要在私有数据上训练自定义模型的场景,Agent Platform 提供托管训练作业,在指定的 GPU 或 TPU 硬件上运行训练代码,按实际使用时长计费。

提交训练作业

from google.cloud import aiplatform

aiplatform.init(project=’my-project’, location=’us-central1′)

# 提交自定义训练作业

job = aiplatform.CustomTrainingJob(

    display_name=’my-training-job’,

    script_path=’trainer/task.py’,

    container_uri=’us-docker.pkg.dev/vertex-ai/training/pytorch-gpu.2-1:latest’,

    requirements=[‘torch’, ‘transformers’],

)

model = job.run(

    dataset=None,

    replica_count=1,

    machine_type=’n1-standard-8′,

    accelerator_type=’NVIDIA_TESLA_V100′,

    accelerator_count=1,

    args=[‘–epochs=10’, ‘–batch_size=32’]

)

训练完成后,模型自动注册到 Model Registry,可以直接部署到推理端点,也可以导出到 Cloud Storage 用于其他推理框架。

部署模型到推理端点

# 从 Model Registry 部署模型

endpoint = model.deploy(

    machine_type=’n1-standard-4′,

    min_replica_count=1,

    max_replica_count=5,

    accelerator_type=’NVIDIA_TESLA_T4′,

    accelerator_count=1,

    traffic_split={‘0’: 100}

)

# 发起在线预测

prediction = endpoint.predict(

    instances=[{‘input’: ‘sample text to classify’}]

)

print(prediction.predictions)

端点支持自动扩缩容,流量低时缩到最小副本数,流量高时自动扩容到最大副本数,按实际运行的副本数量和机型计费。

RAG Engine:企业私有知识库

RAG(Retrieval-Augmented Generation,检索增强生成)是目前企业 AI 应用中使用最广泛的架构模式:将企业内部文档(产品手册、技术文档、合规规定)导入向量数据库,用户提问时先从知识库检索相关内容,再将检索结果和问题一起发送给模型生成有依据的回答。

RAG Engine 是 Agent Platform 提供的全托管 RAG 方案,不需要自建向量数据库或手动实现 Embedding 和检索逻辑。

from google.cloud import aiplatform_v1beta1 as vertex_ai

# 创建 RAG 语料库

rag_client = vertex_ai.VertexRagDataServiceClient()

corpus = rag_client.create_rag_corpus(

    parent=f’projects/my-project/locations/us-central1′,

    rag_corpus={

        ‘display_name’: ‘企业知识库’,

        ‘description’: ‘内部产品文档和技术规范’

    }

)

# 导入 Cloud Storage 中的文档

import_response = rag_client.import_rag_files(

    parent=corpus.name,

    import_rag_files_config={

        ‘gcs_source’: {

            ‘uris’: [‘gs://my-bucket/docs/’]

        },

        ‘rag_file_chunking_config’: {

            ‘chunk_size’: 512,

            ‘chunk_overlap’: 100

        }

    }

)

文档导入后,在调用 Gemini 时附加 RAG 检索配置,模型自动从语料库中检索相关内容:

from google.genai import types

response = client.models.generate_content(

    model=’gemini-2.5-pro’,

    contents=’我们产品的退款政策是什么?’,

    config=types.GenerateContentConfig(

        tools=[

            types.Tool(

                retrieval=types.Retrieval(

                    vertex_rag_store=types.VertexRagStore(

                        rag_resources=[

                            types.RagResource(rag_corpus=corpus.name)

                        ]

                    )

                )

            )

        ]

    )

)

RAG Engine 适合企业内部问答、客服知识库和合规文档查询场景。对于需要分析和查询结构化数据的场景,BigQuery 配合 Gemini 的文本到 SQL 能力是更合适的方案,参考 谷歌云 BigQuery 指南的 AI 集成部分。

计费方式

Agent Platform(原 Vertex AI)的计费按功能类型分层:

基础模型调用(按 Token 计费): 调用 Model Garden 中的 Gemini、Claude 等预训练模型,按输入和输出 Token 数量计费。以 Gemini 2.5 Pro 为例,输入 $1.25/百万 Token,输出 $10/百万 Token(以 GCP 控制台当期报价为准)。

自定义训练(按机器时长计费): 训练作业按实际运行时间和硬件规格(机型 + GPU/TPU 数量)计费,无论是否有实际进展都产生费用,训练完成后应立即结束作业。GPU 实例价格参考 Compute Engine 的加速器附加费,A100 约 $3.28/GPU-小时,H100 更高。

推理端点(按运行时长计费): 部署到端点的模型按实际运行的副本数和机型计费,没有请求时端点仍然计费。如果推理流量不稳定,考虑使用 Cloud Run 部署模型服务,可以缩容到零,只在有请求时计费。

RAG Engine(按检索和存储计费): 文档向量化(Embedding)按 Token 计费,向量存储按数据量计费,检索操作按调用次数计费。

Memory Bank 和 Sessions(2026 年 1 月 28 日开始计费): Memory Bank 按存储的记忆数量和查询次数计费,Sessions 按活跃会话数计费,新功能建议在正式使用前在 GCP 账单中确认具体费率。

功能 计费方式 说明
预训练模型调用 按 Token 输入输出分别计费
自定义训练 按机器时长 包含 GPU/TPU 附加费
推理端点 按副本运行时长 无请求仍计费
RAG Engine 按存储和检索次数 Embedding 按 Token
Memory Bank 按记忆数量和查询 2026 年 1 月起计费

账号开通与代理充值

使用 Agent Platform(原 Vertex AI)需要有效的 GCP 账号,且 GPU 训练资源(A100、H100)的配额在新账号下默认为零,需要单独提交配额申请,审批周期从 1–5 个工作日不等,新账号申请高规格 GPU 的通过率明显低于有历史消费记录的账号。

通过 代理商 渠道获取的稳定账号,配额更宽松,适合直接用于 AI 训练和模型部署,1 分钟交付,免实名免绑卡。对于月均 GCP 消耗在 $500 以上的 AI 团队(GPU 训练费用通常远超这个量级),通过 代理商 充值享赠金返点(充值 $1000 到账 $1150,充值 $3000 到账 $3500),叠加 GCP 的 Spot VM 训练折扣(最高 60% off),年度实际 AI 训练成本明显低于官网按需计费价格,付款支持 USDT 和对公转账。

更多推荐