2026 年 7 月 21 日,Google 发布 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 和 Gemini 3.5 Flash Cyber。三款模型分别面向复杂任务、高并发工作流和网络安全场景。


这次更新释放出一个清晰信号:大模型竞争正从单纯追求能力上限,进入对效率、成本和可靠性的综合竞争。

核心判断:企业 AI 正从“模型能力展示”,走向对效率、成本与可靠性的综合竞争。

大模型进入企业之后,大家很快发现:

模型“答得好”只是第一步。真正困难的是让它以可控的成本、稳定的速度,持续完成真实业务任务。

先看结论:三款模型怎么选?
一句话概括  3.6 Flash 负责“想清楚”,3.5 Flash-Lite 负责“跑得快”,3.5 Flash Cyber 负责“查漏洞”。

对企业来说,这意味着不必再让同一个大模型处理所有任务。


更合理的方式是按照任务复杂度、响应时间和业务价值,为不同环节选择不同模型。

Gemini 3.6 Flash : 企业 Agent 的主力模型

Gemini 3.6 Flash 是此次发布的主力,重点提升了编程与软件工程、知识工作与复杂分析,以及文档、图表等多模态内容处理能力。
根据 Google 引用的 Artificial Analysis Index 数据,与 3.5 Flash 相比,3.6 Flash 的输出 Token 使用量减少约 17%;在部分编程测试中,Token 消耗降幅最高达到 65%。
这项改进为什么重要?


因为企业 Agent 往往需要经历“理解任务—制定计划—查找信息—调用工具—检查结果—输出结论”等多个步骤。


更少的推理步骤和工具调用,意味着:


· 单个任务成本更低;
· 整体响应速度更快;
· 多轮执行中的错误更少;
· 高并发运行时更加稳定。
Google 公布的测试结果显示,3.6 Flash 在编程、机器学习研究、计算机操作和知识工作方面均超过上一代模型。


计算机操作能力也已经作为客户端工具进入 Gemini API 和 Gemini Enterprise,让 Agent 可以进一步执行跨系统任务。

官方价格:每百万输入 Token 1.50 美元;每百万输出 Token 7.50 美元。

它适合承担企业 Agent 中需要综合判断、复杂推理和结果汇总的“主控”角色。

Gemini 3.5 Flash-Lite:让 Agent 真正规模化运行
商品属性提取、客户反馈分类、票据翻译与总结、合同字段抽取、搜索结果初筛——这些任务数量多、频率高、流程相对明确,企业更关心速度和单位成本。


Gemini 3.5 Flash-Lite 正是针对这类场景设计。


根据 Artificial Analysis 的测试数据,该模型的输出速度约为每秒 350 个 Token。


官方价格:每百万输入 Token 0.30 美元;每百万输出 Token 2.50 美元。

企业还可以配置不同的“思考等级”:


简单任务选择较低等级,优先控制延迟和成本;多步骤任务提高思考等级,换取更强的执行能力。


在数据分析 Agent 中,可以让 3.6 Flash 负责理解问题、制定计划和汇总结论,同时让多个 3.5 Flash-Lite 实例并行完成文档解析、数据抽取、信息分类和结果校验。
架构启示:“主模型规划、轻量模型执行”通常比所有任务都调用同一个模型更经济,也更容易扩展。


Gemini 3.5 Flash Cyber:让 AI 帮助修复代码漏洞

Gemini 3.5 Flash Cyber 基于 3.5 Flash 进行专门优化,主要用于发现代码漏洞、验证漏洞、生成修复方案以及协助安全团队规模化处理风险。


它将与 Google DeepMind 的代码安全 Agent——CodeMender 结合使用。


多个 Flash Cyber Agent 可以协同分析代码,最后形成综合安全报告。


由于安全模型具有明显的双重用途,Google 暂时不会通过普通 API 全面开放 Flash Cyber,而是计划通过 CodeMender,以有限试点方式向政府机构和可信合作伙伴提供。


治理提醒: AI 安全不能只关注模型本身,还要同步建立权限控制、操作审计、数据隔离和人工确认机制。

企业真正需要的,不只是“选模型”

未来,一个成熟的企业 Agent 很可能包括三层:


第一层:主模型|理解目标、规划流程、处理复杂判断并生成最终结论。


第二层:执行模型|完成搜索、抽取、分类、转换等高频、可并行工作。


第三层:专业模型|处理安全、代码、金融等需要专业能力和严格权限控制的任务。


因此,企业在选择模型时,需要同时回答:


· 哪些业务适合使用 AI Agent?
· 一次完整任务的成本是多少?
· 不同任务如何路由到不同模型?
· 如何连接企业内部数据和业务系统?
· 如何控制模型访问数据的权限?
· 模型出错或超时后如何处理?
· 哪些步骤必须保留人工审核?

从概念验证走向生产环境,真正困难的往往不是调用模型,而是完成模型、数据、流程和安全体系之间的整合。

NebulaData 可以提供哪些支持?
作为合作伙伴,NebulaData 可以协助企业评估 Google Cloud 与 Gemini 模型在实际业务中的应用价值,并规划从验证到生产落地的完整路径。


1. AI 场景与需求咨询
梳理适合生成式 AI 和 Agent 的业务流程,明确预期收益、应用边界与主要风险。
2. 模型选型与成本评估
围绕回答质量、任务成功率、响应时间、Token 消耗和高并发稳定性,对候选模型进行真实工作负载测试。
3. 企业数据与 Gemini 集成
规划模型与数据仓库、知识库、文档系统及业务应用的连接方式,让 Agent 在权限允许的范围内使用企业数据。
4. Agent 原型与落地架构
设计任务流程、模型分工、工具调用、异常处理、人工审核以及持续监控机制。
5. 安全与治理咨询
完善身份权限、敏感数据保护、Prompt 与输出审计、人工审批和风险监控。

如何开始?建议先做一个“小而真实”的验证
企业不需要一开始就建设覆盖全公司的 AI 平台。


更稳妥的方式,是选择一个范围明确、数据可获得、结果可衡量的业务流程,进行短周期验证。


批量解析合同或报告;
自动整理客户反馈;
构建企业知识问答;
生成数据分析摘要;
辅助代码检查与研发工作。
验证过程中,重点记录任务成功率、人工节省时间、响应速度和实际调用成本,再决定是否扩大应用范围。

结语
Gemini 3.6 Flash 提升复杂任务的质量与效率,3.5 Flash-Lite 支撑高并发、低成本工作流,3.5 Flash Cyber 则把模型能力延伸至专业安全领域。

趋势判断  企业 AI 正从“模型能力展示”,走向“单位任务价值”的竞争。

真正决定 AI Agent 能否规模化落地的,不只是模型有多强,而是它能否以可预测的成本、稳定的质量和可治理的方式,持续完成真实业务任务。


如果您的企业正在评估 Google Cloud、Gemini 或 AI Agent 的应用路径。


NebulaData 可以从场景梳理、模型选型、成本测试、数据集成到落地架构,提供针对性的咨询与技术支持。


欢迎联系我们,一起找到适合您业务的 AI 落地起点。

参考资料:
Google, “Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber”, 2026 年 7 月 21 日。
注:文中的模型价格、性能数据和开放范围来自 Google 官方发布信息,后续可能调整,请以实际产品页面为准。

Nebula Data 星雲數據,总部位于新加坡,在雅加达、广州、上海、香港设有分支机构。公司自主研发 Nebula Lab 多模态智能体协同编排SaaS平台,面向千行百业的AI Agent构建与应用底座模型、数据、工具与业务流程,加速行业智能体落地;同步推出 Nebula AIoT 硬件生态体系(含智能交互终端、物联网网关等产品),形成 “云 - 边 - 端” 全链路智能解决方案,为电商、制造、零售等多领域客户提供从云端算力支撑、AI 智能决策到终端场景落地的一体化服务;同时提供全球 AIDC(AI 智算中心)+ 低延迟网络服务,以技术底座赋能企业拥抱 AI、链接物理世界,拓展全球业务。
 

更多推荐