返回 文章 学习 CMS 文章

Google 推出 Gemini 3.5 Flash Cyber:轻量级网络安全模型

Google 推出轻量级网络安全模型 Gemini 3.5 Flash Cyber,以低成本高效发现和修补漏洞,并采取有限访问试点部署。

Gemini 3.5 Flash Cyber网络安全漏洞发现漏洞修补
成长分 / 100 67 综合收获、行动、留存与影响

Google 推出 Gemini 3.5 Flash Cyber:轻量级网络安全模型
为什么值得读了解 Google 在自动化漏洞发现与修复领域的最新模型进展。

掌握轻量级模型在代码安全搜索空间问题上的优势与基准表现。

关键洞察
  1. Gemini 3.5 Flash Cyber 基于 3.5 Flash 构建并微调,专注于快速高效地发现、验证和修补漏洞。
  2. 轻量级模型适合智能体多次调用,可分析更多代码路径,集成到频繁扫描或大规模提交流水线中。
  3. 在 CyberGym 基准上,CodeMender 通过最多五次调用 3.5 Flash Cyber 取得与更大模型竞争的表现。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:7018

隆重推出 Gemini 3.5 Flash Cyber

多年来,Google 持续投入网络安全领域,率先开展自动化漏洞发现,以保护全球的代码库。像 CodeMender 这样的工具——我们的代码安全智能体——能够自动发现并修复关键软件漏洞。但随着 AI 智能体发现漏洞的能力越来越强、速度超过防御者的修复速度,应对这一全球性威胁需要一种能力强大、成本可负担且可扩展的方法。

今天,我们正在扩展长期以来的努力,以更好地帮助防御者做好准备,为此推出 Gemini 3.5 Flash Cyber——这是我们基于 3.5 Flash 构建的轻量级网络安全模型,经过微调,能够快速高效地发现、验证和修补漏洞,在这些任务上比 Gemini 的主线 Flash 模型更为有效。

Flash 的性能和效率使其成为我们网络安全模型工作的理想基础。通过在 Flash 之上构建,3.5 Flash Cyber 为大型、昂贵的网络安全模型提供了一种成本高效且能力强大的替代方案。

鉴于这项技术的两用性质,我们对 3.5 Flash Cyber 的部署采取了审慎的方式。作为有限访问试点计划的一部分,3.5 Flash Cyber 将很快通过 CodeMender 独家提供给政府和可信合作伙伴,并随时间逐步扩大范围。这将使一线防御者能够抢先发现并修复关键漏洞,赶在其被利用之前,同时降低更广泛滥用的风险。

另外,我们还通过 Gemini Enterprise Agent Platform,将 CodeMender 的基础能力直接带给使用正式版 Gemini 模型的客户。

搜索空间问题:轻量级模型在代码安全中的优势

发现深层次的缺陷需要探索巨大的执行搜索空间。依赖对大型语言模型的一次昂贵调用可能会造成瓶颈。3.5 Flash Cyber 特别适合在智能体必须扫描大型代码库并分析大量代码路径的场景中发现漏洞。

CodeMender 会多次调用 3.5 Flash Cyber,因此智能体可以分析多得多的代码路径来发现和验证漏洞。随后,子智能体生成一份高质量的报告。

得益于其速度和成本优势,3.5 Flash Cyber 可以轻松集成到频繁扫描、时间敏感的发布流程或大规模提交扫描流水线中。

3.5 Flash Cyber 基准测试结果:大型网络安全模型的高效替代方案

我们在多种基准测试上测试了 3.5 Flash Cyber。特别是,我们在 CyberGym 基准测试上测试了 3.5 Flash Cyber,该基准测试针对数百个真实世界的软件漏洞评估 AI 智能体。通过配置 CodeMender 对单个最终报告最多调用 3.5 Flash Cyber 五次,利用其低成本,整体智能体在 CyberGym* 上取得了与规模大得多的模型相比具有竞争力的表现。

CyberGym 上的成功率(pass@1)

*竞争对手结果来源于提供商自我报告的分数

我们还在没有安全护栏的情况下,对模型在 CyberGym 之外的能力进行了压力测试。Google 的 Big Sleep 团队独立构建了一项评估,专注于在 Chrome 和 Safari 等全球最复杂的代码库中寻找关键且难以发现的漏洞。在这里,3.5 Flash Cyber 显著超越了主线 3.5 Flash 和 3.6 Flash。

Big Sleep 评估上的成功率(pass@1)

3.5 Flash Cyber 还在 Google Chrome 的生产提交扫描流水线上进行了评估。这些漏洞并未公开披露,这确保了该基准测试对 Gemini 和竞品模型保持无污染。

结果显示,与 3.5 Flash 相比,3.5 Flash Cyber 有显著提升。注意:Opus 4.6 之后更新的竞品模型版本因内置安全护栏而拒绝执行这些任务,因此未予展示。

Chrome 生产提交扫描流水线上的成功率(pass@1)

此外,与主线 3.5 Flash 和 Claude Opus 4.6 相比,3.5 Flash Cyber 持续发现更多独特漏洞。在高度复杂的 V8 JavaScript 引擎上,以固定调用次数进行测试时,3.5 Flash Cyber 发现了 55 个经确认的独特问题,而主线 3.5 Flash 发现了 47 个,Opus 4.6 发现了 36 个,其中包括另外两个测试模型未能捕捉到的 10 个问题。

基础的网络安全模型可能会陷入循环,反复发现同一个问题,却遗漏关键漏洞。强大的模型则能撒下更广的网,发现更多数量的独特问题。

随着我们扩大调用次数,我们发现 3.5 Flash Cyber 持续发现新的代码路径和漏洞。

真实世界应用与在 Google 扩展防御

基准测试只是故事的一部分。CodeMender 中的 3.5 Flash Cyber 已经在发现并修复 Google 内部代码库中的漏洞,包括 Chrome、Android、Cloud、Ads 和 YouTube。

轻量级模型所带来的发现速度已产生可衡量的影响。

例如,Google 的 Cloud Vulnerability Research 团队使用 3.5 Flash Cyber 以创纪录的时间主动保护我们的系统。在短短 2 小时内,该模型发现了公共 API 中的远程代码执行漏洞,并在一个敏感的生产服务中发现了一个内存破坏漏洞。随后,它生成了一个 100% 可靠的远程代码执行利用程序,绕过了地址空间布局随机化(ASLR)和写异或执行(W^X)等标准缓解技术。

来自 Wiz 和 Cloud CISO Security Engineering 测试人员的早期反馈证实,3.5 Flash Cyber 相比主线 3.5 Flash 模型有显著的能力提升。

大规模赋能防御者

Google 在软件安全领域的领导地位赋予我们独特优势。例如,OSV.dev 是 Google 运营的漏洞数据库,涵盖超过 700,000 个开源漏洞,以及超过 10 年的 OSS-Fuzz 结果,帮助我们识别最高质量的漏洞。

这使我们能够超越合成网络安全示例,教会我们的模型真实安全专业人员的工作方式。我们的模型学会操作行业标准工具,通读 Chromium 等大型项目中数百万行代码,并独立处理需要数小时持续深度分析的复杂安全任务。

通过以 3.5 Flash Cyber 驱动 CodeMender,我们提供了一种能力强大、可扩展且经济实惠的架构,旨在帮助更多防御者保护软件安全。