谷歌发布Gemini 4 Argon:单次输出上限100万Token,先服务网络安全防御者

AI资讯58秒前发布 EdgeClaw
0 00

10月1日,谷歌正式发布新一代前沿模型Gemini 4 Argon,这是Gemini 3系列旗舰亮相近十个月后的首次大更新。与以往直接向公众开放不同,Argon这次选择了一条更稳妥的路线:先交给受信任的网络安全防御者试用,再逐步向开发者、企业和普通用户开放。

输出上限提升到100万Token意味着什么

Argon最受关注的变化,是把单次输出Token上限从此前的6.4万直接拉高到100万。注意,这个数字与上下文窗口是两个概念——它衡量的是模型在一次推理轨迹中能连续生成多长的内容。对大型代码库迁移、深度研究和多步骤企业流程来说,这意味着模型可以在一条任务链里持续推理,而不必把复杂工作拆成好几轮。

目前多数前沿模型的输出上限约为12.8万Token,Argon的100万Token显得相当突出。定价方面,Argon API初始价格为每百万输入Token 2美元、每百万输出Token 10美元,缓存输入价格比标准输入低95%。据第三方测算,在折扣价下Argon完成单个任务的成本约为1.99美元,比GPT-6 Astra低约40%。

Gemini 4 Argon模型核心芯片与数据流概念图,象征单次输出上限升至100万Token

软件工程与安全能力实测

谷歌在19项基准测试中宣称Argon取得13项领先。在衡量长期软件工程能力的DeepSWE v1.1评测中,Argon拿到77.9%,为当前最高水平;在Zapier的AutomationBench企业流程自动化基准上以51.3%排名第一,比Claude Opus 5.5高出近9个百分点;长视频理解评测LVBench得分91.7%。

更值得关注的是它在真实工程任务中的表现。谷歌披露,Argon已参与内部C/C++代码库向Rust的迁移,覆盖超过80万行代码的Fuchsia Zircon内核;在开源视频解码器libgav1项目中,它重写了约3.2万行SIMD代码,新版本运行速度达到原版的2.7倍。

数据中心内存优化项目中,Argon代理自动分析全网性能监控数据并实施优化,上线后已释放超过300 TiB内存。在量子计算领域,它仅用几分钟就把已发表基准结果提升了40%。

网络安全是Argon首批落地的重点。谷歌称该模型能自主发现、验证并修复关键软件漏洞,在CWE-bench v1漏洞修复评测中以68%的成绩并列第一。安全公司Wiz已通过相关计划使用Argon,为公共基础设施免费排查高风险暴露面,谷歌还表示Argon发现过一项影响全球医院医疗软件、此前其他前沿模型未能识别的严重漏洞。

AI网络安全防御场景图,盾牌与机械臂修复漏洞,象征Argon首批落地安全领域

从研究机构到产品引擎

Argon的发布背景是一次深刻的组织调整。今年8月,谷歌对DeepMind进行架构调整,联合创始人兼CEO哈萨比斯卸下日常运营职责转任董事长,专注AGI长期战略;首席技术官卡武克丘奥卢升任高级副总裁直接向CEO汇报。外界普遍认为,这次”静悄悄的权力交接”意味着DeepMind正在从顶级研究机构转向高效产品引擎,让AI能力更快落地到搜索、地图、Gmail等十亿级用户产品中。

分阶段发布:先安全、后公众

谷歌表示,Argon正在参与美国政府推动的模型预发布自愿流程,首批测试者将帮助评估模型表现并完善安全防护。针对网络攻击及化学、生物、放射性和核相关滥用请求,Argon均设有使用限制,并部署了内部激活监测、自动化红队测试和针对间接提示注入的对抗训练。

不过,评测成绩与真实体验之间仍有差距。彭博社报道称,部分谷歌员工对Argon在日常编码中的实际表现存疑——它在结构化的DeepSWE v1.1上表现出色,但在更接近真实工程复杂度的FrontierSWE v2上只有55.0%,被GPT-6 Astra的65.5%拉开差距。

Argon能否兑现长周期推理能力,还需要更多真实场景来验证。可以肯定的是,把最强模型先交给安全团队、再逐步开放的分阶段发布策略,正在成为行业的新常态。

© 版权声明

相关文章