TechTrends360 科技前沿

聚焦全球科技前沿资讯:AI、芯片、互联网大厂动态,每日更新

人工智能

谷歌发布Gemini 3.1 Pro,推理与性价比双领先

导语:2026年2月19日,谷歌DeepMind首席执行官Demis Hassabis宣布发布Gemini 3.1 Pro。作为去年11月Gemini 3 Pro的进化版,新模型在ARC-AGI-2、GPQA Diamond等多项高难度推理基准上大幅领先Claude Opus 4.6与GPT-5.2。据2月行业回顾,Gemini 3.1 Pro在性能与成本的平衡上同样具备领先优势,成为2月“模型雪崩”中谷歌打出的关键一牌。

事件详情

Gemini 3.1 Pro被谷歌定位为“更智能、更有能力的复杂问题解决基线”,专为“没有标准答案”的复杂任务而生,目标直指科学研究、工程开发与长链条决策场景。最引人注目的成绩来自ARC-AGI-2测试——这项被视为高阶AI推理“试金石”的评测专门考验模型解决全新逻辑模式的能力。Gemini 3.1 Pro拿下77.1%,几乎是前代Gemini 3 Pro(31.1%)的两倍以上,同时领先Claude Opus 4.6(68.8%)和GPT-5.2(52.9%)。

在专家级科学知识评测GPQA Diamond中,3.1 Pro取得94.3%,高于GPT-5.2的92.4%和Opus 4.6的91.3%。在编程与代理任务上同样亮眼:LiveCodeBench Pro的Elo评分达2887(GPT-5.2为2393),SWE-Bench Verified达80.6%,Terminal-Bench 2.0达68.5%,科学编程基准SciCode达59%,比Claude Opus 4.6高出7个百分点。

技术规格上,Gemini 3.1 Pro采用混合专家架构,支持100万token的超长上下文输入,最多可生成6.4万token的响应,并全面覆盖文本、图像、视频与音频输入。谷歌还引入了全新的开发者参数:thinking_level(思维控制)让开发者在响应质量、推理复杂度、延迟和API成本之间灵活权衡;media_resolution(媒体分辨率)则可以控制视觉处理的token消耗。

发布渠道覆盖谷歌全系产品:消费者可通过Gemini应用和NotebookLM使用,开发者可通过AI Studio调用,企业则可通过Vertex AI部署。据谷歌称,支撑该模型的“升级版核心智能”上周已在Gemini 3 Deep Think中首次亮相,帮助早期采用者识别出同行评审数学论文中的缺陷。

背景分析

Gemini 3.1 Pro的发布时机耐人寻味:2月5日Claude Opus 4.6与GPT-5.3 Codex同日登场,2月19日谷歌跟进,GLM-5、Qwen3.5、Kimi K2.5等也在数周内密集发布。短短一个月内,前沿模型的竞争从“谁回答得快”彻底转向“谁思考得深”,推理能力成为新的主战场。

谷歌的策略与对手形成差异:当OpenAI和Anthropic把重心放在agentic coding与企业工作流时,谷歌选择在抽象推理与科学任务上建立代差优势。77.1%的ARC-AGI-2得分不仅是数字上的领先,更意味着模型在面对未知问题时的抽象归纳能力出现了结构性跃升。

另一个不容忽视的维度是性价比。据2月行业回顾,Gemini 3.1 Pro在性能与成本的平衡上处于领先位置。结合此前财报披露的“Gemini单位服务成本下降78%”,谷歌正在把规模效应转化为价格优势——这在模型能力趋同的背景下,可能成为决定企业选型的关键因素。

影响展望

对开发者而言,thinking_level这类参数的出现值得玩味:模型厂商开始把“思考多少”交还给用户定价,推理不再是固定成本,而是可以根据任务价值灵活调节的变量。这预示着AI API的商业模式正在从“按量计费”向“按智计费”演进。

对行业而言,2月的“模型雪崩”证明了一件事:前沿模型的领先窗口正在缩短到以“周”计。今天的SOTA,明天就可能被超越。在这种节奏下,真正的护城河或许不再是某一个模型版本,而是把模型快速送进产品、送进企业工作流的能力——而这正是谷歌凭借Android、Workspace与云生态所擅长的。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注