/images/avatar.png

Gemini 3 Deep Think 与 ARC-AGI-2

2026 年 2 月 13 日,Google 发布 Gemini 3 Deep Think。官方给出的 ARC-AGI-2 正确率是 84.6%,距离 ARC Prize 的 85% 红线差 0.4 个百分点。这是 test-time compute,不是知识检索。

ARC-AGI(Abstraction and Reasoning Corpus for Artificial General Intelligence)是最接近"测试通用智能"的基准之一。

它不考知识,考的是在未知规则下解决新问题的能力——给一个视觉谜题,人类能推断出变换规则然后应用到新图形上。

Google 凌晨发布 Gemini 3 的 Deep Think 专用推理模式,在 ARC-AGI-2 上测出 84.6% 正确率

AI Context 管理:RAG 与 Long Context

Lewis 等人 2020 年的 RAG 把生成模型的参数记忆和可替换的非参数索引拆开:窗口装不下,才检索。现行 Claude 窗口写在 Anthropic context windows:Fable / Opus / Sonnet 5 默认 1M,Haiku 4.5 仍是 200k。能 count_tokens 塞进去、又需要跨段一起看的,先塞。语料比窗口大、或要按文档热更新的,再上索引。