AI Agent 浏览器自动化:Browser Use 和 Jina AI 的真实对比
以下完成率、质量分、百分比无独立出处,当印象,不当对照实验。
很多信息只在网页上,API 不提供。传统爬虫抓不到 JS 渲染的页面,反爬越来越严。AI 浏览器自动化能执行 JS、填表单、理解页面内容。
以下完成率、质量分、百分比无独立出处,当印象,不当对照实验。
很多信息只在网页上,API 不提供。传统爬虫抓不到 JS 渲染的页面,反爬越来越严。AI 浏览器自动化能执行 JS、填表单、理解页面内容。
2026 年 2 月 13 日,Google 发布 Gemini 3 Deep Think。官方给出的 ARC-AGI-2 正确率是 84.6%,距离 ARC Prize 的 85% 红线差 0.4 个百分点。这是 test-time compute,不是知识检索。
ARC-AGI(Abstraction and Reasoning Corpus for Artificial General Intelligence)是最接近"测试通用智能"的基准之一。
它不考知识,考的是在未知规则下解决新问题的能力——给一个视觉谜题,人类能推断出变换规则然后应用到新图形上。
Google 凌晨发布 Gemini 3 的 Deep Think 专用推理模式,在 ARC-AGI-2 上测出 84.6% 正确率。
2026 年初,17B 参数的小模型已经能在很多场景取代大模型了。厂商把 Llama 4 Scout (17B) 编程能力写得接近 GPT-4o。这里没有对照实验。
Gemini 2.0 Flash Thinking 在简单到中等编程任务上够用,复杂推理仍不如 Claude 3.7 和 o3。最大优势是价格:$0.1/M input tokens。没有对照实验,不打字母分。
Anthropic 发布 Claude Opus 4.6。
官方对它的定位是"most capable model yet"——但真正的新东西不是模型参数,是 Agent Teams。
Lewis 等人 2020 年的 RAG 把生成模型的参数记忆和可替换的非参数索引拆开:窗口装不下,才检索。现行 Claude 窗口写在 Anthropic context windows:Fable / Opus / Sonnet 5 默认 1M,Haiku 4.5 仍是 200k。能 count_tokens 塞进去、又需要跨段一起看的,先塞。语料比窗口大、或要按文档热更新的,再上索引。