Inherent 称其 AI 研究助手 Faraday 在论文复现任务中胜过大型模型
📰 全文
伦敦 AI 实验室 Inherent 向 TechCrunch 表示,其智能体 Faraday 在无需预先获知答案的情况下复现已发表论文的发现,并在该特定任务上优于 Anthropic 和 OpenAI 的更大模型。公司使用的是 270 亿参数的 Qwen 3.6,并把强化学习作为培养研究决策能力的主要方法之一。
原文要点
- Inherent 将论文复现视为训练 AI 科学助手的一个具体能力,而非已实现自主科学发现的证明。
- 公司称,Faraday 的评估对象包括 Claude Opus 4.8 与 GPT-5.5;报道未把这项比较等同于全面模型排名。
- 团队强调“research taste”,即判断哪些实验值得做以及如何设计实验的能力。
- Faraday 在工作流中会使用现有工具;报道举例称其采用 OpenAI 的 GPT-5.5 Codex,而非由 Inherent 自建编码工具。
为什么重要
研究型智能体的价值不只在生成文本,还在于能否提出、执行和检验实验步骤。若较小模型加上合适训练与工具编排能在限定任务中达到较高表现,研发团队可能重新衡量模型规模与系统设计的取舍;但公司自述结果仍需要公开方法、独立评测和可复现证据支持。
关键要点
- 新闻聚焦论文复现这一狭窄但可评估的科研工作流。
- 该公司将强化学习用于培养实验选择与执行能力。
- 特定任务比较不能外推为对所有研究能力或所有模型的排序。