收藏本站 网站导航 开放平台 Thursday, October 8, 2026 星期四
  • 微信

OpenAI 新模型测试 4000 道未解数学题

来源 中金网 5小时前
摘要: OpenAI发布722篇AI生成数学论文,涵盖已解决与待验证问题进展

  数学测试一直是检验 AI 模型(如 ChatGPT 和 Claude)能力的基准方法。OpenAI 表示,其最新模型在现有数学测试中的表现已经接近极限,这也让这些测试参考价值逐渐降低。为此,研究人员决定挑战更高难度。

  他们向一款尚未公开发布的模型提供了约 4,000 道未被解答的数学难题。结果出人意料,同时也引发关注。

  该 AI 生成了 722 篇学术论文,内容归为 372 个相关成果系列。OpenAI 称,每一项成果平均耗时约 3 小时的推理计算。

  “数学界即将迎来令人激动的时代!” BeInCrypto 未来科技与 AI 专家委员会成员 Stefano Gogioso 表示

  AI 的进步速度会不会过快?

  这才是更深层的隐忧。前沿 AI 如今已不仅仅是解答已知问题,还在尝试为未知问题提出可能的答案。

  这意味着,无论是研究员、工程师还是分析师,其理论工作产能都可能大幅提升。

  但 AI 产出并不等同于“真理”。OpenAI 的部分论文配有可由计算机自动检验的 Lean 证明,但也有论文尚未被验证。OpenAI 警告称,尚未核查的结果“可能存在问题”。

  这也带来了新的瓶颈:AI 生成研究的速度,或许会超过人类审核的能力。

  AI 能否直接进行投资预测与决策?

  理论上有可能,但金融领域的复杂性完全不同。

  数学证明最终总能验证对错,而金融市场则充满噪音、持续波动。

  近期金融领域的基准测试显示,前沿 AI 仍难以应对复杂的投资研究,关于市场时机的研究也尚未发现 AI 具备显著的预测优势。

  短期内,AI 更有可能助力深度研究,而不是“完美预测”。

  具备数小时持续推理能力的 AI,可以同步梳理财报披露、电话会议、宏观数据及多种假设场景,测试人类分析师难以覆盖的大量假设。

  这正是 OpenAI 实验释放的最大信号:AI 正具备以巨大规模产出专业分析工作的能力。下一步挑战,将是如何甄别哪些结果值得信任。

免责声明:中金网发布此信息目的在于传播更多信息,与本网站立场无关。中金网不保证该信息的准确性、真实性、完整性、有效性等。相关信息并未经过本网站证实,不构成任何投资建议,据此操作,风险自担。