数学测试一直是检验 AI 模型(如 ChatGPT 和 Claude)能力的基准方法。OpenAI 表示,其最新模型在现有数学测试中的表现已经接近极限,这也让这些测试参考价值逐渐降低。为此,研究人员决定挑战更高难度。
他们向一款尚未公开发布的模型提供了约 4,000 道未被解答的数学难题。结果出人意料,同时也引发关注。
该 AI 生成了 722 篇学术论文,内容归为 372 个相关成果系列。OpenAI 称,每一项成果平均耗时约 3 小时的推理计算。
“数学界即将迎来令人激动的时代!” BeInCrypto 未来科技与 AI 专家委员会成员 Stefano Gogioso 表示
AI 的进步速度会不会过快?
这才是更深层的隐忧。前沿 AI 如今已不仅仅是解答已知问题,还在尝试为未知问题提出可能的答案。
这意味着,无论是研究员、工程师还是分析师,其理论工作产能都可能大幅提升。
但 AI 产出并不等同于“真理”。OpenAI 的部分论文配有可由计算机自动检验的 Lean 证明,但也有论文尚未被验证。OpenAI 警告称,尚未核查的结果“可能存在问题”。
这也带来了新的瓶颈:AI 生成研究的速度,或许会超过人类审核的能力。
AI 能否直接进行投资预测与决策?
理论上有可能,但金融领域的复杂性完全不同。
数学证明最终总能验证对错,而金融市场则充满噪音、持续波动。
近期金融领域的基准测试显示,前沿 AI 仍难以应对复杂的投资研究,关于市场时机的研究也尚未发现 AI 具备显著的预测优势。
短期内,AI 更有可能助力深度研究,而不是“完美预测”。
具备数小时持续推理能力的 AI,可以同步梳理财报披露、电话会议、宏观数据及多种假设场景,测试人类分析师难以覆盖的大量假设。
这正是 OpenAI 实验释放的最大信号:AI 正具备以巨大规模产出专业分析工作的能力。下一步挑战,将是如何甄别哪些结果值得信任。