DeepSeek放大招!新模型专注数学定理证明,大幅刷新多项高难基准测试。在普特南测试上,新模型DeepSeek-Prover-V2直接把记录刷新到49道。目前的第一名在657道题中只做出10道题,为Kimi与AIME2024冠军团队Numina合作成果Kimina-Prover。而未针对定理证明优化的DeepSeek-R1只做出1道。让还没发布的R2更令人期待了。除测评结果之外,论文中特别报告了...
网页链接DeepSeek放大招!新模型专注数学定理证明,大幅刷新多项高难基准测试。在普特南测试上,新模型DeepSeek-Prover-V2直接把记录刷新到49道。目前的第一名在657道题中只做出10道题,为Kimi与AIME2024冠军团队Numina合作成果Kimina-Prover。而未针对定理证明优化的DeepSeek-R1只做出1道。让还没发布的R2更令人期待了。除测评结果之外,论文中特别报告了...
网页链接
精彩评论