跳到主要內容
AI 武林
影片進階中文1,624 次觀看

四大推理大模型数学与编程能力评测 Grok3、Claude3 7、DeepSeep R1、o3 mini high 到底谁的推理能力最强?

來源 马克的技术工作坊

看影片(在新分頁開啟原站)連到 马克的技术工作坊

摘要

透過演算法題、工程題與邏輯遊戲,實測 Grok3、Claude 3.7、DeepSeek R1 與 o3 mini high 的推理與程式設計能力。觀眾能了解各模型在數學推理、程式撰寫與除錯上的實際表現,並根據工作需求選擇合適的 AI 工具。

A video benchmarking the reasoning and coding capabilities of four major AI models through algorithmic and engineering tasks.

摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。

重點

  • o3 mini high 在演算法與數學題上表現最強,一次透過所有題目。
  • Claude 3.7 工程能力最穩,生成的軟體介面美觀且功能完整。
  • DeepSeek R1 與 Grok3 表現中等,部分題目需多次修正或失敗。

章節

依話題轉折切分,標題由 AI 產生

  1. 00:00四大推理模型简要介绍
  2. 01:00评测内容介绍
  3. 02:35算法题目介绍
  4. 03:08DeepSeek-R1做中等难度算法题
  5. 03:37o3-mini-high 做中等难度算法题
  6. 04:03Grok3 做中等难度算法题
  7. 04:39Claude 3.7 做中等难度算法题
  8. 05:04DeepSeek-R1做困难难度算法题
  9. 05:28o3-mini-high 做困难难度算法题
  10. 05:54Grok3 做困难难度算法题
  11. 06:10Claude 3.7 做困难难度算法题
  12. 07:21DeepSeek-R1 写思维导图
  13. 10:14o3-mini-high 写思维导图
  14. 11:09Grok3 写思维导图
  15. 12:39Claude 3.7 写思维导图
  16. 16:08DeepSeek-R1 写迷宫游戏
  17. 17:52o3-mini-high 写迷宫游戏
  18. 19:04Grok3 写迷宫游戏
  19. 22:11Claude 3.7 写迷宫游戏
  20. 23:05评测总结

提到的工具與公司

  • o3-mini-high
  • Grok3
  • Claude 3.7
  • DeepSeek-R1
  • Leetcode
  • XMind
  • Python
  • React

適合誰看

需要評估大模型在程式設計、數學推理或軟體開發中實際表現的開發者與技術決策者。

摘要依據

依據
人工字幕

為什麼排在這裡

人氣
0.23
新鮮
0.11

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)