看影片(在新分頁開啟原站)連到 马克的技术工作坊
摘要
透過演算法題、工程題與邏輯遊戲,實測 Grok3、Claude 3.7、DeepSeek R1 與 o3 mini high 的推理與程式設計能力。觀眾能了解各模型在數學推理、程式撰寫與除錯上的實際表現,並根據工作需求選擇合適的 AI 工具。
A video benchmarking the reasoning and coding capabilities of four major AI models through algorithmic and engineering tasks.
摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。
重點
- o3 mini high 在演算法與數學題上表現最強,一次透過所有題目。
- Claude 3.7 工程能力最穩,生成的軟體介面美觀且功能完整。
- DeepSeek R1 與 Grok3 表現中等,部分題目需多次修正或失敗。
章節
依話題轉折切分,標題由 AI 產生
- 00:00四大推理模型简要介绍
- 01:00评测内容介绍
- 02:35算法题目介绍
- 03:08DeepSeek-R1做中等难度算法题
- 03:37o3-mini-high 做中等难度算法题
- 04:03Grok3 做中等难度算法题
- 04:39Claude 3.7 做中等难度算法题
- 05:04DeepSeek-R1做困难难度算法题
- 05:28o3-mini-high 做困难难度算法题
- 05:54Grok3 做困难难度算法题
- 06:10Claude 3.7 做困难难度算法题
- 07:21DeepSeek-R1 写思维导图
- 10:14o3-mini-high 写思维导图
- 11:09Grok3 写思维导图
- 12:39Claude 3.7 写思维导图
- 16:08DeepSeek-R1 写迷宫游戏
- 17:52o3-mini-high 写迷宫游戏
- 19:04Grok3 写迷宫游戏
- 22:11Claude 3.7 写迷宫游戏
- 23:05评测总结
提到的工具與公司
- o3-mini-high
- Grok3
- Claude 3.7
- DeepSeek-R1
- Leetcode
- XMind
- Python
- React
適合誰看
需要評估大模型在程式設計、數學推理或軟體開發中實際表現的開發者與技術決策者。
摘要依據
- 依據
- 人工字幕
為什麼排在這裡
- 人氣
- 0.23
- 新鮮
- 0.11
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- 顶级模型PK - 到底谁是编程之王?影片 ・ 马克的技术工作坊 ・ 31 分鐘(在新分頁開啟原站)
- o3-mini-high编程与推理能力评测影片 ・ 马克的技术工作坊 ・ 18 分鐘(在新分頁開啟原站)
- not much happened today文章 ・ AINews(Latent Space/smol.ai)
- OpenAI 连续 12 天 AI 发布会:第十二天 —— 最新一代推理模型 o3 和 o3-mini 发布介绍影片 ・ 宝玉的技术分享 ・ 22 分鐘(在新分頁開啟原站)
- [GRPO Explained] DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models影片 ・ Yannic Kilcher ・ 1 小時 9 分(在新分頁開啟原站)
- ThursdAI - Grok 4.6, Grok Bot deep dive, DeepSeek v4 Pro, Meta Muse Glimmer & more AI news | ThursdAi Aug 13Podcast ・ ThursdAI ・ 2 小時 15 分
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)
