※ 摘要僅根據標題與說明
模型發布與實測
Model Releases & Reviews ・ 59 筆內容
新模型出了什麼、實際表現如何、跟其他模型怎麼比。
也叫做:模型發布、新模型、model release、模型評比、模型比較、模型实测、模型實測、GPT-5、Gemini 3、Claude Opus、Claude Sonnet
排行前 14 名
依相關、人氣、新鮮度綜合排序;站長推薦的加成
- 12.5 萬次觀看
First impressions of GPT-6 Astra from developers(在新分頁開啟原站)
開發者分享首次體驗 GPT-6 Astra 的初印象,內容聚焦於新模型在實際應用中的表現與反應。
58.2 萬次觀看※ 摘要僅根據標題與說明
- 120 萬次觀看
※ 摘要僅根據標題與說明
Before we ship a Claude model, these teams try to break it.(在新分頁開啟原站)
說明在正式推出 Claude 模型前,相關團隊會嘗試如何破解它。
1.6 萬次觀看※ 摘要僅根據標題與說明
- 3.2 萬次觀看
※ 摘要僅根據標題與說明
The First UNSHIPPED Model: Claude MYTHOS (Senior Engineer Breakdown)(在新分頁開啟原站)
這則影片由資深工程師解讀,介紹了 Claude Mythos 這個未公開的模型,並探討其可能對 AI 領域的衝擊。
1.9 萬次觀看※ 摘要僅根據標題與說明
Pushing My AI Dark Factory to Its Limits with Opus + Kimi Combined(在新分頁開啟原站)
介紹了如何將 Opus 與 Kimi 兩個大模型結合,以測試它們在極限條件下的表現。
5,300次觀看※ 摘要僅根據標題與說明
Claude Sonnet 5.5(在新分頁開啟原站)
介紹了 Anthropic 新推出的 Claude Sonnet 5.5 模型,指出其比 Sonnet 5 更快且成本更低。雖然在特定 Token 數下會出現像 Opus 5.5 的 bug,但在編碼和 3D 動畫等任務上表現優於舊版。
Kimi K3: The open-weights escalation(在新分頁開啟原站)
Moonshot AI 推出 Kimi K3,這是近來最接近開源前沿的模型之一。文章指出,中美模型效能差距縮短至 3-5 個月,顯示中國實驗室在資源效率、架構創新和文化自由度上取得顯著進展。
- 6,100次觀看
※ 摘要僅根據標題與說明
Plan with Claude Opus, Build with Kimi K2.6? LIVE Mixed-Provider Benchmark(在新分頁開啟原站)
探討使用 Claude Opus 與 Kimi K2.6 進行混合提供者測試,並分析其效能表現。
5,300次觀看※ 摘要僅根據標題與說明
EP147 - GPT-5.6 跟 Fable 誰強?Meta、SpaceXAI 也殺進模型戰場(在新分頁開啟原站)
Meta 與 SpaceX 的 AI 團隊在 GPT-5.6 與 Fable 之間展開激烈對決,探討誰能成為下一個大模型。
※ 摘要僅根據標題與說明
Claude Opus 4.5: The Engineers' Model(在新分頁開啟原站)
Claude Opus 4.5 是 AI 領域最新推出的工程模型,專為工程師設計,提供強大的程式碼生成與最佳化能力。
2.8 萬次觀看※ 摘要僅根據標題與說明
愛好 AI Engineer 電子報 🚀 2025 Q4 AI 模型與 Agent 開發 #33(在新分頁開啟原站)
本文收錄 2025 Q4 新模型動態與 AI Agent 開發實戰心得。涵蓋 GPT-5.1/5.2、Gemini 3、Claude 4.5 等模型更新,並探討 Spec-Driven Development、Context Engine…
最新
依發布時間
AI #188: Gemini Dot Argon(在新分頁開啟原站)
這篇文章彙整了近期 AI 領域的動態,包括 Google 推出的 Gemini 4 Argon、OpenAI 的 GPT-6.1 Sol 以及 Claude Opus 5.5 等模型更新。
[AINews] Opus 5.5 is good at explainer videos(在新分頁開啟原站)
Opus 5.5 於 9 月 24 日推出,在解釋影片生成領域表現卓越,主導 SimpleBench 並獲評為目前 Anthropic 最佳視覺模型。其推理能力在科學推理與視覺任務上均有顯著提升,但需注意避免使用「max」設定以節省預算。
Claude Sonnet 5.5(在新分頁開啟原站)
介紹了 Anthropic 新推出的 Claude Sonnet 5.5 模型,指出其比 Sonnet 5 更快且成本更低。雖然在特定 Token 數下會出現像 Opus 5.5 的 bug,但在編碼和 3D 動畫等任務上表現優於舊版。
🎙️ How I AI: Jev for beginners + I left Claude for months, Opus 5.5 brought me back + Opus 5.5 vs. GPT-6 Sol bench(在新分頁開啟原站)
介紹了 Lenny 的 How I AI 系列中關於 Jev 決策模型的實戰應用,以及作者為何在離開 Claude 後選擇 Opus 5.5 的原因。Jev 是一種決策模型而非語言模型,能將任務成本降低至每百萬字僅 4 美分。
Opus 5.5(在新分頁開啟原站)
介紹了 AI 模型 Opus 5.5 的更新,它取代了 GPT-5.6 Sol 成為 Amp 平台預設的「中級」模式。在內部評估中,Opus 5.5 解決了 65% 的任務,比前代提升 4%,且耗費更少資源。
Claude Opus 5.5 Should Raise Your Ambitions(在新分頁開啟原站)
介紹了 Anthropic 推出的 Claude Opus 5.5 模型,指出它在效能上接近甚至超越 Fable 5.1,但價格更低。
AI #187: Coming Into Play(在新分頁開啟原站)
討論了 AI 領域的最新動態,包括 Opus 5.5 模型的發布、OpenAI 推出的新軟體以及美國參議院透過的《禁止人工超級智慧法案》。作者也提及了關於 AI 安全、風險評估以及未來技術發展(如 AGI)的爭議與預測。
GPT-6与Claude Opus 5.5同日发布 | 模型价格战升级 | GPT-6 Luna | OpenAI | Anthropic | 大模型价格战 | AI性价比 | 模型评测 | 大模型(在新分頁開啟原站)
OpenAI 與 Anthropic 於 2026 年 9 月 23 日發布 GPT-6 Sol/Luna 與 Claude Opus 5.5,核心競爭點從效能轉向單位成本。GPT-6 價格腰斬,主打 Astra 能力下放;
2.5 萬次觀看※ 摘要僅根據標題與說明
Using Claude Opus 5.5 as your daily driver(在新分頁開啟原站)
介紹了 Claude Opus 5.5 的實作,涵蓋其較 Opus 5 更快、更精準的效能,以及 Pro、Max 與 Team 版更高的 Token 限制。
31.1 萬次觀看※ 摘要僅根據標題與說明
GPS, explained by Claude Opus 5.5(在新分頁開啟原站)
透過 Claude Opus 5.5 的互動網頁,模擬真實 GPS 衛星如何透過原子鐘廣播訊號,讓使用者計算自身位置與時間。
42.9 萬次觀看※ 摘要僅根據標題與說明
“It Blew Me Away” | Box’s First Look at GPT-6 Astra(在新分頁開啟原站)
介紹了 Box 對 GPT-6 Astra 的首次測試,內容聚焦於該模型在處理特定任務時的表現,並展示了其與 GPT-4o 的比較。
3.1 萬次觀看※ 摘要僅根據標題與說明
- 12.5 萬次觀看
※ 摘要僅根據標題與說明





















