跳到主要內容
AI 武林
影片進階EN1.2 萬 次觀看

Stanford CME296 Diffusion & Large Vision Models | Spring 2026 | Lecture 7 - Evaluation

來源 Stanford Online

看影片(在新分頁開啟原站)連到 Stanford Online

摘要

第七講介紹如何評估文字生成影像模型的輸出品質,涵蓋人類評分、參考無指標(如 FID、CLIPScore)與參考有指標(如 MSE、PSNR、SSIM)等評估方法。學員將學習如何從美學與提示遵循度兩個維度判斷生成結果,並了解 GenEval、LongTextBench 等主流基準測試的運作原理。

This lecture covers methods for evaluating text-to-image generation quality, including human ratings, reference-free metrics like FID, and reference-based metrics like SSIM, alongside benchmark discussions.

摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。

重點

  • 學習人類評分與二值化評分的優缺點與噪音來源。
  • 掌握畫素級指標(MSE、PSNR)與結構相似性指標(SSIM)的計算邏輯。
  • 了解 GenEval、LongTextBench 等基準測試如何驗證提示遵循度與文字渲染能力。

章節

依話題轉折切分,標題由 AI 產生

  1. 00:00Introduction
  2. 05:19Motivation
  3. 10:48Human ratings
  4. 19:43Elo rating system
  5. 26:37Reference-free metrics
  6. 29:15Fréchet inception distance (FID)
  7. 42:30CLIPScore
  8. 44:51PickScore
  9. 45:41Reference-based metrics
  10. 48:07Mean squared error (MSE)
  11. 49:36Peak signal-to-noise ratio (PSNR)
  12. 51:54Structural similarity (SSIM)
  13. 1:01:09Perceptual similarity (LPIPS)
  14. 1:05:03Multimodal LLMs
  15. 1:13:10Faithfulness evaluation (TIFA)
  16. 1:17:29Visual question answering score (VQA)
  17. 1:24:40MLLM-as-a-Judge
  18. 1:34:17Benchmarks

提到的工具與公司

  • GenEval
  • DPG bench
  • TIFA
  • CLIPScore
  • PickScore
  • MLLM-as-a-Judge

適合誰看

正在修讀或研究擴增生成模型評估方法的研究生或工程師。

摘要依據

依據
人工字幕

為什麼排在這裡

人氣
0.56
新鮮
0.61

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)