這兩年,模型迭代越來越快,你也趕著把系統換上最新、最強的模型;測完,卻只得到一句:「好像有好一點。」這大概是近期最多團隊共同的困惑:模型明明越來越強,自家系統卻沒跟著變強。
Andrej Karpathy 的 Software 3.0 給了第一條線索:當我們越來越習慣用自然語言把「意圖」交給模型、讓它負責規劃與執行,人剩下最關鍵的一件事,就是驗證機器的產出對不對。但驗證得再好,也只守得住品質,還不足以讓系統自己越變越強。
真正的答案,藏在強化學習之父 Richard Sutton 的 Bitter Lesson 裡:能隨規模擴展的通用訓練,長期總是打敗人類手工設計的框架。
把這兩條線接起來、再往前推一步,就是 Angus 自行延伸提出的 Bitter Lesson 2.0:該 scale 的,已經不只是模型,而是整條「驗證 → 回饋」的迴圈。誰能把這條迴圈規模化,誰的系統才會持續增強。
這正是 Angus 一路在做的事:從新加坡 SAP 的推薦系統、柏林 Remerge 的即時競價,到如今回到台北——題目換了三次,主線卻始終是這條「驗證 → 回饋」的迴圈。他現任內容推薦平台 Taboola(每日觸及全球約 6 億名活躍使用者)的 Data / ML R&D Team Leader。
當天,他會以自駕車領域的 Waymo vs Tesla 為對照,帶你把這條主線完整走一遍:
活動大綱
- Software 1.0 → 2.0 → 3.0:規則由誰來寫?
- 1.0:人來寫規則
- 2.0:機器從資料中學出規則
- 3.0:人用自然語言表達意圖,模型負責規劃與執行
- 每一次躍進都拉高了抽象層次,也重新定位了人的判斷;到了 3.0 時代,重點落在一件事上:驗證機器的產出。
- 上路實戰的自駕車系統:Waymo vs Tesla
- 兩種系統設計:Waymo 的模組化架構搭配冗餘驗證,對上 Tesla 由車隊資料餵養、受監督的端到端建模。
- 真正的差異不在架構,而在於各自如何擷取真實世界的經驗、驗證改進,並轉動回饋飛輪——同時安全地把風險控制在邊界之內。
- The Bitter Lesson 1.0 → 2.0
- 1.0(Sutton):能隨算力擴展的通用方法,長期持續打敗手工規則。
- 2.0(Angus 的延伸):規模化的對象變大了——從單一模型的能力,擴大到整個回饋閉環。
- 要持續規模化的是回饋系統,不是單一模型
- 一個系統要能持續變好,前提是結果能被觀察、評估,並回饋到下一次迭代。
- 這對 ML/DS 工作的意義:價值從「打造模型」移到「設計整個學習系統」。
適合對象
- 手上的 AI 應用換過模型、調過 prompt,卻始終說不清效果有沒有變好的 AI Engineer 與數據工作者
- 被問「導入 AI 之後成效如何」就頭痛、需要拿出具體驗證方式的 PM 與主管
- 想知道 AI 系統如何在上線後持續變強、而非停在第一版的學習者


