The AI Product Playbook

2026-07-02

全書精華

主要主題、論點、核心訊息

  • 主要主題:本書旨在為非技術背景的產品經理(PM)提供實用的策略、技能與框架,幫助他們跨越商業問題與深層技術執行之間的鴻溝,順利轉型並勝任「AI 產品經理」的角色。
  • 核心論點:成功的 AI 產品經理不需親自編寫演算法,但必須具備「AI 溝通能力(AI Fluency)」。PM 需要能區別各種 AI/ML 技術的應用場景、理解模型如何學習與評估,並將混淆矩陣等技術指標轉化為商業影響力,引導團隊打造有價值的產品。
  • 核心訊息「從問題出發,而不是從技術出發」。AI 僅是解決問題的強大手段,PM 必須秉持以使用者為中心的心態、重視資料品質、適應機率性而非決定性的結果,並將道德、公平性與持續維護(MLOps)視為開發生命週期中不可妥協的核心原則。

掌握作者思路必懂的關鍵要點

  • AI 與 ML 的區別:AI 是創造智慧機器的廣泛目標,而 ML(機器學習)是達成此目標的具體方法,讓系統能從「數據」中學習規律並改進。這項區別直接影響了技術可行性評估、數據資源分配與專案的迭代規劃。
  • 機率性而非決定性:傳統軟體是決定性的(點擊按鈕就會發生預期動作),而 AI 模型是機率性的,提供的是帶有信賴度的預測。PM 必須針對模型出錯的情況進行規劃,設計能優雅處理不確定性並維持使用者信任的體驗。
  • 三種 AI PM 專業角色:作者將 AI 時代的產品經理分為三大發展方向:「AI 體驗 PM」(專注於使用者與 AI 互動的介面設計)、「AI 基礎建設 PM」(建構與管理內部 AI 平台、模型與架構),以及**「AI 增強 PM」**(利用 AI 工具提升自身與團隊的決策及工作效率),幫助讀者明確定位職涯。
  • 從模型指標到商業 ROI:評估 AI 專案不能只看單一的「準確率(Accuracy)」。PM 必須理解精準度(Precision)與召回率(Recall)之間的權衡,並根據**「錯誤的代價(偽陽性或偽陰性哪個傷害更大)」**來選擇評估標準,進而將這些技術指標轉化為減少客戶流失或增加營收等具體的商業投資報酬率。
  • AI 的持續生命週期與 MLOps:AI 產品的發布只是開始,而非結束。由於現實世界的數據會隨著時間改變(模型漂移),AI 系統必須透過 MLOps(機器學習維運) 進行持續的監控、驗證與重新訓練,確保模型在生產環境中保持可靠與可擴展性。
  • 負責任的 AI 與道德設計:公平性、隱私與偏見消除不能是開發週期末端的「事後檢查」,必須在產品構思初期就納入核心需求。特別是在涉及「受保護階層(如性別、種族)」時,PM 是使用者的代言人,有責任透過人機協作(HITL)與多元數據等方式,確保 AI 系統不會延續或放大社會的既有偏見。

反主流洞見

讓「人類介入 (Human-in-the-Loop)」成為核心策略,而非 AI 失敗的象徵

  • 差異點:主流觀點常認為 AI 產品的終極目標是「完全自動化」,若系統需要人類介入,就代表 AI 不夠聰明或是開發失敗;但作者認為 Human-in-the-Loop (HITL) 是一種刻意的設計模式(Design Pattern),結合人類判斷力與機器運算能力是提升產品可靠性的關鍵策略。
  • 作者論證:作者指出,在處理模糊性、缺乏訓練資料的邊緣案例,或是高風險決策時,AI 容易出錯或產生偏見。將人類專家納入 AI 產品生命週期(如資料標註、模型驗證或最終決策),不僅能提高準確度與公平性,更是建立使用者信任的關鍵要素。
  • 相關案例:在社群媒體的內容審查中,AI 會先標記可疑的違規內容,再由人類審查員做最終裁決,以避免誤刪正常內容或漏掉有害資訊;在醫療影像診斷上,AI 負責標示潛在異常,但最終的診斷與決策仍交由醫生判斷。

追求高「準確率 (Accuracy)」可能是一個危險的陷阱

  • 差異點:一般人通常直覺認為模型的「準確率」越高越好(例如 99% 準確率聽起來極佳);作者則警告,單一的準確率指標往往會對產品經理產生嚴重的誤導。
  • 作者論證:作者利用「混淆矩陣 (Confusion Matrix)」解釋,當資料集極度不平衡時(例如 99% 的郵件是正常的,只有 1% 是垃圾郵件),一個總是預測「非垃圾郵件」的偷懶模型也能達到 99% 的準確率,但它完全無法攔截那 1% 的垃圾郵件,對使用者毫無用處。因此,產品經理必須評估「犯錯的代價」,根據誤判與漏判哪個更嚴重,改用精確度 (Precision) 或召回率 (Recall) 來衡量商業價值。
  • 相關案例:在「信用卡詐欺檢測」中,漏抓一筆詐欺的成本極高,因此寧可有少數假警報(False Positives),也要看重「召回率 (Recall)」;相反地,在「垃圾郵件過濾」中,把重要信件誤判為垃圾信會引發巨大民怨,因此必須高度看重「精確度 (Precision)」。

產品上線 (Launch) 不是終點,而是模型退化的開始

  • 差異點:傳統軟體開發思維認為,功能一旦寫好並上線,專案就大致完成了(僅剩除錯);但對於 AI 產品而言,上線只不過是生命週期的起跑線。
  • 作者論證:傳統軟體的邏輯是靜態的,但 AI 模型是動態的系統,其效能會隨著真實世界的資料變動(例如使用者行為的改變)而逐漸下降,這種現象稱為「模型漂移」。因此,AI 產品必須建立 MLOps(機器學習營運)思維,將持續監控、重新訓練和維護視為產品生命週期的常態循環,並規劃好長期資源。
  • 相關案例:在訂閱服務的「客戶流失預測模型 (Churn Prediction)」案例中,模型上線後必須持續監控使用者的行為數據變化,並定期使用最新的真實資料重新訓練模型,以確保預測準確度不會因為趨勢的改變而失效。

不要為 AI 而 AI:最複雜的機器學習技術未必是最佳解

  • 差異點:隨著生成式 AI 等高階技術爆紅,產品開發很容易陷入「拿著技術找問題 (solution in search of a problem)」的狂熱,認為所有問題都該用最新、最複雜的 AI 模型解決;作者反而呼籲退一步,堅持「從問題出發」的務實原則。
  • 作者論證:作者強調,有時候一個簡單的、非 AI 的解決方案(或僅需簡單的基於規則的系統 Rule-based system)可能執行速度更快、更可靠,而且帶來更好的使用者體驗。產品經理的責任是捍衛「最佳解決方案」,而非盲目推動「最複雜的技術」。
  • 相關案例:若只是要處理客服常見問題 (FAQs),使用基於關鍵字比對的規則系統(屬於廣義的 AI,但不具備機器學習能力)就十分足夠且實作快速;只有在系統必須從歷史資料中找出複雜模式並做預測時,才真正需要動用機器學習。

內化行動計畫

1. 先找問題,再找技術

  • 行動目標:避免「為 AI 而 AI」,確保 AI 技術是為了解決真實的用戶痛點或商業問題。
  • 記憶鉤子拒絕拿著槌子找釘子——AI 只是強大手段,不是最終目的。
  • 故事或例子:PM 想用最新 GenAI 摘要所有用戶信件,但深究發現用戶根本找不到 FAQ。改用簡單的關鍵字搜尋(非機器學習)就解決了問題,替團隊省下數月開發時間。
  • 觸發情境:當老闆或團隊提出「我們應該要在產品裡加入 AI 功能」時。
  • 對象與場景:產品經理、利害關係人/產品需求定義與路線圖規劃會議。
  • 具體步驟
    • 步驟一:退回原點,問團隊「我們試圖解決的『核心用戶問題』是什麼?」
    • 步驟二:評估是否有更簡單、更便宜的「非 AI」解決方案(如規則系統)。
    • 步驟三:若確認 AI 是最佳解,列出驗證此方案所需的關鍵數據與資源。
  • 可衡量的成果:產出一份明確定義「用戶痛點」且評估過非 AI 替代方案的產品需求文件(PRD)。
  • 失敗補救機制:若高層堅持上線 AI 功能,則將其框架為最小可行性產品(MVP),透過 A/B 測試快速驗證其商業價值。

2. 定義犯錯的代價(選擇正確指標)

  • 行動目標:跳脫單一的「準確率(Accuracy)」陷阱,依據商業風險選擇精確度(Precision)或召回率(Recall)。
  • 記憶鉤子犯錯代價決定指標——寧可錯殺一百,還是不願放過一個?
  • 故事或例子:信用卡詐欺預測模型的準確率高達 99%,但漏抓一筆詐欺損失慘重。PM 決定將目標改為追求「召回率(Recall)」,寧可多幾次假警報(偽陽性),也不放過任何詐欺(偽陰性)。
  • 觸發情境:與資料科學家討論模型成效,或定義機器學習專案的 KPI 時。
  • 對象與場景:產品經理、資料科學團隊/模型驗證與成效評估階段。
  • 具體步驟
    • 步驟一:列出該情境下的「偽陽性(False Positive)」與「偽陰性(False Negative)」分別代表什麼。
    • 步驟二:評估這兩種錯誤對用戶體驗與商業造成的成本與傷害,哪一個更致命。
    • 步驟三:依據傷害程度,決定優先優化 Precision(防擾民)或 Recall(防漏抓)。
  • 可衡量的成果:在 PRD 中明確定義出主要的模型評估指標(如 Recall 目標需 > 95%)。
  • 失敗補救機制:若初期難以抉擇,先採用綜合指標 F1-Score,待上線收集真實用戶回饋後再做權重調整。

3. 設計「人類介入(HITL)」工作流

  • 行動目標:在高風險或高模糊性的 AI 應用中,引入人類判斷以確保準確度與用戶信任。
  • 記憶鉤子AI 提案,人類拍板——讓機器做苦工,讓人類做決策。
  • 故事或例子:醫療影像 AI 自動寄送罹癌診斷給病患引發恐慌與誤診。PM 重新設計流程,讓 AI 標示異常處並產出報告,交由專業醫師「一鍵確認」後才發送,信任度大幅提升。
  • 觸發情境:開發涉及高風險決策(如醫療、金融、招募)或極端邊緣案例的 AI 功能時。
  • 對象與場景:產品經理、UX 設計師/用戶體驗設計與風險評估環節。
  • 具體步驟
    • 步驟一:找出 AI 流程中最關鍵、出錯成本最高的決策點。
    • 步驟二:設計 UI 介面,將 AI 的輸出設計為「建議」或「草稿」,而非最終結果。
    • 步驟三:設計清晰的人類審查工作流,允許審查員輕鬆批准、修改或拒絕 AI 建議。
  • 可衡量的成果:產出包含「人類審查節點」的用戶旅程圖(User Journey Map)。
  • 失敗補救機制:若全人工審查太耗時,可設定「AI 信心閾值」:信心度 > 95% 自動放行,低於此標準才轉交人工審查。

4. 建立生成式 AI(GenAI)品檢線

  • 行動目標:針對變異性高、主觀性強的 GenAI 產出,建立系統化的評估機制以確保品質與安全。
  • 記憶鉤子拒絕盲測,建立專屬品檢線——為 AI 的創造力裝上安全護欄。
  • 故事或例子:產品內建的 AI 寫作助手偶爾會產生帶有偏見或胡言亂語的內容。PM 導入「GenAI Evals」流程,結合 BLEU 自動評分與人工盲測,在上線前成功攔截毒性內容。
  • 觸發情境:準備發布或迭代基於大型語言模型(LLM)等生成式 AI 功能時。
  • 對象與場景:產品經理、資料科學家、QA 團隊/模型測試與上線前準備。
  • 具體步驟
    • 步驟一:明確定義「好」的產出標準(如:相關性、連貫性、事實準確度、安全性)。
    • 步驟二:針對客觀標準選用自動化指標(如 BLEU、ROUGE),針對主觀標準設計人工評分量表。
    • 步驟三:設定上線的最低容忍閾值,未達標則退回重新調整 Prompt 或微調模型。
  • 可衡量的成果:建立一份標準化的 GenAI 評估報告(包含自動化分數與人工評分結果)。
  • 失敗補救機制:若自動化評估建置成本太高,初期先從抽樣人工審查(Human Evaluation)開始,並在 UI 上加上「AI 生成內容可能不準確」的免責聲明。

5. 執行事前道德與偏見審查

  • 行動目標:在開發初期主動識別並阻斷 AI 可能造成的偏見與歧視,保護弱勢群體。
  • 記憶鉤子將公平植入產品基因——事前防範勝於事後公關危機。
  • 故事或例子:某企業的 AI 履歷篩選系統因使用過往偏頗數據,自動給女性求職者打低分。若 PM 提早執行偏見審查,發現數據失衡並調整權重,就能避免嚴重的法律與公關災難。
  • 觸發情境:專案啟動、定義資料來源與規劃模型訓練資料集時。
  • 對象與場景:產品經理、法務、資料科學家/專案 Kick-off 與資料盤點會議。
  • 具體步驟
    • 步驟一:列出產品會接觸到的「受保護階層(如性別、種族、年齡)」。
    • 步驟二:檢視訓練資料集,尋問「這些數據是否反映了歷史上的不平等或刻板印象?」
    • 步驟三:與資料團隊制定去偏見策略(如重新抽樣、特徵重權重),並在模型驗證期加入公平性測試。
  • 可衡量的成果:完成一份記錄潛在風險與應對策略的「道德與法律影響評估清單」。
  • 失敗補救機制:若產品上線後仍發現偏見,立即啟動緊急應變:關閉 AI 功能,切換回傳統人工流程,並回收數據重新訓練。

6. 運用提示工程強化 PM 工作流

  • 行動目標:將 AI 作為個人與團隊的效率倍增器,自動化繁瑣的產品管理日常任務。
  • 記憶鉤子讓 AI 成為最強副手——把時間留給戰略,把繁瑣交給 AI。
  • 故事或例子:PM 面對數千筆 App Store 用戶評論無從下手。他使用提示工程(Prompt Engineering),精準設定 AI 的角色、分析框架與輸出格式,五分鐘內就淬鍊出三大核心痛點,省下整週時間。
  • 觸發情境:需要處理大量文本分析、撰寫 PRD 草稿、進行競品研究或總結會議記錄時。
  • 對象與場景:AI 增強型 PM(AI-Enhanced PM)/日常個人工作與團隊協作。
  • 具體步驟
    • 步驟一:盤點耗時的 PM 任務(如用戶回饋分類、文件起草)。
    • 步驟二:撰寫結構化提示詞(包含角色、背景、任務目標、所需輸出格式)。
    • 步驟三:提供範例(Few-shot learning)給 AI 參考,並根據產出結果反覆微調提示詞。
  • 可衡量的成果:建立專屬的「PM 常用提示詞庫(Prompt Library)」,每週節省至少 20% 行政時間。
  • 失敗補救機制:若 AI 產出的洞見太過表面,重新優化提示詞加入更嚴格的限制,或改用 AI 協助抓取關鍵字,再由人工進行深度推論。

整體執行建議

  • 搭配方式:所有專案皆應以「行動 1(先找問題)」起頭;進入開發時並行「行動 2(定義指標)」與「行動 5(道德審查)」;設計體驗時落實「行動 3(HITL)」;上線前執行「行動 4(品檢線)」。同時,每天持續實踐「行動 6(增強工作流)」。
  • 執行週期:跟隨產品開發生命週期(Lifecycle)推進,行動 1、2、5 屬於探索與規劃期(數週),行動 3、4 屬於開發與測試期(數週至數月),行動 6 為持續性的日常習慣。
  • 防棄機制
    1. 修改公版文件:將「衡量指標(Precision/Recall)」、「非 AI 替代方案」與「道德偏見風險」直接納入公司內部的 PRD 範本中,強制每次提案都必須填寫。
    2. 建立 AI 讀書會或 Prompt 交流群:在團隊內定期分享自己成功運用 AI 節省時間的案例與好用的提示詞,透過社群力量保持對 AI 應用的熱度與學習。

記憶卡片總表

編號
記憶鉤子
核心理念
適用情境
01
拒絕拿著槌子找釘子
AI只是手段,優先確認用戶痛點與非AI解法。
收到「我們需要一個AI功能」的開發要求時。
02
犯錯代價決定指標
依據偽陽與偽陰的嚴重性,選擇精確度或召回率。
與資料科學家討論模型成功標準與KPI時。
03
AI 提案,人類拍板
在高風險或模糊決策中,將人類審查納入流程。
設計涉及重大決策或潛在風險的AI體驗時。
04
建立專屬品檢線
結合人工與自動化指標,為生成式AI建立評估。
準備發布或更新大型語言模型(LLM)功能時。
05
將公平植入產品基因
在開發初期主動審查數據偏見,確保群體權益。
專案啟動、定義資料來源與資料集規劃階段。
06
讓 AI 成為最強副手
透過結構化提示工程,利用AI加速PM日常工作。
撰寫文件、分析回饋等繁瑣文書任務時。