
我們公司內部目前跑著 20+ 個 AI 流程,從報價草稿、會議紀錄整理到內容產線都有。跑了一年多之後,最深的一個體會是:生成式 AI 的導入方法,跟過去那種「找一批標註資料、訓練模型、算準確率」的 AI 專案,在時程、預算結構、驗收方式上幾乎沒有一項是共通的。

多數公司踩的坑,就是拿舊的方法論來管新的東西。先花三個月寫規格書、再花三個月開發、最後驗收「準確率要 95%」,然後在驗收會議上發現這個指標根本定義不出來。
直接給結論:生成式 AI 的導入有三個結構性差異。沒有標註資料這個前置工程、成效是機率分布,同一題問兩次答案會不同、成本是每個月變動的 token 費用。這三件事會反過來改變你的專案怎麼排、合約怎麼寫、驗收條件怎麼定。
這篇是企業 AI 導入完整指南的生成式專章:先用一張表看清楚差在哪,接著是六個已經被驗證的企業場景、token 成本怎麼估、資料外流的四條防線,最後是十二週的落地路徑。
生成式 AI 導入跟傳統 AI 專案差在哪
先看這張表,後面每一段都是在展開它。
面向 | 傳統 AI 專案(預測、分類、影像) | 生成式 AI 導入 | 對你的實際影響 |
|---|---|---|---|
前置資料 | 要標註資料,常佔專案 40% 以上工時 | 多半不用標註,改成整理知識來源與提示詞 | 起跑快很多,兩週就能看到第一版 |
成效衡量 | 準確率、召回率,數字固定 | 輸出品質是機率分布,同一題兩次答案不同 | 驗收要改成抽樣人工評分,不能寫「準確率 95%」 |
成本結構 | 一次性建置費 + 少量維運 | 建置費較低,但每月 token 費隨用量成長 | 預算要編三年變動成本,不是一次性資本支出 |
失敗模式 | 模型跑不準,看得出來 | 模型講得很順但講錯,看不出來 | 一定要設人工覆核關卡 |
上線後維護 | 資料漂移時重訓練 | 模型版本更新、提示詞退化、供應商改價 | 要有人固定回歸測試,不能上線就丟著 |
適合的第一個案子 | 有大量歷史資料的預測題 | 有大量重複文字工作的流程 | 從文件、客服、報價這三類先找 |
成效衡量那一列是最多專案死掉的地方。McKinsey 的 State of AI 調查顯示超過八成的受訪企業還看不到生成式 AI 對整體獲利的可衡量貢獻,而其中很大一部分的原因是他們一開始就沒有定義出可以衡量的東西。AI 導入的 ROI 怎麼算那篇把五個常見的估算陷阱都列出來了。
六個已經被驗證的企業場景,各自投多少、回收什麼
先講原則:值得做的場景有一個共同特徵,就是這件事現在有人在做、做得很煩、而且做錯了看得出來。三個條件缺一個,回收就會變得很難算。
場景 | 取代掉什麼 | 建置投入 | 每月變動成本 | 回收訊號 |
|---|---|---|---|---|
文件摘要與整理 | 人工讀長文件寫重點 | 10 到 30 萬 | 3 千到 2 萬 | 每份文件處理時間,從 40 分鐘到 5 分鐘 |
客服回覆草稿 | 客服從零打字 | 20 到 60 萬 | 5 千到 5 萬 | 首次回覆時間、客服人均處理件數 |
報價與提案生成 | 業務手動組報價與說明 | 30 到 90 萬 | 3 千到 3 萬 | 報價產出時間、漏報項目次數 |
合約與文件審閱 | 法務或主管逐條看 | 30 到 80 萬 | 1 萬到 6 萬 | 審閱輪次、抓出的風險條款數 |
內部知識庫問答 | 同事互相問、翻舊檔案 | 40 到 120 萬 | 1 萬到 8 萬 | 重複提問次數下降、新人上手天數 |
程式輔助與測試 | 工程師寫樣板程式與測試 | 10 到 30 萬 | 每人每月 2 千到 8 千 | 功能交付週期、測試覆蓋率 |
這六個裡面,投報率最穩定的是第一與第三項。原因很單純:它們的產出有明確的對照組(人做要多久),錯誤也看得出來。我們自己的內部報價流程就是走這條,五個節點、三次模型呼叫、兩層 fallback,完整的 SOP 寫在我們公司怎麼跑出 20+ AI 流程:內部報價自動化那篇。
最容易高估的是內部知識庫問答。它聽起來最誘人,但它同時是六個場景裡資料整理成本最高、品質最難穩定的一個。文件本身沒整理過就先做問答,結果通常是「答得很順、但答案是三年前的舊版流程」。五個高投報場景的完整對比可以看中小企業導入 AI 系統的 5 個高 ROI 場景。
文件摘要:最好入門的一個
找一種你們每週都要讀、而且格式固定的文件(法規函釋、供應商規格書、客訴紀錄),先做這一種就好。它的好處是對照組很明確:現在一個人讀完寫重點要幾分鐘,算得出來。上線兩週就能拿出數字給老闆看,這對後續爭取預算很重要。常見的錯誤是一開始就想做「所有文件都能問」,那會直接跳進知識庫問答的難度,成功率低很多。
客服回覆草稿:把「回覆」跟「送出」分開
這個場景會成功的關鍵在於定位。讓 AI 產草稿、客服按下送出,跟讓 AI 直接回客戶,是兩件完全不同風險等級的事。前者三個月就能上線,後者需要六個月以上的規則與例外處理。第一次做請選前者,讓客服變成審核者而不是打字員,這樣連內部抵抗都會少很多。
報價與提案生成:投報最穩、但最吃流程
報價之所以適合,是因為它同時滿足「重複」「規則明確」「錯了看得出來」三個條件。難點在前置:公司的計價邏輯常常只存在幾個資深業務的腦子裡,要先把它挖出來寫成規則。這一步的工作量通常比接模型還大,但做完之後就算不上 AI,光是把規則整理清楚本身就已經在省時間了。
合約審閱與知識庫問答:先問資料整理過沒有
這兩個場景的成敗幾乎完全取決於文件本身的狀態。如果公司的合約範本散在五個資料夾、有三個版本在流通,先花兩個月整理文件的投報率會比接 AI 高。整理完之後再接,效果才穩得住。
程式輔助:唯一可以直接按人頭算的一個
開發團隊的 AI 輔助工具是六個場景裡最好估的:按人頭訂閱、效果每個工程師自己感受得到、要不要續訂很容易決定。如果你的公司有內部開發人力,這通常是最快看到回報的一項。
token 成本怎麼估,一張試算表就夠
先講算法,再講數字。token 成本 = (每次任務的輸入 tokens × 輸入單價 + 輸出 tokens × 輸出單價)× 每月次數。中文大約 1 個字等於 1 到 1.5 個 token,所以一份 3,000 字的文件大概是 4,000 個 token 左右。
下面用一個常見設定試算:文件摘要場景,每份輸入 8,000 tokens、輸出 800 tokens,一個月跑 2,000 份。單價欄是每百萬 token 的價格,試算欄是這個用量下的月費。
模型級距 | 輸入單價(每百萬 token) | 輸出單價(每百萬 token) | 輸入 1,600 萬 tokens 月費 | 輸出 160 萬 tokens 月費 | 月合計 |
|---|---|---|---|---|---|
小型快速模型 | 約 US$1 | 約 US$5 | US$16 | US$8 | 約 US$24 |
中階通用模型 | 約 US$3 | 約 US$15 | US$48 | US$24 | 約 US$72 |
旗艦模型 | 約 US$15 | 約 US$75 | US$240 | US$120 | 約 US$360 |
算式攤開來看:輸入 8,000 tokens × 2,000 份 = 1,600 萬 tokens,以中階模型每百萬 US$3 計算,就是 16 × 3 = US$48。數字本身會隨供應商改價浮動,但這張表要傳達的重點是量級:多數中小企業的第一個生成式 AI 場景,月費落在幾十到幾百美金,遠低於大家想像中的「AI 很貴」。真正貴的是建置與維護的人力。
⚠️編預算時最常漏掉的三筆
第一是失敗重試:實務上 5% 到 15% 的請求會因為格式不符或超時而重跑,預算要乘 1.15。第二是開發期間的測試用量,通常是正式上線後一個月用量的 2 到 5 倍。第三是模型升級:新版模型出來時,舊的提示詞往往要重調,這是一筆固定會發生的人力成本。
資料外流的四條防線
這是老闆最該花時間的一段。生成式 AI 的資料風險跟傳統系統不同,因為外流的入口是「員工自己把資料貼進去」,而不是被駭。資策會科法所的生成式 AI 工具營業秘密管理建議把這件事講得很清楚:三星曾因為工程師把半導體原始碼貼進 ChatGPT 除錯,直接禁用整個工具。禁用是一種選擇,但它通常只會讓員工改用手機偷偷用。
防線 | 解決什麼 | 怎麼做 | 成本量級 |
|---|---|---|---|
不上傳原文 | 最常見的外流路徑 | 在系統層先做去識別化與遮罩,只送出處理過的內容 | 開發時多 10% 到 20% 工時 |
用企業版或私有部署 | 資料被拿去訓練 | 改用有簽 DPA、承諾不訓練的企業方案;高敏感資料走自架模型 | 企業版每人每月數百到數千元 |
資料外洩防護與存取控制 | 跨部門的資料越界 | 先做資料分級,再決定哪一級可以進 AI 流程 | 主要是內部盤點的人力 |
稽核日誌 | 出事後查不出來 | 記錄誰、什麼時候、送了什麼進去、拿回什麼 | 開發時多 5% 工時 |
四條裡面,第三條要先做。資料還沒分級就談防護,等於在還不知道哪些是機密的情況下保護機密。60 天的資料權限盤點 SOP 在中小企業老闆 AI 導入前資料權限盤點那篇有完整路線圖;如果公司同時在做資安認證,CNS 27001 條文白話對照表可以直接對照到控制措施編號。
🚨先把「員工現在到底在用什麼」查清楚
多數公司在做防線之前,都低估了一件事:員工已經在用了。先發一份匿名問卷問「你最近三個月用過哪些 AI 工具處理公司資料」,答案通常會讓人嚇一跳。禁用之前先給替代方案,否則只是把可見的風險變成不可見的風險。
還有一個常被忽略的風險來源是模型的輸出端。員工把 AI 產出的內容直接貼進客戶信件或對外文件,如果內容裡混進了另一個客戶的資料、或是模型自己編出來的條款,那同樣是一次外洩。所以覆核關卡要放在輸出端,不能只管輸入端。實務上的做法是:對外的內容一律經人工按過送出鍵,對內的內容才允許自動流轉。這條規則寫進 SOP 的成本是零,但它擋掉的是最難補救的那一類事故。
十二週落地路徑
十二週是我們觀察下來比較合理的第一個週期:足夠做出一個真的在用的流程,又短到還沒開始政治化。
階段 | 做什麼 | 交付什麼 | 這階段最容易死在哪 |
|---|---|---|---|
第 1 到 2 週 | 選一個場景、盤點會用到的資料分級 | 場景說明書 + 資料清單 | 同時選三個場景,結果三個都做不完 |
第 3 到 4 週 | 人工用現成工具把流程跑一遍,記錄每一步 | 可行性判斷 + 提示詞初版 | 跳過這步直接開發,規格全靠想像 |
第 5 到 8 週 | 做成系統,加上人工覆核關卡與稽核日誌 | 可用的第一版 + 抽樣評分表 | 沒設覆核關卡,錯誤直接流到客戶端 |
第 9 到 10 週 | 給一個小團隊真的用,收集抱怨 | 使用紀錄 + 問題清單 | 上線給全公司,一出事全公司都不信任它 |
第 11 到 12 週 | 量測前後差異,決定擴大或收掉 | 投報數字 + 下一季計畫 | 沒有量測基準,最後靠感覺決定 |
第 3 到 4 週那段是最多人想跳過、也最不該跳過的。先用現成工具人工跑一遍,你才會知道這個流程真正的難點在哪,以及模型在哪些輸入上會出錯。跳過它直接進開發的專案,有很高比例會卡在 POC 出不去,企業 AI 從 POC 到 production 的路線圖那篇把六個常見死因整理得很清楚。
驗收條件怎麼寫,才不會在會議上吵起來
這是生成式 AI 專案跟廠商最容易翻臉的一段。傳統系統的驗收是「功能有沒有做出來」,生成式 AI 的驗收是「輸出夠不夠好」,而「夠好」如果沒有事先定義,驗收會議就會變成互相說服。
驗收項目 | 不要這樣寫 | 改成這樣寫 |
|---|---|---|
輸出品質 | 準確率達 95% | 隨機抽 100 筆,由雙方指定的一位業務人員按三級評分,可用比例達 80% 以上 |
回應時間 | 系統反應快速 | 第 95 百分位回應時間在 15 秒內 |
失敗處理 | 系統需穩定 | 呼叫失敗時自動重試兩次,仍失敗則寫入待辦清單並通知窗口 |
資料安全 | 符合資安規範 | 所有送出內容留存稽核日誌 12 個月,欄位包含使用者、時間、送出摘要 |
交付範圍 | 含提示詞調整 | 上線後 3 個月內含 2 輪提示詞調整,超出以人天計價,單價 NT$X |
抽樣評分那一列是核心。它把主觀的「好不好」變成可以重複執行的程序,而且雙方在簽約時就會被迫討論「什麼算可用」。這個討論本身往往就會讓需求收斂一大半。
什麼情況下這件事現在不該做
這一段刻意寫反面。並非每家公司現在都該導入生成式 AI,以下五個訊號出現任兩個,建議先把地基補好。
- 公司內部沒有人能說清楚某個流程現在是怎麼跑的。流程講不清楚,AI 也接不進去。
- 資料散在個人電腦與 LINE 群組,沒有共用的檔案位置。
- 找不到一個願意花每週三小時盯這件事的內部窗口。
- 老闆期待的是「導入之後可以少請兩個人」,而部門主管完全不知道這回事。
- 上一個資訊系統專案是三年前導入的,到現在還有一半的人在用 Excel 繞過它。
第四點特別要說。把人力節省當成對外理由,會讓第一線員工在專案一開始就站到對立面,然後你會發現沒有人願意提供流程細節。五個「還不該導入」的訊號與組織盤點做法,你的公司還不該導入 AI 的 5 個訊號那篇有更完整的判斷框架;十間公司的實際失敗原因則在AI 導入失敗的 10 間公司。
下一步怎麼走
如果你已經選定一個場景,最有效率的做法是先做第 3 到 4 週那件事:找兩個同事,用現成工具把流程手動跑十次,把每次的輸入輸出貼進同一份表。跑完你會很清楚這件事值不值得做成系統。
跑完之後如果判斷要做成系統,可以把那份表丟過來,我們陪你看一下哪幾段值得寫成程式、哪幾段留給人做比較划算。恆遠做的是AI 系統開發與導入,需要先釐清顧問與系統商怎麼分工的話,AI 顧問 vs AI 系統開發商分工指南那篇有報價區間與合約紅線。
生成式 AI 場景與 token 成本試算表
上面的六場景投入回收表與 token 試算公式正在整理成一份可以直接改數字的試算表。完成之前,可以先用 AI 導入顧問費用怎麼算 那篇的計費模式對照表估預算。
ℹ️我們做過這件事
恆遠自己每天就在跑 20+ 個 AI 流程,這篇講的做法都是我們實際跑過、確認真的省到時間之後才寫的。客戶端的案子例如 AI 智慧客服系統 與 Meeting King 會議紀錄系統,共同點都是先把一段重複的文字工作切出來,其他部分不動。看到這裡,如果你也在想「我們公司哪一段流程適合先做」,我們很樂意 聽你聊聊現在的實際情況,一起看看從哪一塊開始最划算。
ℹ️我們怎麼看
生成式 AI 的企業導入正在從「買一個工具」轉向「改一段流程」。三年後真正拉開差距的,會是那些把 AI 當成工程方法、有版本控管、有回歸測試、有稽核日誌的團隊,而不是買了最多套 AI 訂閱的公司。我們的取捨是把力氣放在流程與介接這一層,模型本身交給供應商去競爭。對老闆的具體意義是:評估任何一個生成式 AI 提案時,先問「這個流程現在誰在做、做多久、做錯了誰發現」。這三題答得出來,這個案子才有得談。
Q生成式 AI 導入的預算大概要抓多少?
第一個場景的合理範圍是建置 10 到 90 萬,加上每月幾千到幾萬的 token 與訂閱費用。真正需要注意的是三年總持有成本:建置只佔其中一部分,後續的提示詞維護、模型升級調整、人工覆核人力都要編進去。比較穩的抓法是「建置費 × 1.5 = 首三年的維護預算」。
Q我們公司資料很敏感,可以導入生成式 AI 嗎?
可以,但要先做資料分級。實務上的做法是把資料分成三級:可以直接送進外部模型的、要先去識別化才能送的、只能在自架環境處理的。分完級之後你會發現,多數重複性文字工作用到的其實是第一級資料,而第三級的量往往比想像中小很多。
Q要用哪一家的模型?會不會綁死在單一供應商?
建議在系統設計時就把模型呼叫抽成一層介面,讓底層模型可以換。這件事在開發時多花的成本很低,但可以避免供應商改價或停用某個版本時整條流程停擺。選型階段不必糾結哪家最強,把注意力放在資料處理協議與服務水準承諾上。
Q導入之後可以少請幾個人?
以目前的實務經驗,第一個場景通常省下的是「時間」而不是「人頭」。把節省的工時換算成人力是合理的估算方式,但把它當成專案的對外目標,幾乎一定會遇到內部抵抗。比較務實的說法是把省下的時間拿去做原本沒時間做的事。
Q怎麼判斷一家 AI 導入廠商靠不靠譜?
問三個問題:第一,你們自己內部有沒有在用生成式 AI?請舉一個具體流程。第二,這個案子的驗收條件怎麼定?答不出抽樣評分方式的要小心。第三,模型升級或供應商改價的時候,維護怎麼算錢?這三題都能具體回答的,通常真的做過。
AUTHOR
恆遠數位編輯團隊
想了解更多?看看我們的相關服務
相關文章

AI 導入顧問費用怎麼算?5 種計費模式、3 個議價點與外聘成本結構

中小企業 AI vendor stack 整併決策 SOP:從 15 家 point solution 到 3-4 anchor 供應商,6 個整併訊號、5 條合約紅線、4 個垂直整合陷阱

我們公司怎麼跑出 20+ AI 流程?系列第 3 篇:客戶服務分流自動化 SOP,3 層分流、4 個信心分數、2 條人類接手紅線

我們公司怎麼跑出 20+ AI 流程?系列第 4 篇:每日部落格 SEO 寫稿自動化 SOP,4 階段 pipeline、5 條品質紅線、3 個跳過寫稿的判斷條件

建築業 AI 工作流完整指南:從投標、BIM 協作、施工日誌到驗收,中小型建築事務所 4 條落地路徑與 5 條合約紅線

留言(0)
尚無留言,成為第一個留言的人吧!