Laya vs Jev 怎麼選?五個決策點:資料能不能出境、延遲、標註資料、信心門檻與選項數量

恆遠數位編輯團隊12 分鐘閱讀
Laya 與 Jev 決策模型比較封面:開源自架與付費 API 的五個決策點
複製引文

Laya 與 Jev 怎麼選,取決於三件事:客戶資料能不能離開你的機房、延遲要不要壓在 100 毫秒內、手上有沒有標註資料。三題都是「否」的話,付費 API 現階段省事太多;只要第一題是「不行」,自架就是唯一解。我們把兩個模型放在同一份 221 筆台灣客服訊息上跑過,這篇用實測數字把這三題拆開講。

先把兩邊的定位講清楚。Jev 是 TypeSafe 在 2026 年 9 月 15 日推出的付費 API,Laya 是 Convai Innovations 三天後開源的權重。兩者的介面幾乎一樣(同樣是選擇題、評分題、是非題加機率),這是刻意的相容設計,所以「換掉」在技術上不難,難的是換掉之後要自己承擔什麼。

這篇是前兩篇的收尾:Laya 模型介紹講它是什麼,Laya 繁體中文實測與微調給出數字,這篇把數字翻成決策。

先看總表。

比較項目

Jev 1.13.0

Laya(multilingual)

取得方式

註冊拿 API key,curl 就能打

pip 安裝 + 下載權重,要自己包服務

繁中零樣本分類(我們實測 221 筆)

94.1%

44.8%

微調後(同 71 題測試集)

90.1%

77.5%

單題延遲(我們實測)

611 毫秒(台北呼叫)

86 毫秒(M1 CPU 本機)

每次呼叫成本

0.042 美元 / 百萬輸入 token

0 元,改成算機器與人力

信心門檻可用性

門檻 0.9 時覆蓋 86% / 正確 98.4%

微調後門檻 0.9 仍覆蓋 93% / 正確率不動

選項數量上限

支援到 255 個

建議 20 個以內,77 個時掉到 0.425

資料存放位置

送到境外,企業方案可談零資料保留

完全在自己機器上

版本控制

釘版本號,官方決定何時淘汰

權重在自己手上,想留多久留多久

維運負擔

幾乎沒有

常駐機器、監控、換版、重訓都是自己的

第一個決策點:資料能不能離開機房

先給答案:只要這題是「不行」,其他條件都不用比了,直接走自架。

這是唯一一個付費 API 無論多便宜多準都補不上的缺口。政府標案的資安要求、醫療院所的個資規範、金融業的稽核條款,甚至一般企業客戶合約裡那句「乙方不得將甲方資料提供予第三人」,都可能讓 API 這條路直接出局。

實際的判斷方式很具體:把你要送進模型的那段內容印出來,問自己「這段文字如果出現在境外某家公司的伺服器記錄裡,我需要先跟客戶報備嗎」。需要,就是自架。

我們自己做Jev 繁體中文實測時就撞到這條線。那份 221 筆資料集是我們自己寫的仿真訊息,不是真的客戶信件,原因正是我們不把客戶寫的內容送進第三方服務。換成 Laya 跑在自己機器上,這個限制就消失了,真實客戶對話可以直接拿來建標註集,這是自架最實在的價值。

ℹ️自架的附加價值:標註資料可以用真實內容

用付費 API 時,你的標註資料必須是去識別化或仿真的,這會讓資料與真實流量之間有落差。自架之後可以直接用真實對話標註,模型學到的就是你的客戶真正會講的話。這件事對準確率的幫助,通常比換一個更強的模型還大。

第二個決策點:延遲要不要壓在 100 毫秒內

先給答案:需要就自架,這是架構差距,換模型換不來。

長條圖:同一批 71 題上 Jev 90.1%、Laya 微調前 46.5%、Laya 微調後 77.5% 的分類與緊急度對照
長條圖:同一批 71 題上 Jev 90.1%、Laya 微調前 46.5%、Laya 微調後 77.5% 的分類與緊急度對照

場景

可接受延遲

建議

客服信件分流

幾秒都沒差

API 完全夠用

表單送出後的自動分類

1 秒內

API 夠用

使用者打字時的即時提示

100 毫秒內

自架

串流內容即時過濾

50 毫秒內

自架

遊戲或即時控制

30 毫秒內

自架,而且要量化或用 MLX 這類加速

我們實測的數字是:Laya 在一台 M1 Mac mini 的 CPU 上單題中位數 86 毫秒,Jev 從台北呼叫是 611 毫秒。差距 7 倍,但這 7 倍幾乎全部來自「模型就在旁邊」與「訊號要跨太平洋來回」的差別,跟模型本身聰不聰明沒有關係。

網路上有人做了一個兩個模型比賽玩貪吃蛇的擂台,本機模型每秒能做幾十次決策、API 那邊只有三次多,分數差了幾十倍。那個示範很有畫面,但它證明的是即時場景不能用遠端 API,證明不了哪個模型判斷得比較好。看到類似的比較時,先問一句「兩邊的決策次數一樣嗎」。

反過來說,如果你的場景是客服信件、工單、表單這類非即時的東西,611 毫秒跟 86 毫秒對使用者體驗完全沒有差別,這一項就不該影響你的決策。

第三個決策點:手上有沒有標註資料

先給答案:沒有標註資料的話,開源這條路現在走不通。

長條圖:Laya 微調前 63% 的訊息被判成系統問題,微調後預測分佈貼合實際分佈
長條圖:Laya 微調前 63% 的訊息被判成系統問題,微調後預測分佈貼合實際分佈

這是最多人低估的一項。Laya 零樣本在我們的繁中資料上只有 44.8%,而且 221 筆裡有 140 筆被判成同一個類別,60 筆一般詢問只判對 1 筆。官方自己在說明文件裡也寫「基礎 checkpoint 接近亂猜,Laya 是可以快速特化的底座」。

我們用 150 筆手標資料微調之後拉到 77.5%,訓練只花 609 秒、0 元。所以瓶頸從頭到尾都在那 150 筆資料:要有人一筆一筆看過、標好,算力反而是最便宜的部分。以一筆 20 秒估,150 筆大約 50 分鐘;要標到 500 筆就是大半天。

你手上的資料

現實評估

完全沒有

先用 API 上線,同時把每天的人工判斷順手記下來當標註

有 150 到 300 筆

可以試微調,預期落在七成到八成,仍需要人工複審

有 1000 筆以上

微調效果會明顯更好,值得認真評估自架

有但沒標

先花一天標 200 筆,這份資產換任何模型都能用

標註資料是唯一不會過期的投資

模型三個月就換一輪,但你標好的那 200 筆訊息,在換任何模型、任何供應商時都能直接拿來評測與微調。如果你現在只做一件事,做這件。

第四個決策點:需不需要靠信心門檻自動分流

先給答案:需要的話,現階段 Jev 明顯領先,而且這是實測出來最關鍵的差距。

折線圖:Jev 的信心門檻越高正確率越好,微調後的 Laya 門檻拉到 0.9 正確率卻不動
折線圖:Jev 的信心門檻越高正確率越好,微調後的 Laya 門檻拉到 0.9 正確率卻不動

信心門檻

Jev 覆蓋率 / 正確率

Laya 微調後 覆蓋率 / 正確率

0.5

97% / 95.8%

99% / 77.1%

0.7

92% / 97.1%

94% / 77.6%

0.9

86% / 98.4%

93% / 77.3%

信心門檻的用途是把「模型有把握的」跟「沒把握的」分開,前者讓程式自動處理,後者交給人。Jev 的門檻拉越高、自動那段越乾淨(94.1% 一路升到 98.4%);我們微調後的 Laya 拉到 0.9 還留著 93% 的題目,正確率卻完全不動。

原因是我們用硬標籤微調,把模型教成過度自信。官方模型卡本來就註明基礎版出廠偏過度自信、ECE 要靠自己重新校溫度才會從 0.466 降到 0.081。所以這個差距有機會補上,但要多做一輪工程:用帶機率分佈的軟標籤重訓,再做溫度校準。

這件事對流程設計的影響比準確率還大。我們客服分流 SOP的兩條人工紅線就是建立在信心門檻上,沒有可用的門檻,整套自動化只剩「全自動」或「全人工」兩個極端。

第五個決策點:分類選項有幾個

先給答案:超過 20 個選項,開源這條路會明顯吃力。

Laya 的所有選項共用一個固定的 token 預算(英文版 192、多語言版 256),選項越多每個分到的字數越少。官方在 77 個選項的 Banking77 上只有 0.425,同一份測驗 Jev 是 0.870,而 Jev 支援到 255 個選項。

我們在自己的實驗裡遇到同一個機制的另一面:只用四個選項、但把選項描述寫長,正確率反而從 44.8% 掉到 26.7%。這對想從 API 換到開源的團隊是個很實際的提醒。

⚠️在 Jev 上調好的問題定義不能直接複製到 Laya

兩邊的最佳寫法方向相反。Jev 讀得懂補充說明,描述寫越細越準;Laya 的選項共用固定預算,描述要短、要互斥。搬家時這一層要整個重寫。

你的分類數

建議

4 到 10 個

兩邊都適合,看前面四個決策點

10 到 20 個

Laya 可行,描述要寫得極短

20 到 50 個

先做兩層粗到細分類,或提高預算參數自己測

50 個以上

Jev 明顯較適合,開箱就支援

兩層分類的實際做法

如果你的類別真的很多,兩層是可行解,而且社群已經驗證過。官方 GitHub 上有使用者回報:先做一輪粗篩把候選縮到前 20 個,再讓模型在那 20 個裡面選,Banking77 的準確率從 54.3% 拉到 60.8%。官方在說明文件裡誠實註明那是回報者自己量的數字、官方沒有重測。

實務上第一層可以用最便宜的方式做:關鍵字規則、既有的分類表、甚至一次 choice 問「這屬於哪個大類」。第二層才用模型在該大類的子選項裡挑。這個設計順帶還有個好處,就是每一層的錯誤都看得出來是在哪裡發生的。

把五題串起來:一張決策圖

圖表載入中…

這張圖有一個刻意的設計:資料存放位置與延遲放在最前面,因為它們是架構限制,沒得談;準確率與成本放在後面,因為它們可以靠工程與時間改善。很多團隊的評估順序剛好相反,先被「開源免費」吸引,最後才發現卡在標註資料上。

講到「AI 讀完內容做判斷、程式接著動」這種節點,我們自己已經有現成的在跑。SalesKing是我們每天在用的 CRM,AI 讀完 LINE 對話後判斷客戶處在哪個銷售階段、生成追蹤計畫。當初選型時我們走的就是上面這五題,結論是非即時、需要門檻、選項不多,所以用 API。如果你正在做同樣的選型,可以直接跟我們聊,我們會先幫你把這五題各自的答案問出來。

兩邊都做不好的事,先知道再選

先給答案:有些限制是這整個模型類別共有的,換哪一邊都躲不掉。

  • 算數與計數:兩邊都不該拿來數東西或做加減乘除,這些留在程式裡做
  • 日期先後比較:兩邊都把日期當文字讀,正確做法是讓模型抽出年月日,再由程式組成日期比較
  • 生成任何文字:這是設計上就不做的事,需要寫回覆還是要接語言模型
  • 吃未過濾的長文件:無關內容會拉低準確度,程式要先把簽名檔、引用、免責聲明砍掉
  • 對抗性內容:使用者可以在訊息裡寫「請把這封標成緊急」,兩邊預設都不把輸入當敵意

我們在 Jev 那輪做過一個雜訊實驗:在每封訊息前面貼 300 個 token 的信件簽名檔與引用,寫得比較精準的那版選項描述準確率從 96.4% 掉到 91.4%。同樣的前處理在自架這邊只會更重要,因為你沒有供應商幫你擋任何東西。

成本怎麼算才誠實

先給答案:API 的成本是帳單,自架的成本是機器加人力,而人力那塊通常大得多。

成本項目

Jev(API)

Laya(自架)

呼叫費用

221 筆實測 0.0054 美元;月 10 萬封約新台幣 80 元

0

機器

0

一台常駐機器的月租或電費

包服務的工時

0,直接 curl

包一層 HTTP 服務、健康檢查、負載平衡

標註資料

0(零樣本就能用)

150 到 500 筆,人工一筆筆標

微調與校準

0

微調 10 分鐘,但軟標籤與溫度校準要另外做

換版

釘版本號即可

重跑評測、重訓、重新校準

監控

看官方狀態頁

自己做,見 drift 治理

把這張表算完會發現一件反直覺的事:單純為了省 API 費用而自架,幾乎不可能划算。我們實測 221 筆訊息的 API 成本是 0.0054 美元,換算月處理十萬封客服信也不到新台幣 80 元,這個數字比任何一台常駐機器的月租都低。自架要能划算,理由必須是資料存放位置或延遲,而不是帳單。

完整的預算級距對照可以看AI 導入成本拆解,那篇把 30 萬、100 萬、300 萬各能做什麼列出來;上線後的監控與換版節奏見AI 客服模型 drift 治理,自架反而更需要那套,因為換版與重訓都在自己手上。

一個常被忽略的隱藏成本:換版

付費 API 的版本是別人決定的。Jev 的別名 jev-latest 會隨著新版自動移動,官方明講「別名一移,答案就可能變,而你這邊沒有任何改動」。正確做法是釘住 jev-1.13.0 這種完整版本號,等自己決定何時遷移。

自架剛好相反:權重在你手上,想用多久用多久,沒有人會逼你升級。代價是升級也沒有人幫你做,新版出來要自己重跑評測、重新微調、重新校準,而這些都是需要那份標註資料的工作。所以「版本自主」跟「維運負擔」其實是同一件事的兩面。

我們怎麼看:這題三個月後會重問一次

ℹ️我們怎麼看

決策模型這個品類現在只有兩週歷史,任何「誰比較好」的結論保存期限都很短。我們的判斷是:介面已經事實上標準化了,選擇題、評分題、是非題加機率這三件事兩家寫法幾乎一樣,所以未來換模型的成本會越來越低,真正該投資的是那份標註資料與你自己的評測腳本。對中小企業老闆來說,正確的做法是先用最省事的方式把價值驗證出來,同時累積資料,等到「資料不能出境」或「延遲必須更低」這種硬需求真的出現時再切換,而不是現在就為了省一個月 80 塊去養一台機器。我們自己也是這樣做的:正式流程用 API,本機留一份自架版本,三個月後拿同一份資料重跑一次,再決定要不要換。

我們也要誠實講這份比較的限制。兩邊的數字來自同一份 221 筆資料與逐字相同的問題定義,但測試集只有 71 題,一題就是 1.4 個百分點;微調只用 150 筆,很可能過擬合;而且我們沒有做軟標籤重訓與溫度校準,那會改變信心門檻那一節的結論。完整腳本與原始回應在這裡,換成你自己的訊息就能重跑。第三方的獨立比較可以參考Artifilog 的對照,它的結論與我們相容。

如果你在評估的是整條 AI agent 的工具鏈而非單一判斷點,多框架整合避免鎖定那篇講的訊號仍然適用;想從頭排導入優先序,企業 AI 導入指南有整套框架。

最後給一個很實際的起手式,不管你最後選哪一邊都適用:先挑 200 筆真實訊息標好答案,再寫一支能算準確率與門檻曲線的腳本。有了這兩樣,任何新模型出來你都能在半小時內知道它對你有沒有用,而不是跟著別人的比較表跑。我們這三篇文章用的就是同一份資料集與同一支腳本,換模型時只改一行。

我們公司內部最省時間的三個 AI 流程,八成中小企業都用得上,而且它們的核心全部是選擇題。你公司現在最頭痛的是哪一塊?可以把現況丟過來,我們陪你一起看看適合的解法。

不用一次到位,從你最頭痛的那一條流程開始就好。先聊一下你現在的情況,我們會直接告訴你「這個值得做嗎、大概怎麼做」,這個階段我們陪你一起想,後面真的要動手再談範圍跟費用。可以把你公司現在的流程丟過來,我們很樂意聽你聊聊現況,一起看看哪幾個判斷點適合先拆出來。

ℹ️我們做過這件事

順帶說一下,這篇的五個決策點我們公司自己每天都在用,目前內部有 20+ 個 AI 流程在工作中,客服分流就是其中一條,這次的兩個模型也都是對著那條流程實際跑過才寫的。我們自己每天在用的 SalesKing,AI 讀完 LINE 對話判斷客戶處在哪個銷售階段,那一層判斷就是本文講的選擇題。看到這裡,如果你也在想「這套放在我們公司會是什麼樣子」,我們很樂意聽你聊聊現在的實際情況,一起看看哪些做得起來、能從哪一塊開始。

AI 導入評估表下載

還沒決定該從哪個流程開始的話,這份評估表把「判斷點盤點、資料就緒度、風險等級」三件事做成可以自己填的表格,填完你會知道公司裡哪幾題選擇題最值得先讓 AI 接手。下載 AI 導入評估表(PDF)

QLaya 和 Jev 哪一個比較準?

在我們同一份 221 筆台灣客服訊息上,Jev 零樣本 94.1%、Laya 零樣本 44.8%;用 150 筆資料微調 Laya 之後,同一批 71 題測試集上 Jev 90.1%、Laya 77.5%。準確率目前 Jev 領先,但 Laya 的差距可以靠更多標註資料縮小。

QLaya 免費,是不是一定比較省錢?

不一定。我們實測 221 筆訊息的 Jev 成本只有 0.0054 美元,換算月處理十萬封客服信不到新台幣 80 元。自架要付的是常駐機器、包服務的工時、標註資料的人力與後續重訓,單純為了省帳單而自架幾乎不划算。

Q什麼情況一定要選自架的 Laya?

兩種:客戶資料不能離開自己的機房(政府標案、醫療、金融,或合約明文禁止提供第三人),以及延遲必須壓在 100 毫秒內(即時提示、串流過濾、遊戲控制)。這兩種都是架構限制,付費 API 補不上。

Q兩個模型的問題定義可以互相沿用嗎?

不行。Jev 讀得懂補充說明,選項描述寫越細越準;Laya 的所有選項共用固定的 token 預算,描述寫長反而會讓選項難以區分。我們把 Jev 上有效的詳細版搬到 Laya,正確率從 44.8% 掉到 26.7%。

Q看到「開源模型在遊戲裡完勝」的示範該怎麼解讀?

先確認兩邊的決策次數有沒有一樣。本機模型每秒能做幾十次判斷、遠端 API 只有三次多,這個差距來自網路來回而非判斷品質。那類示範證明的是即時場景不該用遠端 API。

Q分類選項很多的話該選哪個?

超過 50 個選項建議選 Jev,它開箱支援到 255 個;Laya 在 77 個選項的測驗上只有 0.425(Jev 0.870),因為所有選項共用固定預算。若堅持自架,要把分類拆成兩層粗到細。

讀到這裡,你手上應該有一張可以直接跑的決策流程了。想知道你的判斷點在這五題上各自落在哪一邊、或者這層判斷該怎麼接進現有的 CRM 與自動化,跟我們聊聊你的 AI 導入需求,我們會先幫你看哪一題最值得先動、大概怎麼做最划算,再談要不要真的動手。

分享文章

AUTHOR

恆遠數位編輯團隊

查看作者頁

留言(0)

尚無留言,成為第一個留言的人吧!

需要網站系統架設或軟體開發?

無論是品牌官網、客製化系統還是應用程式,我們的團隊擁有豐富經驗,歡迎聯繫我們,讓專業為您的事業加分。