答案正確,跟答案有用,是兩回事

EdWealth Team · Published Sep 4, 2026
答案正確,跟答案有用,是兩回事

三個 AI 系統回答了同樣的 106 條個人理財問題。單看事實準確度,它們幾乎並駕齊驅——五分制之下分別是 3.99、3.72 和 3.65,差距約三分之一分。但當評分者要挑出「哪個答案我真正想要」,其中一個被選中的次數,接近另外兩個的三倍。

有趣的正是這道落差。既然三者答得同樣正確,勝出的那個就不是靠「答得對」贏。下一個直覺猜測是它寫得比較好——但表達力恰恰是三者最接近的一項,其中一組對比的差距甚至未達統計顯著。

那麼被獎勵的,究竟是什麼?是第三種特質。MoneyBench 研究報告(全文為英文)對它的定義異常精準:一個有用的答案,是能夠支撐它所回應的那個決定——它指出與問題相關的數字、說明這些數字如何互相作用,並講清楚它們對眼前這個選擇意味著什麼。

聽起來很溫和,實際上卻是全部分野所在——而且一旦你看得見它,就可以用它來檢驗任何一個 AI 給你的理財答案。

這是三篇系列的第二篇。第一篇講述這場測試如何設計、以及發現了什麼。

一個答案可以擅長的三件事

MoneyBench 為每個答案在三個獨立維度上評分,各為 1 至 5 分,而權重在任何評分開始之前就已經固定——準確度 0.45、有用度 0.35、表達力 0.20。事先訂好權重很重要:它杜絕了看見結果之後,再去找出一條「剛好會贏」的公式。

用日常語言講,三個維度是:

準確度——事實對不對?供款上限是不是真正的上限,稅務處理是不是真正的處理方式。

有用度——這個答案有沒有替你做好「決定」那部分的工作?問的不是「這是真的嗎」,而是「我現在可以作出選擇了嗎」。

表達力——讀起來舒不舒服?句子清楚、次序合理、沒有廢話。

用餐廳來比喻,分野就很明顯。準確度是碟裡的東西跟餐牌寫的是否一致;表達力是擺盤;有用度是這一餐到底有沒有讓你吃飽。三者都是真實的優點——而一間廚房完全可以在其中兩項出色,第三項卻很薄弱。

三個系統的成績如下:

維度 Ed ChatGPT Gemini
有用度 4.24 3.62 3.47
準確度 3.99 3.72 3.65
表達力 4.03 3.68 3.78

準確度貼身,表達力更貼身。有用度,才是拉開距離的地方。

一個把問題徹底解決的測試

平均值會掩蓋很多東西,所以報告做了更嚴格的版本:分數完全不動,只改變你在乎什麼。你可以把它想成用不同的科目比重去重新計算同一份試卷——同一批答案,不同的優先次序,然後你就會知道這個學生真正強在哪裡。一個只有在某一種權重下才成立的結果,本身就是那個權重的產物。

你重視什麼 Ed 的絕對勝出率
原本的權重(準確 0.45/有用 0.35/表達 0.20) 58.5%
三項均等 56.6%
偏重準確度(0.60/0.30/0.10) 55.7%
完全剔除有用度(0.70/0/0.30) 46.2%
只看準確度 36.8%
只看表達力 23.6%
三選一的隨機基準 33.3%

下半部分值得慢慢讀。把有用度從評分中抽走,優勢就跌至五成以下。只計算「答得對」,數字落在 36.8%——而三個系統之中盲猜,本來就有 33.3%。單論事實本身,這三個系統幾乎難以區分。

(以上只計算絕對勝出,因此第一行低於 62.3% 的標題數字——這裡的打和是剔除,而非攤分。)

這就是核心發現,而它對大眾談論 AI 的方式相當不客氣。把幾個系統分開的,不是知識,而是它們拿這些大家都差不多具備的知識,做了什麼。

逐題紀錄說的是同一件事。在 106 條問題中,Ed 的有用度紀錄是對 ChatGPT 76 勝/15 和/15 負,對 Gemini 75/16/15——對兩者的顯著性皆為 p<0.001。準確度是 58/21/27 和 55/19/32:優勢真實,但幅度較窄。表達力則是 51/31/24 和 41/39/26——留意最後一組的 39 次打和。那是一個各系統大致打成平手的維度。

「這不就是排版靚一點嗎?」

這個質疑問得對,而報告在 4.2 節用一個比任何辯論都乾淨的測試回應了它。

排版對真假無動於衷。表格裡的數字錯了,表格一樣整齊。所以,假如「有用度」量度的其實是標題和項目符號,那麼在事實崩壞的那些題目上,它理應照樣站得住。

結果不然。在 Ed 經核實準確度只得 3.0 或以下的 14 條問題中,它的有用度紀錄塌至 1 勝、3 和、10 負(對手為該題得分較高的一方)。而在全部 106 條問題、同一計算基礎下,紀錄是 64 勝、22 和、20 負。

排版依然在,有用度卻消失了。評分者獎勵的並不是答案的外形,而是裡面那套推理站不站得住。

報告在這一點上很謹慎,我們也應該一樣:對 Ed 而言,有用度與準確度的相關系數為 0.747,所以刻意挑出準確度最低的題目,本身就會在算術上壓低有用度。這次塌陷比單靠相關性所預期的更陡峭,但它並不是一個純粹的實驗。

相關結構提供了第二項佐證——有用度跟準確度的連動有多緊,相對於它跟表達力的連動有多緊:

  • Ed:與準確度 0.747,與表達力 0.350
  • ChatGPT:0.806/0.640
  • Gemini:0.860/0.827

Gemini 那兩項幾乎融為一體(0.827)——它的答案讀起來順,就會被評為有用。Ed 的兩個維度則明顯分開。若「有用度」不過是包裝的化名,它應該與表達力緊緊同步。事實並非如此。

評分者實際寫了什麼

報告中最耐人尋味的一節是 4.3——評分者的文字理由被編碼成主題。兩欄數字:選擇 Ed 時給出的理由(n=129),以及沒有選 Ed 時給出的理由(n=79)。

評分者說那個答案做到了什麼 選擇 Ed 沒有選 Ed
解釋推理過程,而不只給出結論 26% 32%
結構清晰易讀——表格、標題 26% 29%
先講結論,再補上支撐細節 21% 30%
數據足夠,而不只是「有數據」 17% 22%
比較幾個選項,而非直接指定一個 15% 15%

真正的發現不在任何一欄之中,而在兩欄有多接近。

無論評分者選了 Ed 還是否決了它,浮現的都是同一組五項標準。他們沒有選 Ed 的時候,用的是同一把尺——只是判斷另一個答案在這把尺上做得更好。沒有人為了合理化自己的偏好而換一套標準。

這正是這份清單比一個產品結果更有價值的原因。它描述的不是某一個系統,而是這批讀者對「任何理財答案」的要求。同時留意什麼是缺席的:十個數字裡面,沒有一個是關於文筆。

這份數據不能證明什麼

三項限制,因為一個經不起質疑的結果,價值有限。

表達力是打和。 Ed 4.03,Gemini 3.78——這道差距的 p 值是 0.086,未達統計顯著。文筆質素在這幾個系統之間,應視為已經收斂。

準確度的領先是「逐個對手」的領先。 分開來看,Ed 的準確度勝過 ChatGPT,也勝過 Gemini。但若改為逐題對比「該題得分較高的那一方」,優勢便收窄至大致打平,平均差距為 −0.13。Ed 比其中任何一個系統準確;但它並不比兩者各自最好的一次加起來更準確。

假設本身很窄。 這次測試的,是一個為單一領域而建的系統,在該領域之內能否勝過通用助手。僅此而已。它沒有回答哪個 AI 整體更好,也沒有回答消費者理財以外的任何問題。

你可以直接拿來用的部分

把系統名字全部拿走,剩下的是一個可以隨身帶走的測試。下次任何 AI 給你一個關於金錢的答案,按次序問三件事:

  1. 它對嗎? 必要,但——正如「只看準確度」那一行所示——遠遠不足夠。
  2. 它讀起來舒服嗎? 令人愉快,但單靠它幾乎沒有價值。只計表達力的勝出率是 23.6%,明顯低於隨機水平。
  3. 我能據此作出決定嗎? 它有沒有指出你這個處境真正相關的數字、說明它們如何互相作用、並講清楚代表什麼?如果沒有,你手上的是一篇正確的文章,不是一個答案。

第三條是幾乎沒有人問、卻真正做事的一條。它同時能揪出那種語氣自信、卻悄悄漏掉了你的決定所繫的那個數字的答案。

同一套測試也適用於你自己的思考。知道自己的儲蓄率,是一個事實;知道這個比率代表你走在正軌與否,是一個決定——而財務健康(financial fitness)要填補的,正是這道空隙。

第三篇會把這一切變成一份大約一分鐘就跑得完的清單:如何判斷一個 AI 的理財答案。

結語

回答這些問題的幾個系統,所知道的東西其實相差無幾。把它們分開的,是那個答案究竟是為「閱讀」而砌,還是為「決定」而砌。正確是地板,不是目標——而一旦你看見這道分別,往後每一個答案你都會不自覺地用它來衡量。完整的方法、圖表與限制說明,都在 MoneyBench 研究報告。

了解你自己的財務健康狀況

Ed 的財務健康測評,就是把同一套想法用在你身上:不是裁決,而是一張地圖。幾分鐘、無需術語,給你一個可以行動的答案,而不是一個好看的答案。

立即開始:edwealth.ai/check-up,或下載 App:App Store · Google Play

Money at peace. Wealth in motion.

Ed Wealth 是財務研究與自我評估工具,並非持牌投資顧問。本文內容不構成任何財務、投資或稅務建議。所有決定由你自行作出。

資料來源

  • Ed Wealth Research, MoneyBench: a fact-verified benchmark of AI assistants on consumer finance questions — edwealth.ai/moneybench
  • MoneyBench §4.1,各維度平均分、逐題勝/和/負紀錄及顯著性檢定
  • MoneyBench §4.2,權重敏感度分析與低準確度子集測試
  • MoneyBench §4.3,評分者文字理由編碼結果(n=129/n=79)
推薦閱讀
生活方式膨脹,就是為甚麼加了薪卻從來不覺得富有——使費會悄悄升上來把它吃掉。解法不是靠意志力,而是一條規則:每次加薪,自動先把一半存起來,趁你還未習慣那筆錢。

如何擺脫生活方式膨脹(加薪存一半)

生活方式膨脹,是為甚麼一張更大的糧單,從來不會令你覺得過得更好:收入一升,使費就緊跟上來,於是你賺得更多、卻存得一樣少。解法不是咬緊牙關,而是一條簡單、自動的規則——加薪一到手,先把其中一半直接撥去儲蓄/投資,讓它在變成你的生活水平之前就離開。你照樣覺得富有,只是沒有把它全部花掉。 你拿到了想要的加薪。一年後,不知怎的,月底依然甚麼都不剩。那筆錢沒有花在甚麼驚天動地的東西上——搬去租金貴一點的單位、換部電話、多叫幾次外賣、幾個訂閱、樣樣升級一點。每一項都合情合理,加起來卻吃掉了整個加薪。這就是生活方式膨脹,也是高薪一族依然覺得在原地踏水的頭號原因。 膨脹之所以危險,正因為它從不像個錯誤。沒有人會用一次魯莽的消費燒掉加薪,它是從一個個站得住腳的小升級裡漏走的,每一個大約一個月就變成新常態。你的大腦幾乎即時適應了更高的生活水平(心理學叫「享樂跑步機」),新鮮感很快消退——但那筆更高的開支卻留了下來。你鎖死了成本,卻失去了快樂。 結果就是我們在〈為甚麼收入不錯卻覺得窮〉裡談過的陷阱:收入上升、儲蓄原地、心裡總覺得「應該不只如此」。 關鍵洞見在這裡。當錢已經到帳、生活也擴張到用掉它,再要縮回去就感覺像一種損失——而我們最討厭損失。但一筆你從未開始花的錢,不是損失;你沒適應過,就不會想念。
EdWealth
·
Aug 04 2026
你存不到錢,幾乎肯定不是因為那杯咖啡奶茶。住、行、食吃掉大半個預算,而在香港,租金與供樓更是壓倒性的一項。這篇拆解錢到底花在哪,以及真正能改變局面的幾個動作。

為甚麼我存不到錢?問題不是那杯奶茶

先講結論:你存不到錢,幾乎肯定是因為大開支,不是小開支。住、行、食三項就吃掉大半個預算——而在香港,租金與供樓更是壓倒性的一項,往往佔去收入的四成甚至一半。相比之下,一杯咖啡奶茶只是零頭。慳細數令人有種在努力的錯覺,實際上改變甚少;重新調整一項大而經常性的開支,才真正改變全局。 坊間有一整套理財說法,建立在「你只要戒掉早餐那杯飲品就會發達」之上。它動聽,因為簡單——但大多是錯的。不是數學造假,而是它把你有限的意志力,瞄準了房間裡最小的目標。 持平地說:複利是真的。每天慳 40 蚊、投資 30 年,確實會滾成一筆可觀的錢。如果戒飲品對你毫無痛苦,那就慳,當賺。 但陷阱在這裡。死盯着幾十蚊的小開支,會造成兩種傷害。第一,把你有限的意志力耗在一條極小的項目上——結果就是「慳到攰」:你咬牙戒了三星期飲品,覺得委屈,然後在一件更大的東西上一次過花光。第二、也更嚴重:你真正的預算殺手,就此完全無人審視。你可以天天贏了那杯飲品的仗,卻依然一毫子都存不到,因為戰場根本在別處。 看看實際的開支結構。以美國勞工統計局的數據為例(2024 消費開支調查):
EdWealth
·
Aug 03 2026
以 15 年計,幾乎沒有一個類別的主動基金經理能跑贏指數;10 年計,能跑贏標普 500 的少於六分之一。這篇解釋為何被動對幾乎所有人都勝,以及在香港,費用拖累為何更嚴重。

主動 vs. 被動投資:有人真的能跑贏大市嗎?

先講結論:對幾乎所有人,被動勝。「主動」是付錢請經理靠選股和擇時去跑贏大市;「被動」是直接透過低成本指數基金持有整個市場。證據壓倒性地一面倒——以 10 年計,能跑贏標普 500 的主動美股大型基金少於六分之一;以 15 年計,沒有一個主要類別能有過半數經理跑贏。不是因為經理不聰明,而是費用加上「持續估中市場」近乎不可能,把他們慢慢拖垮。在香港,這個費用拖累甚至更嚴重。除非你有特定理由,做那個市場,而不是與它對賭。 這是個人理財中少數證據並不模稜兩可的辯論之一。值得理解「為甚麼」——因為輸的那一方,偏偏有更好的行銷。 主動投資是直覺那種:專業經理研究公司、選出他認為會跑贏的、並頻繁買賣去嘗試打敗一個基準(例如標普 500)。你為這份努力與專業付較高費用。大部分傳統銀行代銷的基金都是主動型。 被動投資幾乎簡單到令人尷尬:不是嘗試跑贏市場,而是透過指數基金買下整個市場,持有基準裡的所有成分。不選股、不預測、費用極低。你接受市場的回報——不多不少——而這其實是一條很高的門檻。 標普每年公佈 SPIVA 記分卡,比較主動基金與其基準。結果相當一致,而且看得愈長、愈難看:
EdWealth
·
Aug 02 2026

金錢安穩,財富前行。

你的錢,終於有人打理;你的生活,終於不再匆忙。