我們用真實理財問題實測三個 AI。結果是這樣。

EdWealth Team · Published Sep 3, 2026
我們用真實理財問題實測三個 AI。結果是這樣。

2026年7月,我們把 106 條真實理財問題交給三個 AI 系統——Ed、ChatGPT 和 Gemini——所有答案以匿名方式評分,評審模型不屬於三者任何一方的模型家族,而每一項關鍵事實都對照即時來源核查過。Ed 在 62.3% 的問題上勝出,Gemini 20.8%,ChatGPT 17.0%。

完整研究已經公開,名為 MoneyBench(報告為英文版),內容包括方法論、評分準則、研究限制,以及我們輸掉的那一輪。

有兩件事值得在讀下去之前先知道。第一,這些問題不是為測試而寫的,而是從真實用戶問過個人理財 AI 的紀錄中抽出來——是那種瑣碎、具體、帶著個人處境的問題,不是教科書式的題目。第二,事實核查那一關令 Ed 的分數下跌。核查之前,Ed 是 67.6%;當每個答案的每項關鍵事實都對照即時來源查證之後,Ed 是 62.3%——被削去 5.3 個百分點,而兩個對手的分數則同時上升。Ed 仍然排第一。

這篇文章講 MoneyBench 量度什麼、測試怎樣搭建。另外兩篇會走得更深:什麼才算一個「有用」的 AI 理財答案,以及你自己可以怎樣判斷一個 AI 理財答案。

為什麼需要這樣一個基準測試

寫程式和數學都有公開的基準測試。你可以查到模型排名、看到題庫、對評分方式提出質疑。個人理財問答卻沒有對應的東西——這其實有點奇怪,因為它正是「答錯代價最大」的領域之一。

理財答案是會被拿去行動的。有人看到一個供款上限,就真的把錢調走;有人看到一個過時的股價,就真的調整了持倉。理財答案還會過期:三月正確的數字,七月可能已經錯了,而 AI 的行文語氣完全不會告訴你眼前這個屬於哪一種。無論對錯,答案都以同樣自信的語氣、同樣即時地出現。

這個落差在行為上看得見。Intuit Credit Karma 一項訪問 1,019 名美國成年人的調查發現,在曾經按 AI 理財建議行動的人當中,52% 表示那導致了一個不好的決定。

所以我們把自己想被拿來量度的那把尺造出來:真實問題、盲測評分、第三方評審、每項事實核查。然後把它連同做法一併公開,讓任何人都能重跑這套流程——包括拿來測我們自己。

我們實際量度什麼

大部分 AI 評測量度的是答案對不對。「對」是必要條件,但它不是這件事的本質。

人們問 AI 理財問題,不是為了核對一個自己已經知道的數字,而是為了做一個決定:應該先還貸款還是先增加退休金供款、花紅應該留現金還是投入市場、某條稅務規則放在自己的處境上到底是什麼意思。一個答案可以完全正確,卻讓你留在原地。

所以 MoneyBench 用 1 至 5 分量度三個維度,並加權計算:準確度 0.45、有用度 0.35、表達 0.20。準確度看事實站不站得住;有用度看這個答案有沒有把人推近一個決定;表達看它讀不讀得順。

權重之上還有一條硬規則:準確度否決權。只要答案裡有一項事實被核查證實是錯的,那個答案就不能在該題勝出——無論它多有用、寫得多好。有用度永遠買不到一個錯數字的通行證。

三輪測試的結果

輪次 日期 Ed Gemini ChatGPT 評分方式
Panel I 2026年5月 17.4% 46.1% 36.5% 37 位盲測評分員,1,308 份評分回應
Panel II 2026年6月 54.4% 28.3% 17.3% 25 位盲測評分員,90 條問題,375 票
Verified Evaluation 2026年7月 62.3% 20.8% 17.0% 第三方模型評審、逐題事實核查,106 條問題

第一行值得再看一次。五月那一輪,Ed 包尾——三者之中排第三,而且差距不小。

輸因分析的結果很具體,也不是我們原本預期的方向:能力是有的,只是沒有送到用戶面前。在那些被導向 Ed 深度推理路徑的問題上,Ed 排第一——39.8%,對 Gemini 的 30.5% 和 ChatGPT 的 29.7%。但那條路徑只承載約一成流量。大部分問題根本走不到那裡。

之後重建的是檢索、任務調度和答案組裝——問題怎樣被理解、抓取哪些數據、走哪條路徑、答案怎樣拼出來。不是換模型。引擎沒問題,有問題的是管道。

自那之後,Ed 每一輪都排第一。

七月那道差距出在哪裡

維度(1–5 分平均) Ed ChatGPT Gemini
有用度 4.24 3.62 3.47
準確度 3.99 3.72 3.65
表達 4.03 3.68 3.78

表達幾乎是三方打和——三個系統都寫得好。準確度拉開了距離,但幅度不大。真正的差距在有用度,而且很闊:在 106 條問題中,Ed 的有用度有 76 題高於 ChatGPT、75 題高於 Gemini。

這個型態本身就是結論。通用助手並不是不懂理財,它們擅長回答理財問題,卻不太擅長解決理財問題——數字來了,決定沒來。

為什麼這個結果不容易被輕輕帶過

任何公司都可以公開一場自己贏了的測試。真正令結果有份量的,是它在什麼條件下贏。

評審在三個系統之外。 評分由 Anthropic 的 Claude 執行——它不屬於 ChatGPT 的模型家族、不屬於 Gemini 的,也不屬於 Ed 本身所採用、未公開的基礎模型。沒有人在批改自己的功課,我們也一樣。

呈現方式是匿名而且隨機排序的。 答案被移除所有能辨認來源的痕跡,並以隨機位置呈現,令排列次序影響不到分數。

每一項關鍵事實都對照即時來源核查。 不是抽樣——是每個答案的每一項關鍵事實,全部對照 2026年7月23日的即時來源查證。106 條問題全部核查成功。

對手沒有被削弱。 ChatGPT 以 GPT-5.6 Sol 的 Pro effort 運行——高於它自己的預設值;Gemini 以 3.6 Flash 預設值運行;Ed 則是一般生產環境設定,跟用戶用到的完全一樣。

還有兩件事——如果換成我們要來挑這份報告的毛病,會第一時間指出的兩件事。

核查那一關令我們付出代價。Ed 由 67.6% 跌至 62.3%,同時 Gemini 由 17.1% 升至 20.8%、ChatGPT 由 15.2% 升至 17.0%。一場為自己臉上貼金而設計的測試,不會加入一個把自己 5.3 分削走、再送給對手的步驟。這場勝出,捱過了最傷自己的那一關。

而五月那一輪在報告裡。Ed 以 17.4% 排第三,那一輪的公開程度跟我們贏的幾輪一樣——分數、輸因分析、診斷結論,全部在內。一個只在贏的時候才公開的基準測試,不是基準測試,是新聞稿。

補一個統計角度:Ed 七月得分的 95% 置信區間為 [52.8%, 71.7%],而三方隨機的基準線是 33.3%。即使取區間最低那一端,仍然明顯高於隨機水平。

這場測試證明不到什麼

三項研究是彼此相關的測試,不是一條乾淨的成長曲線——報告本身寫明,只有 Panel I 與 Verified Evaluation 之間的比較是成立的,我們把這句保留在內,而不是硬把三個點連成一條漂亮的線。七月那一輪,有 47% 的問題屬於接近打和的情況。而受檢驗的假設本身很窄:一個為單一領域而建的系統,在那個領域之內,表現勝過通用助手。不是「Ed 比前沿模型更會推理」。它不是,而我們也從來沒有這樣宣稱。

這場測試說的東西,比「Ed 更聰明」更小、但更有用:在理財問題這件事上,為目的而建的系統贏過通用系統——在第三方評審、匿名盲測、事實核查的條件下。

結語

在 106 條經事實核查的真實理財問題中,Ed 勝出 62.3%,Gemini 20.8%,ChatGPT 17.0%,由三個模型家族以外的評審匿名評分。差距來自有用度——答案有沒有把人帶到一個決定——而不是文筆,三者在文筆上相當接近。

我們認為這才是應該量度的東西,也是應該採用的量度方式:公開流程、用外部評審、即使核查會扣自己的分也照樣核查、輸掉的那一輪照樣公開。完整報告(英文)已經公開,測試流程亦然。

了解你自己的財務健康狀況

基準測試量度的是答案。而你自己的錢,是一條關於你的問題——你的現金流、你的備用金、你的目標。Ed 的財務健康測評,幾分鐘內帶你走過財務健康的五個維度,無需術語,告訴你哪裡強、哪裡有風險。這正是通用助手,與一個屬於你自己的 money person 之間的分別。

立即開始:edwealth.ai/check-up,或下載 App:App Store · Google Play

Money at peace. Wealth in motion.

Ed Wealth 是財務研究與自我評估工具,並非持牌投資顧問。本文內容不構成任何財務、投資或稅務建議。所有決定由你自行作出。

資料來源

  • Ed Wealth Research, MoneyBench: measuring usefulness and factual accuracy on real money questions(2026年8月)— edwealth.ai/moneybench
  • Intuit Credit Karma,訪問 1,019 名美國成年人的調查,調查期 2025年8月7至14日
推薦閱讀
生活方式膨脹,就是為甚麼加了薪卻從來不覺得富有——使費會悄悄升上來把它吃掉。解法不是靠意志力,而是一條規則:每次加薪,自動先把一半存起來,趁你還未習慣那筆錢。

如何擺脫生活方式膨脹(加薪存一半)

生活方式膨脹,是為甚麼一張更大的糧單,從來不會令你覺得過得更好:收入一升,使費就緊跟上來,於是你賺得更多、卻存得一樣少。解法不是咬緊牙關,而是一條簡單、自動的規則——加薪一到手,先把其中一半直接撥去儲蓄/投資,讓它在變成你的生活水平之前就離開。你照樣覺得富有,只是沒有把它全部花掉。 你拿到了想要的加薪。一年後,不知怎的,月底依然甚麼都不剩。那筆錢沒有花在甚麼驚天動地的東西上——搬去租金貴一點的單位、換部電話、多叫幾次外賣、幾個訂閱、樣樣升級一點。每一項都合情合理,加起來卻吃掉了整個加薪。這就是生活方式膨脹,也是高薪一族依然覺得在原地踏水的頭號原因。 膨脹之所以危險,正因為它從不像個錯誤。沒有人會用一次魯莽的消費燒掉加薪,它是從一個個站得住腳的小升級裡漏走的,每一個大約一個月就變成新常態。你的大腦幾乎即時適應了更高的生活水平(心理學叫「享樂跑步機」),新鮮感很快消退——但那筆更高的開支卻留了下來。你鎖死了成本,卻失去了快樂。 結果就是我們在〈為甚麼收入不錯卻覺得窮〉裡談過的陷阱:收入上升、儲蓄原地、心裡總覺得「應該不只如此」。 關鍵洞見在這裡。當錢已經到帳、生活也擴張到用掉它,再要縮回去就感覺像一種損失——而我們最討厭損失。但一筆你從未開始花的錢,不是損失;你沒適應過,就不會想念。
EdWealth
·
Aug 04 2026
你存不到錢,幾乎肯定不是因為那杯咖啡奶茶。住、行、食吃掉大半個預算,而在香港,租金與供樓更是壓倒性的一項。這篇拆解錢到底花在哪,以及真正能改變局面的幾個動作。

為甚麼我存不到錢?問題不是那杯奶茶

先講結論:你存不到錢,幾乎肯定是因為大開支,不是小開支。住、行、食三項就吃掉大半個預算——而在香港,租金與供樓更是壓倒性的一項,往往佔去收入的四成甚至一半。相比之下,一杯咖啡奶茶只是零頭。慳細數令人有種在努力的錯覺,實際上改變甚少;重新調整一項大而經常性的開支,才真正改變全局。 坊間有一整套理財說法,建立在「你只要戒掉早餐那杯飲品就會發達」之上。它動聽,因為簡單——但大多是錯的。不是數學造假,而是它把你有限的意志力,瞄準了房間裡最小的目標。 持平地說:複利是真的。每天慳 40 蚊、投資 30 年,確實會滾成一筆可觀的錢。如果戒飲品對你毫無痛苦,那就慳,當賺。 但陷阱在這裡。死盯着幾十蚊的小開支,會造成兩種傷害。第一,把你有限的意志力耗在一條極小的項目上——結果就是「慳到攰」:你咬牙戒了三星期飲品,覺得委屈,然後在一件更大的東西上一次過花光。第二、也更嚴重:你真正的預算殺手,就此完全無人審視。你可以天天贏了那杯飲品的仗,卻依然一毫子都存不到,因為戰場根本在別處。 看看實際的開支結構。以美國勞工統計局的數據為例(2024 消費開支調查):
EdWealth
·
Aug 03 2026
以 15 年計,幾乎沒有一個類別的主動基金經理能跑贏指數;10 年計,能跑贏標普 500 的少於六分之一。這篇解釋為何被動對幾乎所有人都勝,以及在香港,費用拖累為何更嚴重。

主動 vs. 被動投資:有人真的能跑贏大市嗎?

先講結論:對幾乎所有人,被動勝。「主動」是付錢請經理靠選股和擇時去跑贏大市;「被動」是直接透過低成本指數基金持有整個市場。證據壓倒性地一面倒——以 10 年計,能跑贏標普 500 的主動美股大型基金少於六分之一;以 15 年計,沒有一個主要類別能有過半數經理跑贏。不是因為經理不聰明,而是費用加上「持續估中市場」近乎不可能,把他們慢慢拖垮。在香港,這個費用拖累甚至更嚴重。除非你有特定理由,做那個市場,而不是與它對賭。 這是個人理財中少數證據並不模稜兩可的辯論之一。值得理解「為甚麼」——因為輸的那一方,偏偏有更好的行銷。 主動投資是直覺那種:專業經理研究公司、選出他認為會跑贏的、並頻繁買賣去嘗試打敗一個基準(例如標普 500)。你為這份努力與專業付較高費用。大部分傳統銀行代銷的基金都是主動型。 被動投資幾乎簡單到令人尷尬:不是嘗試跑贏市場,而是透過指數基金買下整個市場,持有基準裡的所有成分。不選股、不預測、費用極低。你接受市場的回報——不多不少——而這其實是一條很高的門檻。 標普每年公佈 SPIVA 記分卡,比較主動基金與其基準。結果相當一致,而且看得愈長、愈難看:
EdWealth
·
Aug 02 2026

金錢安穩,財富前行。

你的錢,終於有人打理;你的生活,終於不再匆忙。