跳到主要內容
分析6 分鐘
作者:何佳勳·電商行銷顧問,十多年電商操盤與 AI 工具實戰

🧪 A/B 測試跑完別急著全量上線,先讓工具幫你確認這不是運氣

A/B 測試結果解讀器使用教學。貼入 A、B 兩組的曝光、轉換、營收,AI 幫你判讀統計顯著性與信心水準、估算實施 ROI、建議下一輪實驗方向,並列出可能的誤判風險,避免把隨機波動當成真實效果就急著全站套用。

為什麼 B 版看起來贏了,還是不能直接全量

A/B 測試最常見的錯誤,是看到 B 版轉換率比 A 版高,就直接宣布勝出、全站換上。

問題在於,轉換率天生會抖。同一個頁面不動任何東西,切成兩半跑一週,兩邊的數字也不會一模一樣。如果 B 版只贏 A 版一點點,樣本又不夠大,那個「贏」很可能只是這一週剛好運氣好,換一週跑就翻盤了。

實際會踩到的坑:

  • B 版轉換率 3.1%、A 版 2.9%,看起來 B 贏,但兩組各只有 3000 次曝光,這種差距根本分不出真假
  • 測了 3 天就急著下結論,剛好那 3 天有一波 EDM 導流灌進 B 版
  • 只看轉換率有沒有贏,沒去想「就算是真的,這個提升值多少錢、值不值得為它改整站」

這個工具就是在你下判斷之前,先幫你把「這是真的還是運氣」跟「就算是真的划不划算」兩件事講清楚。

它到底幫你判讀什麼

你把 A、B 兩組的曝光數、轉換數、營收,加上測試天數跟情境說明貼進去,AI 會回你六塊資訊:

實驗總結:哪一版勝出、提升幅度(lift)多少、信心水準多少。信心水準 95% 的白話意思是「這個差距是真實效果、不是隨機的把握有九成五」。低於 95% 通常代表還不能下結論。

統計分析:兩組各自的轉換率、合計樣本數、p-value,以及一段白話解讀。p-value 小於 0.05 才代表差距顯著,值越小越有把握。

商業影響:把提升幅度換算成每月大概多賺多少營收、估算的 ROI、多久回本。這一塊決定「值不值得為這個改動動整站」。

下一步行動:具體建議該全量上線、還是繼續跑、還是開下一輪測什麼。

誤判風險:列出這次結果可能被什麼污染,例如樣本不足、跨週末、同期有廣告活動、裝置差異等。

分群建議:提醒你該再拆新客與回購客、行動與桌機、不同流量來源來二次檢視,避免用一個平均數字蓋掉重要差異。

要先講清楚:這是 AI 輔助判讀,數字會送到 AI 產生解讀,會消耗一次 AI 額度。它給的是幫你思考的參考,不是實驗室等級的統計裁決,關鍵決策記得配合自己的判斷。

照著填就能跑一次

步驟 1:填實驗名稱與情境

先給這次實驗一個名字,例如「Hero 標題改免運訴求」。名稱是必填,沒填會擋下來。

情境說明這格很值得花時間寫。把你改了什麼、為什麼改、測試期間有沒有同時跑活動都寫進去。AI 有這些背景,判讀誤判風險時才抓得準,例如你若寫了「這週有跑雙 11 預熱廣告」,它就會提醒營收提升可能被外部流量污染。

步驟 2:填 A、B 兩組數字

A 版和 B 版各填三個數字:曝光數、轉換數、營收。

曝光就是進到這個頁面或看到這個版本的人次,轉換是實際完成目標(下單、加入購物車、註冊,依你的實驗而定)的次數,營收是這一組帶來的總金額。

填的時候工具會即時幫你算好兩組的轉換率跟提升幅度,你在送出前就能先目測一下差距大不大。

步驟 3:填測試天數

填這次 A/B 測試實際跑了幾天。天數會影響判讀,跑太短(例如少於 7 天)容易被單日波動或週末效應干擾,AI 會把這點列進誤判風險。

步驟 4:送出讀結果,先看信心水準

按下產生後,先看「實驗總結」裡的信心水準跟「統計分析」的 p-value。這兩個決定你能不能下結論。過了門檻,再往下看商業影響評估划不划算、看誤判風險有沒有致命問題。都沒問題,才照下一步行動去做。

判讀時容易忽略的五件事

1.信心水準沒到 95% 就是「還不知道」:不是輸也不是贏,是樣本還不夠、分不出來。這種情況不要停測,繼續累積曝光到差距顯著,或是承認這個改動效果太小、不值得追。

2.樣本太小的顯著也要留一手:兩組各只有幾百次轉換時,就算 AI 說顯著,也建議把測試再延長一週複驗。轉換數越少,數字越會跳。

3.情境說明寫得越細,誤判風險抓得越準:同期有沒有廣告、有沒有跨大節慶、流量分配是不是均勻,這些你不寫 AI 不會知道。多花兩分鐘寫情境,換來的是更可信的風險清單。

4.營收提升要拆轉換率還是客單價:B 版營收高,不一定是更多人買,可能只是剛好幾張大單。工具會提醒你拆 CR 與 AOV 雙指標確認,別把客單價的波動當成轉換的勝利。

5.ROI 是估算,拿來排優先順序而不是財務入帳:商業影響那塊的每月營收與回本天數是根據你填的數字外推的參考值,用途是幫你判斷「這個改動值不值得優先做」,不是拿去報帳的精確數字。

三個實際情境

情境 A:Hero 文案測試,看起來贏但心裡沒底

改了首頁主標,跑 14 天。A 版曝光 8200、轉換 196;B 版曝光 8150、轉換 256。B 版轉換率 3.14% 對 A 版 2.39%,提升 30.6%。

丟進工具,信心水準約 97.8%、p-value 0.022,通過門檻。商業影響估每月多賺十幾萬、ROI 十幾倍。結論明確:可以全量上線。這種「差距夠大、樣本夠、天數夠」的情況,工具幫你把「敢不敢上」的心理門檻補上了。

情境 B:兩版咬得很近,到底誰贏

結帳按鈕改色,跑 5 天。A 版曝光 3000、轉換 90;B 版曝光 3050、轉換 96。轉換率 3% 對 3.15%,看起來 B 微幅領先。

工具會告訴你信心水準遠低於 95%、p-value 過大,這個差距分不出真假,而且只跑 5 天,誤判風險會點出樣本不足與天數過短。正確做法不是宣布 B 贏,是繼續跑到樣本夠,或接受這個改動效果太小、不必為它折騰。

情境 C:B 版轉換沒贏,營收卻高

商品頁加了組合推薦,跑 10 天。兩版轉換率幾乎一樣,但 B 版營收明顯高。

工具在誤判風險與分群建議會提醒:營收提升可能來自客單價而非轉換率,要拆 CR 與 AOV 分開看。這時候的正解不是「B 版轉換贏了」,而是「這個改動不影響多少人買,但買的人買更多」,兩種結論後續要做的事完全不同。

判讀完之後接著做什麼

顯著、且商業影響夠大:全量上線 B 版,然後把這個有效的訴求延伸到其他頁面。如果這是廣告落地頁的測試,接著用投放前 KPI 試算器重算一次,看新的轉換率能不能撐起更大的投放預算。

顯著、但商業影響很薄:可以上,但別急著開下一輪同類測試。先把力氣放在影響更大的環節,例如用Meta Ads 廣告組診斷看廣告端有沒有更值得優化的空間。

不顯著:繼續累積樣本到差距明朗,或承認這個改動效果太小、換個假設重測。工具給的下一步行動會建議你下一輪該測什麼變數。

不管哪種結果,把工具建議的分群維度記下來。全量上線後過一段時間,拿實際成效搭配廣告 ROAS 計算器回頭對帳,看當初估的商業影響有沒有兌現,下次判讀就會越來越有感覺。

常見問題

Q: 這個工具會消耗 AI 額度、會上傳我的資料嗎?
會消耗一次 AI 額度。它跟站上的純計算工具不同,你填的曝光、轉換、營收數字會送到 AI 產生判讀,所以每次產生會用掉一次額度。填的是彙總後的統計數字(例如總曝光、總轉換),不是逐筆顧客名單,但如果你的情境說明含敏感資訊,送出前自己斟酌一下。
Q: 信心水準要到多少才能下結論?
一般以 95% 為門檻,對應 p-value 小於 0.05。到了這條線,代表這個差距是真實效果、不是隨機波動的把握夠高,可以考慮全量。低於 95% 不代表 B 版輸,是「還分不出來」,通常要繼續累積樣本,或接受這個改動效果太小不值得追。
Q: 測試只跑了三天,數字很漂亮可以用嗎?
不建議直接下結論。跑太短很容易被單日波動、週末效應、或某天一波導流灌大,工具也會把天數過短列進誤判風險。電商 A/B 測試通常至少跑滿 7 到 14 天、涵蓋完整的週循環,數字才穩。
Q: 它算的每月多賺多少、ROI 幾倍準嗎?
那是根據你填的數字往外推的估算值,不是精確財務數字。用途是幫你判斷「這個改動值不值得優先做、要不要為它動整站」,拿來排優先順序很好用,但不要當成會計入帳的金額。實際成效請上線後用真實數據回頭對帳。

立即免費使用電商營運工具箱

192 個 AI 驅動的電商工具,解決你每天最痛的營運問題

開始使用 →