題目與適用情境
一家即時外送平台準備在 24 個營運區域測試新的派單演算法。實驗組訂單可能占用原本會分給對照組訂單的外送員,外送員也會在相鄰區域之間移動。請設計實驗,估計把新演算法推廣到整個市場後的效果,並說明估計目標、隨機分派單位、空間外溢與跨期殘留控制、檢定力計算、分析方法、護欄指標及上線決策。
24 個區域、介入方式和營運細節都是面試案例假設,並非任何真實平台的資料。假設實驗系統可以隨時切換新舊演算法,但不能因此認定市場狀態會立即復原。切換視窗與洗脫期都必須從訂單和外送員的動態推導。
這是一道適合資料科學家、實驗科學家、經濟學家與產品分析師的高難度實驗設計題。公開面試題頁面把網路實驗列為資料科學及資料分析職位的困難案例,並記錄了 2026 年 4 月 7 日的提問日期。LinkedIn 公開過利用叢集實驗偵測社交網路干擾的方法。DoorDash 公開過派單情境的「區域 × 時間」切換式實驗,並在 2025 年的廣告市場案例中說明跨期殘留、低檢定力以及資源隔離方案的選擇邊界。ICLR 2026 論文仍在研究網路干擾下叢集隨機實驗的偏誤與變異問題。這些資料支持題目在目前環境中的代表性與技術價值,無法據此推算任何公司的提問頻率或公司歸屬。
直接按訂單隨機分組並比較兩個使用者層級的平均值會產生誤導。新演算法改變訂單取得共享外送員池的方式,一筆訂單的處理會影響其他訂單,普通 A/B 解讀所依賴的無干擾條件因此失效。高品質回答會先定義要估計的效應,再找出處理如何跨越空間和時間傳播,最後讓分組、估計量、不確定性和上線決策回答同一個問題。
面試官的評估重點
第一,候選人能否把因果問題說清楚。「實驗組是否優於對照組」缺少目標母體與處理環境。產品決策關心整個市場統一使用新演算法後的效應,這可能不同於鄰近訂單仍混用兩種演算法時,單一實驗組訂單得到的直接效應。
第二,候選人能否把網路干擾拆成機制。共享外送員使訂單彼此爭奪運力;外送員跨區移動連結相鄰區域;未完成外送與行為變化又會把影響帶到後續時間。只說有網路效應,還不足以決定實驗單位和視窗。
第三,候選人能否比較多種設計。地理叢集可降低跨組競爭,獨立單位卻可能太少;切換式實驗能增加區域時間單位,也會受到跨期殘留影響;兩階段飽和度實驗適合拆分社交網路中的直接效應與外溢效應;預算或庫存能真正切開時,隔離資源宇宙可消除組間爭奪。
第四,分析是否符合隨機分派方式。處理只分派給少數市場時間區塊時,數百萬筆訂單也不會產生數百萬個獨立觀測。檢定力、權重、標準誤和隨機化檢查都必須遵循真實的實驗單位與分派機率。
最後,候選人能否拒絕不可信的正向結果。解讀提升前應檢查分派、實際曝光、跨邊界移動、處理持續性、同時進行的實驗及指標成熟度。候選人也要說明:切換式實驗可能估計短期政策效應,但不會自動支持長期市場均衡或外送員學習效應的結論。
回答前要先釐清的問題
- 哪一個效應直接支撐決策? 目標是整個市場使用新演算法後每筆符合資格訂單的變化、每個市場時間區塊的平均變化、實驗組訂單的直接效應,還是對未處理訂單的外溢效應?估計量與權重由此決定。
- 干擾沿著什麼路徑傳播? 一位外送員能否服務多個區域?訂單能否跨區媒合?定價、獎勵、併單或佇列優先順序是否也會連結區域?答案會定義干擾圖。
- 處理會影響多久? 派單、取餐、完成、外送員換區和重新進入可用運力的時間分布為何?程式可以切回舊版,不代表市場狀態同步復原。
- 實際有多少個獨立市場? 24 個區域是彼此分離的運力池,還是 4 座高度連通城市的內部分區?24 個標籤可能只代表 4 個有效地理叢集。
- 稀缺資源能否隔離? 預算、候選庫存或配額可能切成獨立池。外送員通常無法複製到兩個宇宙,派單情境未必能採用資源隔離。
- 主要指標與分母為何? 每筆符合資格訂單的完成率、接單等待時間、外送員利用率與成交額回答不同問題。資格條件必須在處理改變進入佇列或完成之前固定。
- 哪些延遲和雙邊護欄必須保護? 可考慮取消、逾時、外送員每活躍小時收入、閒置時間、接單率、申訴和跨區排擠。
- 哪些同時執行的政策也改變同一市場? 促銷、定價、天氣應變和其他派單實驗可能與本實驗交互作用,需要分層、互斥或明確的因子設計。
- 能記錄哪些分派與曝光資料? 至少需要排定組別、實際演算法、市場叢集、時間區塊、訂單資格時間、外送員跨區、降級及成熟結果,才能區分實驗故障和產品效應。
30 秒回答架構
「我會先把估計目標定義成:整個目標市場統一採用新派單策略後,每筆符合資格訂單的變化。訂單層級隨機分派不成立,因為實驗組與對照組會爭奪同一批外送員。我會用媒合和外送員移動資料建立干擾圖,合併跨區流量高的區域;若策略能快速恢復,再評估按『地理叢集 × 時間區塊』隨機分派的切換式實驗。時間區塊和固定過渡區間由實測殘留決定,不使用預設時長。檢定力用歷史叢集時間區塊的變異和自我相關規劃,分析依隨機排程做意向治療,並讓估計量和不確定性符合每訂單估計目標與叢集設計。解讀提升前先核對分派、實際曝光、污染和指標成熟度。只有完成率提升且使用者與外送員護欄通過,我才會進入持續區域放量;若學習效應很長或外溢無法控制,就改用較長期的叢集實驗。」
分步深入解析
步驟一:先定義估計目標,再選擇分桶單位
先把目標對比寫成一句話:「對新舊策略都符合資格的訂單,目標市場全部執行新演算法,相較於全部執行舊演算法,主要結果會改變多少?」這就是全面上線政策效應。
存在干擾時,一筆訂單的結果同時取決於自身處理與周圍單位的處理。使用者層級的混合實驗主要估計部分處理密度下的直接效應,未必等於全實驗與全對照的差異。業務若同時需要直接效應和外溢效應,應分別聲明估計目標,不能期待一個組間差同時識別兩者。
資格條件要在策略生效前凍結。例如依請求有效性、服務區域和派單前時間戳記定義符合資格的訂單。主要結果可以是「固定成熟視窗內,每筆符合資格訂單完成的外送數」,讓未媒合與失敗訂單都保留在分母。「實驗組已完成訂單的平均外送時間」依賴處理後的完成狀態,策略只要捨棄困難訂單,也可能看起來更快。
步驟二:把網路效應畫成干擾圖
依營運資料與產品規則建立邊:
- 同一時段爭奪同一位外送員的訂單相連;
- 跨區媒合與外送員移動連結不同區域;
- 未完成訂單或外送員位置變化仍存在時,相鄰時間區塊相連;
- 定價、併單、獎勵或其他實驗改變同一運力時,策略之間相連。
干擾圖只能使用實驗前資料建立,不能依處理後產生的行為重新分組。計算每個候選邊界上的跨區媒合與外送員移動比例。有效叢集應把多數強連結留在叢集內,同時保留足夠的叢集以取得檢定力。LinkedIn 的公開實務清楚呈現這項權衡:叢集越多,隨機化單位和檢定力通常越多;叢集越大,跨實驗組的邊通常越少。
這張圖也會揭露設計無法隔離的結果。外送員頻繁跨越所有區域邊界時,按區域分組只是在同一個連通市場貼上不同標籤。團隊可能需要整座城市按時間隨機、執行長期獨立市場實驗,或主動縮小因果結論。
步驟三:依干擾機制比較設計
個體伯努利隨機分派在單位彼此不影響時有較高名目樣本量。本題的實驗組訂單會消耗共享運力,因此不適用。
持續地理叢集隨機分派讓一個相對隔離的市場在整段實驗期間只使用一種策略。它較能容納長期殘留和行為學習;24 個區域若合併成少數連通市場,平衡、檢定力和外推都會變得困難。
叢集切換式隨機分派讓一個連通地理叢集在一個時間區塊內統一使用某種策略,之後的時間區塊重新隨機。它適合主要影響能在可測時間內衰退的可逆派單演算法。DoorDash 公開的派單實驗正是按區域時間單位隨機。此設計會產生更多實驗單位,但未完成訂單、外送員換區或行為改變仍可能連結相鄰時間區塊。
兩階段或飽和度隨機分派先把網路叢集分配到不同處理密度,再於叢集內分派成員。它能估計鄰居曝光變化帶來的直接和外溢效應,適合社交或推薦情境;同一時刻必須統一管理共享外送員池時,實作和解讀都更複雜。
隔離資源宇宙直接切開造成干擾的資源。DoorDash 2025 年的廣告案例依實驗組拆分活動預算,使兩個策略無法相互消耗預算。資源可分割且每個宇宙都能正常運作時,這可能優於切換式實驗。把同一位外送員同時視為兩個獨立運力池,無法形成真實隔離。
本題只有在主要效應能充分迅速衰退時,才優先選擇叢集切換式實驗。先將跨區連結緊密的相鄰區域合成市場叢集,再隨機「市場叢集 × 時間區塊」。若策略會造成持續數週的外送員學習或位置遷移,就改用持續叢集放量。
步驟四:設計切換排程和過渡規則
使用實驗前訂單生命週期、外送員換區與營運模擬估計跨期殘留,再以 A/A 資料檢查候選排程。時間區塊要讓大部分相關狀態消退;縮短視窗會增加實驗單位,通常也會提高檢定力,同時增加殘留偏誤。區域大小有相同權衡:較大區域減少空間洩漏,也會減少獨立單位。
在市場叢集、星期和日內時段等預先定義的層內,隨機分派每個時間區塊。不能只隨機第一個視窗後機械交替,否則處理可能與尖峰、平日或趨勢對齊。各種序列要平衡,關鍵時段內的每個叢集都應有機會取得兩種策略。
結果出現前先固定過渡規則。主要分析可依訂單進入資格時排定的策略分組,並持續追蹤到結果成熟。協定若設定邊界洗脫期,該區間必須由排程固定、同時排除兩組、清楚說明改變後的估計目標,並計入檢定力損失。看到結果後再刪除「疑似污染」訂單會破壞隨機比較。
可把預先註冊的分派契約濃縮成:
實驗單位 = 市場叢集 × 時間區塊
分派方式 = 在市場叢集 × 週內時段層內隨機
資格時間 = 派單策略選擇前記錄
主要結果 = 固定成熟視窗內每筆符合資格訂單的完成外送
主要估計目標 = 全面上線後每筆符合資格訂單的效應
過渡規則 = 曝光前固定;禁止依結果排除步驟五:按有效實驗單位規劃檢定力
利用歷史 A/A 時段或重播的隨機排程,估計叢集時間區塊間的變異、市場內序列相關、共同時間衝擊、流量不均和預定共變數調整。反覆隨機候選排程,在合理殘留假設下計算偵測預先規定最小效應的機率。
有效樣本由獨立分派資訊決定,並非時間區塊內嵌套的原始訂單數。縮短視窗可能增加單位,也可能增加殘留偏誤;擴大叢集能減少空間洩漏,也會減少單位。檢定力規劃應呈現這條偏誤與變異曲線,選擇值得承擔營運成本的最小效應,不能靠排程追求「一定顯著」。
實驗前固定期間、分派比例、停止規則,以及只使用處理前資料的變異縮減。現有叢集無法辨識業務認定有意義的最小效應時,應在上線前揭露限制。再多訂單也無法把 4 個獨立市場變成高檢定力實驗。
步驟六:讓分析方法符合設計和估計目標
依隨機排程做意向治療分析。實際演算法曝光與執行遵循度應另外報告;實驗組發生降級的訂單仍保留在實驗組。分派變化發生在叢集時間區塊層級,健康檢查也要在這一層彙總。
權重必須符合估計目標。叢集時間區塊的未加權平均估計「平均時間區塊效應」。決策目標若是全面上線後每筆符合資格訂單的效應,而且時間區塊規模不同,就應依已知分派機率採用符合設計的 Horvitz–Thompson 或 Hájek 類估計量,並說明目標母體。平均時間區塊效應可作為次要結果,不能悄悄取代每訂單效應。
條件允許時,優先針對實際隨機排程做隨機化推論。模型方法至少要處理同一市場重複觀測、時間序列相依、共同時間衝擊和分層。把每筆訂單視為獨立觀測會產生過窄區間。結果應同時提供效應、區間、最小決策效應,並檢查預先註冊過渡規則的敏感度。
影響分析前先完成下列健康檢查:
- 每一層內的預定處理比例與平衡;
- 分派持續性及實際演算法曝光;
- 兩組的符合資格訂單、降級與事件遺漏比例;
- 跨叢集媒合與外送員移動;
- 結果成熟度及延遲取消;
- 同時進行的實驗與政策重疊;
- 同一資料流程下 A/A 偽陽性率是否校準。
步驟七:把結果連接到放量決策
選擇一個直接對應派單目標的主要結果,例如固定視窗內每筆符合資格訂單的完成外送。使用者護欄可包含取消、逾時、申訴和取餐等待;外送員護欄可包含每活躍小時收入、閒置時間、接單率和不安全的工作量集中。傷害容忍值和回滾門檻都要在曝光前決定。
正向切換式結果支持測試時間區塊下的短期市場政策效應。數週後的運力均衡、外送員學習和留存仍需要額外證據。這些動態會影響決策時,再做持續區域放量或長期保留組,比較其方向與幅度是否和切換實驗一致,並持續監控邊界洩漏。
個體實驗與叢集實驗結果不一致時,不要將兩者平均成一個數字。LinkedIn 的公開後設實驗顯示,這種差異本身可能就是干擾訊號。必須重新核對兩種估計目標、叢集洩漏、分派健康與檢定力,再判斷哪種設計更接近全面上線。
高品質示範回答
「我會先釐清因果問題:目標市場全面採用新派單演算法後,在固定資格條件下,每筆符合資格訂單的完成外送會改變多少。資格定義要在派單前記錄,處理不能改變自己的分母;每筆已分派訂單都追蹤到相同的成熟視窗。
訂單層級隨機分派在這裡會失效。實驗組訂單可能搶到唯一合適的外送員,改變對照組的等待和完成;外送員移動又把影響帶過區域和時間邊界。我會使用實驗前媒合及移動資料建立干擾圖,合併跨區媒合和外送員流動密集的相鄰區域,並用預先註冊指標檢查叢集間污染。24 個區域最終若只形成少數連通市場,我會按實際獨立單位規劃,不會把標籤數當成樣本數。
派單程式可逆,所以第一候選是叢集切換式實驗。每個連通市場叢集在一個時間區塊內統一執行一種演算法,時間區塊在市場和週內時段層內隨機,不能機械交替。視窗長度依訂單完成、外送員重新定位資料及 A/A 排程模擬選擇。短視窗增加單位,也增加殘留;長視窗減少洩漏,也降低檢定力。策略若影響外送員數週行為,我會放棄快速切換,採用持續市場叢集放量。
主要分析按訂單符合資格時排定的演算法做意向治療,降級和失敗訂單保留在原組。分派發生在市場時間區塊層級,因此檢定力和不確定性來自這些單位及其序列相關,不能用數百萬筆訂單製造虛假精度。我會在歷史 A/A 資料上模擬排程,事先規定最小效應、期間和過渡規則,並在可行時採用以設計為基礎的隨機化推論。決策指標是每筆符合資格訂單,所以使用已知分派機率的設計一致加權估計,同時報告未加權的平均市場時間區塊效應。
解讀提升前,我會檢查層內分派平衡、實際策略曝光、降級和資料遺漏、跨叢集媒合、外送員換區、結果成熟度以及同時進行的實驗。主要結果是固定視窗內每筆符合資格訂單的完成外送,使用者取消、逾時、申訴、取餐等待,以及外送員收入、閒置和接單率都有事先定義的傷害邊界。
效應超過最小業務門檻且所有護欄通過後,我會用持續區域放量驗證短期結果能否承受學習與市場均衡變化。若殘留仍很強、叢集太少而無法辨識目標效應,或個體與叢集估計衝突卻找不到機制,我不會把使用者層級結果解讀成全面上線效應,而會重新設計實驗或縮小因果結論。」
常見錯誤
- 獨立隨機數百萬筆訂單 → 兩組消耗相同運力,名目樣本量掩蓋干擾 → 隨機分派能包含主要交互作用的單位,或真正隔離造成干擾的資源。
- 只說「按叢集實驗」 → 地理邊界未必能阻斷外送員移動、社交互動、預算爭奪或跨期殘留 → 從真實機制與處理前資料建立干擾圖。
- 預設使用 30 分鐘切換視窗 → 方便的視窗可能短於配送和換區影響,也可能長於實際需要 → 估計殘留,並以 A/A 資料和模擬校準候選排程。
- 機械交替兩種策略 → 處理可能與尖峰、星期或趨勢重疊 → 在預先定義的市場和時間層內重新隨機每個時間區塊。
- 把每筆訂單視為獨立樣本 → 分派發生在較粗單位,會低估不確定性並提高偽陽性 → 依真實隨機結構規劃檢定力與推論。
- 用未加權時間區塊平均代表每訂單上線效應 → 時間區塊規模不同會改變目標母體 → 先定義估計目標,再採用權重明確且符合設計的估計量。
- 看到結果後刪除邊界訂單 → 依結果判斷的排除會破壞隨機比較 → 預先定義資格、過渡與成熟規則,並保留意向治療分組。
- 把切換式實驗當成通用答案 → 跨期殘留、學習、低檢定力和共同時間衝擊都會使結果偏誤或變弱 → 依條件選擇持續叢集、飽和度或隔離宇宙。
- 只憑短期提升直接上線 → 市場均衡和外送員行為可能在持續放量後改變 → 使用分階段長期放量和雙邊護欄複核。
延伸追問與應對
追問一:24 個區域最後只形成 4 個獨立市場怎麼辦?
4 個市場叢集無法為持續叢集實驗提供足夠資訊,叢集內訂單再多也不能彌補。效應若衰退快,可以增加隨機市場時間區塊,同時正確處理序列相關與跨期殘留。效應若持續數週,只能採用更長的配對或分階段市場放量、加強處理前共變數調整、用模擬降低營運風險,或等待更多獨立市場。必須報告寬區間並縮小結論,不能切碎連通區域來製造獨立性。
追問二:新策略會改變外送員數週的行為怎麼辦?
快速切換會估計目前策略和歷史處理的混合效應,不適合長期目標。改用持續叢集分派或隨機分階段放量,在完整行為週期內量測運力啟用、供給時間、收入、留存和使用者結果,並持續按市場分派。切換式實驗仍可篩查即時演算法效應,但無法取代長期實驗。
追問三:如果測試的是社交分享功能,設計如何改變?
利用處理前關係或互動邊建立圖。多數強連結留在叢集內時,叢集隨機更接近全網路統一處理與統一對照的差異。若還需要拆分直接效應與外溢效應,可先把叢集分派到不同處理飽和度,再於叢集內隨機分派使用者。預先定義「相關鄰居中實驗組占比」等曝光映射,並為社群重疊和較低檢定力保留空間。
追問四:干擾來源是可以拆分的廣告預算怎麼辦?
將預算或庫存拆成獨立宇宙,每個策略只能使用自己的資源池。這能消除直接預算排擠,同時保留使用者層級分派並提高檢定力。仍要驗證資源池無法互借、投放節奏與競價不會重新連接兩組,且預算拆分能代表全面策略。隔離不完整時要量測洩漏並限制結論。
追問五:個體層級實驗和叢集實驗結果不一致怎麼辦?
先檢查兩者的分派、曝光、指標定義、成熟度和檢定力。再比較估計目標:個體實驗量測混合環境中的處理,叢集實驗讓更多鄰近單位共同處理,通常更接近全面上線。量化跨叢集邊和處理密度,並在可能時採用預先註冊的後設實驗或隨機化檢定。顯著差異是需要調查的干擾證據,不能選擇提升較大的結果。
追問六:實務上如何選擇切換視窗?
使用實驗前資料或安全的小流量試驗,繪出策略切換後未完成訂單、外送員位置偏移和關鍵指標的衰退。把多套隨機排程放到 A/A 時段模擬,檢查偽陽性校準、變異及固定邊界緩衝的敏感度。選擇殘留低於預先註冊容忍值且檢定力仍足夠的最短視窗,再對鄰近視窗與過渡規則進行敏感度分析。