沒上過館子的菜,到底好不好喫?一場關於試菜的餐桌對話
校招Agent專案全是Demo沒有線上流量的討論,被我們翻譯成廚房裡試菜、盲測與小鍋試做如何被評分的滋味故事。
求職論壇上最近有一個問題被反覆討論:校招做的 Agent 專案,幾乎都是 Demo,沒有真的線上流量,評測到底該怎麼做,面試官又到底想看什麼。這個問題表面上是工程題,但你看久了會發現,它其實是一道廚房裡的老題目:一個只在自己家爐子上試做過三次的菜,你憑什麼說它好喫?
這件事讓我想起試菜這件事本身。每一道端上餐廳餐桌的菜,都曾經是某個人鍋子裡的 Demo。
試做跟量產,本來就是兩個爐子
你自己一定有這種經驗。週末在家試了一道紅燒牛肉,小鍋、兩三塊牛腱、小火慢燉兩小時,湯色濃得發亮,牛肉用筷子一撥就散開,膠質黏在嘴脣上。你覺得這道菜成了。
可是同樣的配方,換成拜拜那天要滷的一大鍋,事情就全變了。鹽要重新算,醬油下鍋的時機要重抓,火要轉得更小更均勻,不然鍋底的肉焦了,上面的還沒入味。料多一倍,時間不是多一倍,是多了更多的不確定。
Demo 跟線上流量的差距,就是這口小鍋跟那口大鍋的差距。家裡試做的時候,你可以盯著它、嚐它、隨時補救;真的開店上桌,客人是陌生的舌頭,時間是不等你的,一鍋出問題就是一整排桌子的事。所以餐廳的廚房裡有一套試菜的規矩:同樣的料,不同的師傅各做一輪,互相盲嚐,誰的版本酸甜最穩、誰的顏色最不容易暗掉,留下誰的。
你沒有開過店,但你做過三次,這三次裡每次的味道差多少,你嚐得出來,也說得出來。這件事本身就有價值。
評測不是打分數,是把舌頭訓練出來
廚房裡有所謂的標準化味覺訓練。想學嚐味道,不是喫得多,而是每次只改一個變因。同一鍋清燉蘿蔔湯,一份鹽放五克,一份放七克,其他全部一樣,喝起來的差異你就會突然聽得見,像耳機的音量往上推了一格。下一輪,換成白蘿蔔去皮跟不去皮,湯的清濁、那一絲尾端的辛辣,又是另一回事。
這跟評測 Agent 的邏輯是同一件事。沒有線上流量,你還是可以做對照:同一個任務,換一種寫法的提示詞,換一個工具呼叫的順序,換一種失敗之後重試的策略,然後老老實實記下來哪一版成了、哪一版歪了、歪在哪一步。三十個案例的差異分析,比一句「效果不錯」有說服力太多了,就像「好喫」兩個字,遠不如「第二版的酸比第一版收得住,尾韻沒有搶過魚的甜」來得像一個真的下過廚的人會說的話。
盲測也是家裡就能做的。滷味切盤,同一塊牛腱,一份現滷、一份冰過一夜回溫,請家人不看盤子只憑舌頭投票。你會發現有些味道隔夜更沉,有些香氣跑光了。這種結論沒有任何流量支撐,但它真實,而且可重複。
失敗的紀錄,比成功的食譜更像本事
我認識一位做辦桌的師傅說過一句話,我一直記著:食譜誰都抄得到,會救菜的人纔請得起。
一桌菜十道,現場一定出狀況。羹太稀,現場補太白粉要補得快又不能結塊;魚蒸過頭了,淋醬的糖醋要壓得住那股乾柴。師傅的價值在那些救回來的瞬間。這也是面試裡最想聽的部分:你的 Demo 出過什麼事。哪一次它自信滿滿地給了完全錯誤的答案,你怎麼發現的,加了什麼檢查,檢查本身又誤傷了哪些正常案例。這一來一往,就是你鍋子裡的真實火候。
這個道理跟我們之前聊過的廚房裡的火候考試是同一條線:被問到極限的時候,答得最好的往往不是背套路的人,是真的被那口鍋燙過的人。沒有線上流量不等於沒有故事,等於你的故事要從試做與失敗裡長出來,而不是從部署報告裡抄出來。
把小鍋的事講清楚,就是一種專業
回到那個論壇問題。其實問的人已經把答案寫在題目裡了:既然大家都是 Demo,那比的從來就不是流量,是誰把自己的鍋看得最清楚。
廚房給的建議很樸素。第一,把變因一個一個隔開,像調鹽那樣,讓每一輪差異都有名字。第二,找陌生舌頭來嚐,室友、同學、家人,他們不知道你的設計意圖,他們的困惑就是最便宜的評測。第三,把失敗留檔,哪一步塌了、怎麼補的、補完又冒出什麼新問題,這串紀錄比成果截圖更像一個會做菜的人。
這也讓人想起先前那篇被追問火候的廚房面試:被皺著眉頭問到底的經驗,廚房裡的人早就天天在經歷,而撐過那種追問的,都是對自己那口鍋誠實的人。
週末不妨真的試一次。同一道菜做兩輪,只改一個地方,盛盤前自己先盲嚐,然後誠實寫下差別。你會發現,評測這件事不神祕,它就是一雙訓練過的舌頭,加上一份不護短的手記。沒開過館子的菜,也可以被講得讓人相信它好喫,只要講的人,真的喫過自己鍋裡的每一口。