9 月 14 日,404 Media 揭露了一個內部代號:Project Lily。OpenAI 在這個專案下僱了幾百名外包工,讀的是真實使用者跟 ChatGPT 的對話。
工作內容按拿到的內部文件是兩步。先把使用者當時想問的東西概括成一句話,再給四個生成出來的回答按 1 到 7 評分。
這份工是怎麼發出去的
找人的是一家叫 Crossing Hurdles 的公司,薪水透過 Mercor 這個人力平台結算。一名做過這批任務的人說,時薪超過 50 美元。
看得到的和看不到的,OpenAI 劃了一條線。外包工看不到使用者名稱。公司說在對話送到評審手裡之前會盡量把個人資訊去掉,但也承認敏感內容仍然會漏過去。一名知情者被問到使用者知不知道自己的對話正被人讀,回答是不知道。他的原話是,沒有人會想像某個地方有個外包工正在分析這些對話。
規模那一側的數字是現成的:ChatGPT 的使用者超過 9 億,消費版方案預設打開了訓練開關。
這也不是 OpenAI 一家的做法。Anthropic 向 404 Media 確認自己同樣在用人工審查改進模型,Google 那邊也有同類專案在跑。
同一個工種,四年之內價格翻了幾十倍
這個職位本身不新。新的是價格。
我們 4 月 20 日寫過 Sama 關掉肯亞的業務、1108 人一次性失去工作。那批人做的也是給 AI 的輸出標註、分類、審內容,奈洛比的價碼是按每小時幾美元算的。8 月 28 日我們又寫過 EXL 花 3.1 億美元買下 iMerit 的 68000 個評估席次:評估這件事已經貴到要整批收購才拿得到產能。
Project Lily 是這條曲線的最新一個點,而且這一跳的幅度很大。同樣是看著 AI 的輸出評分,奈洛比的價碼是時薪幾美元,Mercor 上是時薪 50 美元以上。
差別在於評什麼。審內容是判斷一段話有沒有越線,規則寫在手冊裡,誰讀都能對。給四個回答排序不是這樣的活。要判斷哪個回答更好,你得先懂使用者問的那件事本身:他是在改一份合約,還是在配一段程式,還是在算一筆稅。這就把評審的門檻從識字加耐心,抬到了懂這一行。
換個說法:Project Lily 找的不是標註員,是各行各業的從業者,只不過工時按外包結。
AI 造出來的那個職位,長這個樣子
這兩年有一個反覆出現的問句:AI 淘汰了那麼多職位,它自己造出來的是什麼。
Project Lily 給了一個具體到能拿去比對的答案。這個職位是合約制的,沒有職級,沒有晉升路徑,薪水走第三方平台發,工時按專案開合。它同時是這類工作已知的最高價:50 美元的時薪,在美國已經高過不少全職白領職位的折算時薪。
兩頭都是真的,這也正是它值得記下來的原因。它不是一份差工作,它是一份沒有形狀的好工作。你拿的是行業專家的價錢,簽的是零工的合約,而專案本身隨時可能因為某一版模型在某個領域不再需要人評分而關掉。
往下該盯垂直領域。我們 9 月 10 日寫過 OpenAI 把金融服務的初級分析工作打包成一套產品:模型要在金融、法律、醫療這些地方頂上去,就得有懂這些行當的人先給它的輸出排序。這意味著同一套結構大概率會一個行業一個行業地複製過去:找的是專業人士,按小時算錢,簽的是外包合約,薪水從平台走。
對一個手裡握著行業經驗的人來說,這裡有一個很現實的問題要先想清楚:給模型的回答排序,是在把你那份經驗租出去,還是在把它賣斷。兩者的時薪可以一模一樣。