
這個問題我覺得有一個很有意思的地方大家未必認(rèn)為 ChatGPT 比 Gemini 更容易“降智”但一旦 ChatGPT 表現(xiàn)變差用戶的反應(yīng)往往明顯更大。為什么我覺得最核心的原因不是模型跑分而是大家對 ChatGPT 的期待太高了。一個你本來覺得考60分的人這次考55分你可能沒什么感覺。但一個長期考95分的人突然連續(xù)幾次考75分你第一反應(yīng)一定是“你最近怎么了”ChatGPT現(xiàn)在面對的差不多就是這個問題。ChatGPT最大的問題是它曾經(jīng)把用戶胃口養(yǎng)得太高很多人第一次真正被大模型震撼就是ChatGPT。2022年底剛出來的時(shí)候那種感覺現(xiàn)在可能很難復(fù)現(xiàn)了。以前搜索一個問題自己找網(wǎng)頁。自己看資料。自己判斷。ChatGPT出來以后你突然發(fā)現(xiàn)我可以直接和電腦討論問題了。后來模型越來越強(qiáng)推理、圖片、文件、搜索、Deep Research、Codex這些能力又不斷往里面加。于是用戶對ChatGPT的定位慢慢變了。以前是“AI能回答成這樣已經(jīng)很厲害了。”現(xiàn)在變成“你可是ChatGPT這都不會”這句話其實(shí)很能說明問題。ChatGPT已經(jīng)不是在和2022年的AI比較了。它是在和**用戶記憶里那個“狀態(tài)最好時(shí)的ChatGPT”**比較。這才是最麻煩的。Gemini的歷史包袱反而沒那么重Gemini其實(shí)也會答錯也會出現(xiàn)前后不一致也有一些回答讓人覺得莫名其妙。但用戶對它的心理預(yù)期不太一樣。尤其早期Bard時(shí)期很多人本來就覺得“Google這個AI好像沒有ChatGPT那么驚艷?!焙髞鞧emini一點(diǎn)點(diǎn)追上來反而形成了另一種心理Gemini這次回答不錯“可以啊Google最近進(jìn)步挺大?!盋hatGPT這次回答一般“OpenAI是不是又降智了”你會發(fā)現(xiàn)同樣一個80分的回答放在兩個產(chǎn)品身上用戶評價(jià)可能完全不一樣。因?yàn)橐粋€是從70分走到80分。另一個在人們印象里可能是從95分掉到了80分。人的感受從來不是只看絕對值。更看重變化。還有一個原因很多人是真的花錢訂了ChatGPT這個影響其實(shí)很大。如果一個產(chǎn)品免費(fèi)你偶爾遇到一次回答不好可能關(guān)掉就算了。但ChatGPT有大量Plus、Pro用戶。尤其是Pro用戶每個月付的錢并不少。一旦付費(fèi)心理就完全不同了。比如昨天同一個Prompt回答特別好。今天突然變得特別敷衍。用戶當(dāng)然會想“我每個月付這么多錢為什么體驗(yàn)還倒退了”這種憤怒并不完全來自“AI變笨”。而是來自付費(fèi)以后產(chǎn)生的穩(wěn)定性預(yù)期。你可以想象一下。一家餐廳免費(fèi)請你吃飯。今天味道一般你可能覺得算了。但如果一家餐廳人均500塊第一次特別好吃第二次明顯變差你大概率會吐槽。不是第二頓真的難吃到不能吃。而是我付的錢和我的期待不匹配了。ChatGPT還有一個特別吃虧的地方大家天天在測它網(wǎng)上測試AI模型有一個很有意思的現(xiàn)象。一個新模型出來以后很多人第一件事就是拿以前ChatGPT答過的問題再問一次。然后開始比較“GPT-5.6這次怎么回答得還不如以前”“這個問題GPT-4當(dāng)年都能答?!薄笆遣皇峭低祿Q模型了”ChatGPT已經(jīng)變成了某種意義上的“基準(zhǔn)”。大家拿Claude和它比。拿Gemini和它比。拿DeepSeek和它比。甚至ChatGPT的新版本還要和ChatGPT自己的老版本比。所以它特別容易產(chǎn)生“降智”的討論。Gemini很多時(shí)候面對的是“這次有沒有超過ChatGPT”ChatGPT面對的是“你為什么沒有超過你自己”后一個要求其實(shí)難得多。而且“降智”這件事本來就特別難證明我覺得網(wǎng)上關(guān)于AI降智的討論有一部分確實(shí)存在體驗(yàn)依據(jù)但也有很多屬于主觀感受。因?yàn)榇竽P筒皇怯?jì)算器。同一個問題你問兩次本來就可能得到不同答案。另外還會受到很多東西影響模型路由。推理強(qiáng)度。上下文。系統(tǒng)指令。是否聯(lián)網(wǎng)。工具調(diào)用。對話長度。產(chǎn)品策略。甚至你Prompt里面一個詞的變化。所以你昨天問一道題答得很好今天答差了并不能直接證明“OpenAI把模型智商砍了20%?!钡脩舨魂P(guān)心這些。用戶看到的就是昨天能做今天做不好。那最直觀的解釋當(dāng)然就是“降智了?!边€有一個經(jīng)常被忽略的問題ChatGPT已經(jīng)不只是一個模型了現(xiàn)在很多人嘴里的“ChatGPT”其實(shí)混合了很多東西。模型是一層。推理等級是一層。搜索是一層。工具是一層。Codex又是一層。系統(tǒng)還可能根據(jù)任務(wù)選擇不同的處理方式。所以有時(shí)候用戶覺得“ChatGPT怎么突然變笨了”未必真的是底層模型能力下降。也可能是這一次沒有投入同樣的推理資源或者任務(wù)被用不同方式處理了。這也是為什么我現(xiàn)在越來越不建議拿一個Prompt測試一次就宣布某個模型降智。至少同一個問題測試幾次再換幾個不同類型的問題結(jié)論才稍微有參考價(jià)值。Gemini為什么相對少挨這種罵還有一個很現(xiàn)實(shí)的原因很多人的主力工具本來就不是Gemini。這點(diǎn)非常重要。假設(shè)你每天使用ChatGPT三個小時(shí)。寫文章用它。寫代碼用Codex。查資料用它。分析PDF也用它。突然有一天它某個能力發(fā)生變化。你馬上就能感覺出來。但如果Gemini你一周才打開兩次。它今天比昨天差5%你根本察覺不到。這和手機(jī)一樣。你每天用的主力手機(jī)掉10%續(xù)航你會特別敏感。備用機(jī)掉20%可能半年以后你才發(fā)現(xiàn)。所以一個產(chǎn)品被罵“降智”多有時(shí)候反而說明它已經(jīng)進(jìn)入了大量用戶真正的工作流。我甚至覺得“降智罵得兇”某種程度上是ChatGPT成功的副作用這可能聽起來有點(diǎn)奇怪。但你仔細(xì)想。如果明天一個沒人用的AI模型能力下降20%網(wǎng)上會有人罵嗎不會。因?yàn)楦緵]人發(fā)現(xiàn)。只有當(dāng)一個工具變成程序員每天寫代碼要用。學(xué)生每天學(xué)習(xí)要用。自媒體每天寫東西要用。公司每天處理資料要用。它的一點(diǎn)變化才會被迅速放大。這和Windows更新一樣。Windows每次更新出點(diǎn)問題網(wǎng)上一片罵聲。不是因?yàn)槿澜缰挥蠾indows有Bug。而是因?yàn)樘嗳嗣刻煲蕾囁?。?dāng)然這不代表所有“ChatGPT降智”都是用戶錯覺我也不贊成另外一種極端說法“模型跑分提高了所以你覺得變笨一定是你的問題?!边@也不合理。跑分提升和真實(shí)使用體驗(yàn)本來就不是完全一回事。一個模型可以在數(shù)學(xué)、代碼、科學(xué)測試上越來越強(qiáng)同時(shí)因?yàn)榛卮痫L(fēng)格、路由策略、推理資源或者產(chǎn)品調(diào)整讓某些用戶覺得日常任務(wù)反而沒有以前順手。能力更強(qiáng)不等于每一種任務(wù)的體驗(yàn)都更好。這點(diǎn)其實(shí)很重要。用戶最終使用的是產(chǎn)品不是Benchmark表格。你告訴我新模型跑分高了15%但我每天做的那件事情反而更難用了那對于我來說這就是體驗(yàn)下降。所以為什么大家更厭惡ChatGPT“降智”我覺得說到底就是四個字期待太高。ChatGPT是很多人的第一款A(yù)I。也是很多人的主力AI。還有大量用戶每個月真金白銀給它付費(fèi)。大家已經(jīng)習(xí)慣了它不斷變強(qiáng)。于是它一旦表現(xiàn)得沒有以前好哪怕只是某些場景下的波動用戶都會非常敏感。Gemini則有點(diǎn)相反。它早期沒有把用戶期待拉到那么夸張的高度后來能力一路往上走用戶更容易產(chǎn)生“它越來越好了”的感覺。所以同樣一次回答失誤Gemini“這次沒答好?!盋hatGPT“是不是又降智了”我覺得這可能才是兩者最大的區(qū)別。用戶真正厭惡的從來不是一個AI“不夠聰明”。而是一個你已經(jīng)習(xí)慣它很聰明、甚至開始依賴它的AI突然沒有昨天那么聰明了。從這個角度看大家天天罵ChatGPT降智某種程度上反而說明了一件事很多人已經(jīng)不是在“體驗(yàn)ChatGPT”了而是真的在依賴ChatGPT。