這次OpenAI沒跳票,
GPT 5.6全家桶來了,之前說的會把Codex內(nèi)置ChatGPT應(yīng)用也兌現(xiàn)了,就是兌現(xiàn)的方式有點想不到。
OpenAI直接把CodeX改名成了ChatGPT。
是的,沒聽錯。Codex這個名字沒了,整個產(chǎn)品改叫ChatGPT了,原來的ChatGPT改名ChatGPT Classic了。然后在里面分了三個區(qū),一個是原來的Codex,展示代碼差異和合并請求。一個是新的ChatGPT Work,把中間的代碼輸出過程藏起來,定位有點像Claude的Cowork。原來的ChatGPT的聊天也移到了左側(cè)欄。
![]()
主打一個大而全。
還加了個站點功能。我們跟Codex對話生成的可視化網(wǎng)頁,可以直接部署成一個可分享的網(wǎng)站。我在試用這個的時候,也順手打開了新的內(nèi)置瀏覽器。現(xiàn)在支持導(dǎo)入所有的密碼和Cookie了,多標簽頁和文件下載也都有了。
再來說說模型,
GPT 5.6現(xiàn)在分三個級別。Sol是超大杯,主打復(fù)雜推理和長時間自主工作,上下文從272k提升到了372k。Terra是大杯,性能接近GPT-5.5但價格只有一半。Luna是中杯,輕量快速。
API定價我直接搓一個表格出來看,Sol每百萬token輸入5刀,輸出30刀,比Fable5便宜43.5%左右。我在測試的過程中發(fā)現(xiàn),這次5.6 sol應(yīng)該是還調(diào)校了對于內(nèi)置插件調(diào)用的主動性。之前讓GPT5.5生成圖表的時候,它是不會主動調(diào)用Canvas Design的。
![]()
Sol還新增了兩個推理檔位。
max讓模型花更多時間深度思考,ultra會調(diào)用多個子Agent并行處理任務(wù),重型任務(wù)開max到ultra,日常任務(wù)用High就夠了。
![]()
比較可惜的是GPT5.6的UI是比5.5要好了但是還是沒有追上Fable5和Opus4.8。
但在其他地方補回來了。發(fā)布前已經(jīng)有很多早期測試者在爆料了,基本上大家的判斷是一致的。
Fable 5更聰明,但比5.6 Sol更容易犯錯。Fable 5更適合規(guī)劃,5.6 Sol更適合執(zhí)行。5.6 Sol的目標驅(qū)動和閉環(huán)做得更好,特別擅長長時間任務(wù),幾個小時甚至幾天那種。而且速度這次上一把大分。在Cerebras芯片加速下跑出了750 tokens/s,比Fable 5快了10倍。
![]()
OpenAI還有狠活,準備跳過5.x,直接發(fā)GPT6。
GPT6會基于一個全新的、規(guī)模大得多的預(yù)訓(xùn)練底座。目前5.5和5.6共用一個代號叫「Spud」的底座,大概4T token,OpenAI原本打算沿用Spud一路做到GPT-6。
但他們臨時改了主意。改主意的原因,所有爆料者幾乎用的同一個詞。
Mythos,GPT-6就是OpenAI對標Mythos的下一代模型。
國內(nèi)這邊也沒閑著。DeepSeek V4正式版大概率7月中旬上線,能力可能追平甚至超過GLM-5.2。同時DeepSeek還在研發(fā)更大的新模型,跟MiniMax即將推出的2.7T的M3 Pro競爭。
只能說Scale Law還沒到頭,
大就是好,好就是大啊。
這波大更新和爆料還把Claude Fable 5嚇得連夜額度充值了。加油加油,我完全支持新的GPT6一把抓住Fable5,頃刻練化。
![]()
再多說一句,
GPT-5.4會在7月23日下線,OpenAI之前推的Atla瀏覽器也會關(guān)停了,現(xiàn)在改成瀏覽器插件的形式了。
回到實操這塊。
這次升級之后有幾個我自己在用的提示語,覺得挺值得分享的。我基本上把現(xiàn)在公開的,還有沒發(fā)布的skill全部優(yōu)化了一遍。
第一個,純黑盒自查。
Codex的瀏覽器自動化升級后,我們可以讓GPT 5.6完全不讀代碼,像真實用戶一樣去點擊每個按鈕、填每個表單,來判斷第一次打開這個產(chǎn)品的人會不會產(chǎn)生疑惑。
我自己的痛點很明確,ai news radar這個AI熱點skill優(yōu)化到了瓶頸,我就想多收集一點意見,特別是跟信息源質(zhì)量相關(guān)的。
![]()
因為自己本身就是開發(fā)者,我總是想當然地操作界面,但實際上我們就是要模擬一個完全不了解產(chǎn)品的人去看一下來挑毛病。我以前是每天要找好幾個人測新功能,有了這個純黑盒走查提示語的話,交給團隊之前就可以先自過一遍。
## 真實用戶走查提示語使用瀏覽器或電腦控制功能打開 [網(wǎng)址],像真實用戶一樣,把以下流程逐一完整走一遍:[注冊]、[結(jié)賬]、[修改設(shè)置]。不要通過閱讀代碼來猜測結(jié)果。每一步都要真實地點擊、輸入、等待并截圖。記錄所有可能讓第一次使用的人感到困惑或受阻的問題,包括:- 頁面加載緩慢- 報錯- 文案讓人看不懂- 找不到按鈕- 當前狀態(tài)不明確- 返回上一頁后數(shù)據(jù)丟失輸出一份按嚴重程度排序的報告。每個問題都要包含:- 復(fù)現(xiàn)步驟- 你判斷的根本原因- 建議的修復(fù)方案然后直接修復(fù)這些問題,再把完整流程重新走一遍,確認沒有引入回歸問題。把我當成一個第一次打開這個產(chǎn)品、從未讀過代碼的普通用戶。
![]()
![]()
第二個,紅隊審查。
5.6 sol的模型能力升級后,我可以在出計劃階段讓Sol反證我們原有的開發(fā)計劃。這跟從頭開始開發(fā)一個項目不一樣,更多的是通過我們已有項目的數(shù)據(jù),來去驗證我們后續(xù)的迭代計劃的可行性。
## 紅隊審查提示語在開始制定這份計劃之前,先充當我的紅隊。你的判斷力就是最重要的武器。 把我的計劃當成一個需要被攻擊和證偽的假設(shè)。首先完整復(fù)述一遍我的計劃,確認你理解無誤,然后開始質(zhì)疑它。假設(shè)六個月后,這個計劃已經(jīng)失敗。從失敗結(jié)果倒推最可能的三個原因:- 哪項未經(jīng)驗證的假設(shè)被我直接當成了事實?- 哪種失敗情形是我從未考慮過的?- 我為了省事,在哪個地方過于樂觀?- 有沒有更簡單的辦法可以實現(xiàn)同一個目標?針對每個原因,分別給出:- 觸發(fā)條件- 失敗代價- 一個能夠盡早證偽它的最小實驗最后給出明確結(jié)論:- 可以直接做- 先做某項實驗,驗證后再做- 推倒重來
拿我自己的真實案例來說。
我最近在做一個讓Claude和Codex協(xié)同干活的工作流,叫做搭子Skill,簡單說就是Claude出計劃,Codex后臺跑實現(xiàn),跑完Claude再驗收。想法是挺好,但從昨天晚上測到現(xiàn)在,總覺得慢,就是說不上來慢在哪。
![]()
于是我把整個優(yōu)化計劃丟給Sol,讓它紅隊審查。
它給我指出了三個點。
第一個,我把「慢」歸在了錯誤的環(huán)節(jié)。我一直以為是啟動腳本拖了后腿,實際上是我把多次調(diào)用codex,以及claude code讀取修改的時間都算在了一次對話里。
第二個,它發(fā)現(xiàn)我在不同Agent上跑的其實不是同一個版本,Codex和Claude Code上版本已經(jīng)悄悄漂移了,我自己完全沒注意到。
第三個,它會質(zhì)疑我「所有任務(wù)都走同一套重型交付流程」的設(shè)計。有些小活讓Claude Code做完可能比走一圈協(xié)作流程更快。
![]()
后來我又拿同一個紅隊提示語去審了另一個PPT生成Skill的迭代計劃,
給humanize ppt做了一個版本升級,花50分鐘把ppt master兼容到下游的生成路徑了,在動手之前就被Sol指出了我沒注意到的假設(shè)盲區(qū),實現(xiàn)的時候都是一次過,省了不少返工。
![]()
![]()
第三個,說一個更大的,
GPT 5.6和Fable 5的聯(lián)動。
簡單版是把Fable 5的提示語總結(jié)成行動規(guī)范,塞在給Sol的提示語前面。加了之后Sol的執(zhí)行風格明顯利索。我覺得體感上最明顯的就是,在做頁面設(shè)計的時候,就不會再把自己的思考過程塞在頁面文字里了。
開始之前,按以下方式工作:1. 信息足夠時,直接行動。不要重復(fù)推導(dǎo)已經(jīng)確定的事實,也不要羅列那些你根本不會采用的選項。如果需要權(quán)衡,請直接給我你的建議,而不是丟給我一份選擇菜單。2. 采用能夠解決問題的最簡單方案。不要添加任務(wù)之外的功能,不要進行無關(guān)的重構(gòu)或抽象,也不要為尚未出現(xiàn)的未來需求提前設(shè)計。3. 匯報進度前,逐項核對你的每個結(jié)論,確保它有本次任務(wù)中的實際結(jié)果作為依據(jù)。只匯報能夠拿出證據(jù)的工作。如果某件事失敗了或尚未驗證,請明確說明。4. 只有在確實需要我介入時才暫停,例如操作可能造成破壞、任務(wù)范圍發(fā)生實質(zhì)變化,或者缺少只有我才能提供的信息。5. 先說結(jié)果。第一句話直接回答“發(fā)生了什么”,然后再補充細節(jié)。具體任務(wù):做一個HTML版的我的世界
進階版是我搞的一套四模型編排。
Anthropic出過一個數(shù)據(jù),Sonnet 5執(zhí)行加上Fable 5當計劃顧問,在SWE-bench Pro上能拿到Fable 5大約92%的分數(shù),成本只有63%。Fable每個任務(wù)大概只需要調(diào)用一次來把方向,Sonnet執(zhí)行大部分工作。
![]()
但我覺得還能再往前走一步。
讓Fable 5出計劃,Opus4.8做深度推理的子Agent。Sonnet5做一些簡單開發(fā)活的子Agent。Codex單獨作為一個有獨立視角的高級工程師。遇到高風險決策讓Opus和Codex背對背做同一個問題,互不看對方答案,F(xiàn)able來綜合最優(yōu)解。
設(shè)置不復(fù)雜,直接在CLAUDE.md里寫好編排規(guī)則就行了。
![]()
用這個工作流我甚至可以只讓fable5出一次計劃,就讓gpt5.6把一個我自用的待辦清單從頭優(yōu)化了一版。提前預(yù)告下周開源!
![]()
我現(xiàn)在的期待完全放在一個月后的GPT-6上。
Fable 5證明了新一代模型的上限可以非常高。
GPT 5.6 Sol的執(zhí)行力治好了Fable5又貴又封號的臭毛病。
如果GPT-6用上了比Spud大得多的新底座,
再配上Sol的執(zhí)行力。。。
那我只能說這下半年將徹底瘋狂!
@ 作者 / 卡爾
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.