![]()
新智元報道
![]()
Grok,學會一鍵看片了?
就在昨天,馬斯克在X上興奮宣布:Grok可以分析任何視頻了!
![]()
在推文中,馬斯克放出一段長達63秒的高清視頻。其中主角,居然是早已離我們遠去的籃球巨星科比。
![]()
在視頻中,科比身穿黑色西裝,坐在洛杉磯夜景前的真皮沙發上。他的手邊放著一個籃球,對著鏡頭向全網推銷Grok 4.5。
「聽著,我是科比·布萊恩特。今晚,我們不談絕殺球,我們來聊聊下一個令人癡迷的東西——Grok 4.5。」
最后還不忘甩出一句經典收尾:「Grok 4.5。偉大是掙來的。曼巴Out。」
如果不是科比已經去世,看到這個視頻的所有人,大概都會懵一會:這是真的還是假的?完全看不出偽造的痕跡啊……
好在,現在我們有了Grok。它能力驚人,不僅能迅速吃透長視頻,甚至還能對極度逼真的偽造視頻迅速打假,進行技術溯源。
甚至,還有人放出實例:Grok 觀看了一段 30 分鐘的完整訪談視頻,學習、分析后,在僅僅大約 36 秒內就生成了詳細摘要。
![]()
插入視頻
Grok的「神級」扒皮秀
如果把這段科比視頻發給普通人,大概率會被瘋狂轉發,甚至有人會以為,這是一段科比生前未公開的商業代言。
但是,Grok一眼就能鑒假。
看完視頻后,Grok交出一份教科書級的報告。
![]()
它敏銳指出,「這是一段AI生成的Deepfake視頻。科比·布萊恩特已于2020年去世,因此整段視頻完全是合成的。」
甚至,它還能對視頻進行技術溯源。
當被問及「這是哪個AI制作的?」時,Grok認為大概率是xAI自家的Grok Imagine Video 1.5。
因為63秒的時長遠超純文本生成視頻(通常10-15秒)的極限,大概率是通過多段拼接,并使用了「圖像參考+文本提示+唇形同步」的混合工作流。
另外,也有可能是Sora 2或Veo 3制作。
![]()
所以,Grok真的能做到完全「看懂」視頻嗎?
有技術大神打假了:Grok處理的根本不是畫面,是字幕。真要逐幀渲染分析,那算力得堆到天上去。
![]()
而且,AI的幻覺老毛病還在。
有人直接拿自己11分鐘的視頻測試了一下,發現摘要里大部分信息要么是轉錄錯,要么純屬編造。
也有人用X直播試了下,效果時好時壞,并不穩定。
![]()
Grok真的能看懂嗎?實測陶哲軒的科拉茨猜想
為了驗證Grok是否真的有看懂視頻的能力,我們決定親自上手實測一把。
比如,有一個數學界的「死亡問題」——科拉茨猜想(Collatz conjecture,又稱 3n+1 問題)。
數學家們普遍認為Collatz猜想是一個難以自拔的泥潭,并通常會提醒彼此不要輕易涉足。提出近100年來,無人公布這一猜想,既無法證明也沒有反例。
2019年,Terence Tao研究了這個問題,一舉超越了過去幾十年其他所有人的成就。
國外的科普網站Quanta發文介紹了這一消息。
![]()
其中,有一段視頻解釋了該猜想:
全程沒有一個字,只是一些數字。
Grok真的能看懂嗎?
結果,出乎我們意料的是,它不僅能解讀核心內容解讀,還能介紹動畫特點,甚至最后點出了數學意義。
視頻展示的是以數字1為根節點,逐步構建的Collatz 逆向樹/圖。每個節點是一個正整數,邊表示 Collatz 規則下的前驅關系:
? 如果一個數 n 是偶數,則 n/2 n指向它;
? 如果一個數 m 滿足 3m+1=n (且 m 為奇數),則 m指向 n 。
動畫從最簡單的「主干」開始,逐步向外擴展所有能最終到達 1 的正整數,直觀呈現「所有正整數最終都會進入 4→2→1 循環」這一猜想的結構。
而且,這段視頻完全沒有字幕!
![]()
昨天,OpenAI直接宣布,下一代模型Astra解決了10個重要的數學開放問題。有網友評論到,Astra這次表現恐怕會讓Hinton都顯得保守過時!
![]()
那Grok真能理解這段長達50多分鐘的視頻嗎?
直接把鏈接給Grok,結果Grok輕松搞定。
基于帖子標注 + 視頻字幕提取,Grok整理出來了視頻核心內容與時間線。
![]()
它歸納了訪談的整體基調與重點。
Hinton 在這段訪談中延續了他 2023–2026 年的一貫立場,但語氣更直接:
1.對 AI 意識的態度:公開承認「已經有意識」,但刻意淡化,以免干擾對更緊迫安全問題的討論。
2.控制與對齊悲觀:人類歷史上沒有成功控制過更高等智能的先例。
3.Agent 風險:自我保存、欺騙、敲詐等行為不是科幻,而是可預期的涌現能力。
4.時間線壓縮:他給出 10–20 年產生「人類無法理解的數學」的預測,但結合當前進展(尤其是 OpenAI 當天發布的 Astra 結果),這個時間表已經顯得保守。
視頻后半段主持人會追問一些更偏商業/政策的問題(從字幕碎片可見涉及 OpenAI 相關話題),但 Hinton 始終把焦點拉回「能力爆炸 + 控制失效」的核心矛盾。
最后,Grok還分析了視頻與帖子上下文的關系!
這個實測結果,實在讓人驚艷。看來,Grok這個模型,不僅僅是讀懂字幕,而是真正的性能提升。
AI 36秒看完30分鐘,那人類干嘛?
30分鐘的信息量,36秒AI就能看完了,簡直是降維打擊。
泡一杯咖啡的功夫,AI就能把一部微電影或一集播客的核心金句和邏輯脈絡,全部放在你面前。
對于信息大爆炸的當代網友來說,這個功能真是救星。
有人表示:救命,我太需要這個了!因為現在的播客都太長了!
「這不就是為我收藏夾里那些聽不完的播客量身定制的?」
![]()
有人感慨說,未來已來。不是因為它的速度,而是從此,很多事我們再也不需要親自動手了。
![]()
而網友分享的案例中,最讓人動容的是,是下面這個真實的故事。
有人分享說,自己的祖母摔倒了,髖部骨折。他用Grok分析了馬斯克在達沃斯論壇上的演講,結果,Grok找到了有用的結果,還定位了精確的時間戳。
![]()
這一刻,AI真的幫我們從海量信息中,撈出來那一根「救命稻草」。
不過,這就留下了一個問題:那人類去干嘛呢?
![]()
細思極恐——我們正在把大腦「外包」出去?
有學者寫了一篇小作文,堪稱對人類命運的終極拷問。
她警告:這樣下去,人類會喪失閱讀、寫作、批判性思考的能力——因為我們把大腦該干的活,全外包了!
![]()
我們的大腦像肌肉一樣,會用進廢退。
深度閱讀、持續專注、記憶回溯、批判性思維、寫作與言語推理——這些能力一旦被外包,都會退化。
你以為,你每天可以消費幾百條36秒摘要,但實際上,你你喪失了在冗長對白里捕捉微妙情緒的能力,喪失了在復雜邏輯中抽絲剝繭的耐心。
甚至,她引用了《圣經·箴言》19:2。
心無知識的,乃為不善;腳步急快的,難免犯罪。
上帝設計我們以合理的節奏去閱讀、消化、理解。人親手制造工具,然后向它們俯首跪拜——這是現代版的科技偶像崇拜。
這種對速度的病態追求,會讓人生變成追逐多巴胺的賽跑,卻無暇顧及真的的意義。
人類的靈魂,真的能外包嗎?
參考資料:
https://grok.com/share/bGVnYWN5_8013f7a3-f604-4351-8cd7-acecf3ef165bhttps://x.com/elonmusk/status/2014501663776588200
編輯:Aeneas
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.