無論是機器人、自動駕駛,還是具身智能體,它們都需要在現實世界中做出符合物理定律的正確決策。這背后的核心能力,即為“物理推理”。
如今,上海 AI Lab 團隊在實現通用物理智能的道路上取得了關鍵里程碑——P1-235B-A22B 成為首個在國際物理奧林匹克競賽(IPhO 2025)中達到金牌水平的開源模型,并在 2024/2025 年度的 13 場國際及區域性物理競賽中斬獲 12 枚金牌。
更重要的是,當進一步結合智能體框架 PhysicsMinions 后,P1-235B-A22B 超過了 Gemini-2.5-Pro、GPT-5 等閉源模型,在 IPhO 2025 中綜合排名第一。
據官方博客介紹,P1 系列模型獲得國際物理奧林匹克競賽金牌,核心在于其“強化學習 + 多智能體協同進化”的訓練體系。
1?? 以高質量的奧賽級題庫為基礎,通過多階段強化學習不斷強化模型的推理能力,涉及兩項關鍵策略:
-逐步擴展上下文窗口:讓模型能處理更長的推理鏈,解決復雜題時減少信息截斷帶來的錯誤;
-通過率過濾機制:在訓練數據中篩除過難或過易題目,使學習曲線平穩、效率更高。
這一過程讓 P1 模型實現了在基座語言模型的基礎上長期、持續的性能提升。
2?? PhysicsMinions 多智能體系統旨在突破單模型的上限,讓不同模塊分工協作、相互校正。主要涉及以下兩個模塊:
-邏輯模塊:生成初始解決方案,并通過自我改進和自我反思逐步改進解答。
-審核模塊:執行雙階段驗證:物理驗證器檢查物理一致性(比如常數、單位),而通用驗證器檢查邏輯、推理和計算。
通過這種協同進化協作,PhysicsMinions 能夠持續提升復雜物理問題的推理質量和魯棒性。
此外,除了物理領域,P1 系列模型在數學、編程等其他推理任務上也同樣展現出色,凸顯了 P1 系列模型的強大泛化能力。
#大模型 #人工智能 #物理 #物理奧賽 #國際物理奧林匹克競賽 #科技
![]()
![]()
![]()
![]()
![]()
![]()
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.