加拿大溫哥華當地時間6月21日,人工智能領域最有學術影響力的頂級會議之一——國際計算機視覺與模式識別會議(CVPR)2023正式公布了最佳論文等獎項。上海人工智能實驗室(上海AI實驗室)、武漢大學及商湯科技聯合提出的自動駕駛通用模型相關論文從9155篇作品中脫穎而出,獲得本屆CVPR最佳論文獎。
據悉,這是近十年來計算機視覺三大頂級會議中(CVPR、ICCV、ECCV)第一篇以中國學術機構作為第一單位的最佳論文。入圍本屆CVPR最佳論文候選名單的作品來自包括谷歌、上海AI實驗室、斯坦福大學、康奈爾大學等在內的世界頂尖企業及機構。
最終,上海AI實驗室聯合團隊的研究成果《Planning-oriented Autonomous Driving》(以路徑規劃為導向的自動駕駛)摘取CVPR 2023最佳論文獎。該論文首次提出感知決策一體化的自動駕駛通用大模型UniAD,開創了以全局任務為目標的自動駕駛大模型架構先河, 為自動駕駛技術的發展創新提出了新的方向。
(資料圖片僅供參考)
自動駕駛研究突破“當下最優模型”
CVPR在學術界及工業界都極具影響力。根據谷歌學術指標(Google Scholar Metrics)2022年列出的全球最有影響力的六大科學期刊/會議中,CVPR位列第四,僅次于《自然》(Nature)、《新英格蘭醫學雜志》(NEJM)、《科學》(Science)期刊,排在《柳葉刀》(The Lancet)和《先進材料》(Advanced Materials)之前。
本屆CVPR論文投稿總量達9155篇,最終共有2369篇論文被接收。最佳論文候選為12篇,接收率僅為0.13%。提交機構不乏谷歌、Stability AI等人工智能領域頂尖企業,也包括上海人工智能實驗室、斯坦福大學、康奈爾大學、香港中文大學、香港科技大學、南洋理工大學等世界一流研究機構及高校。
CVPR 2023最佳論文獎提出的自動駕駛通用算法框架——Unified Autonomous Driving(UniAD)首次將檢測、跟蹤、建圖、軌跡預測,占據柵格預測以及規劃整合到一個基于Transformer 的端到端網絡框架下,更高效契合了“多任務”和“高性能”的特點,取得自動駕駛技術研究重要突破。
自動駕駛UniAD框架對比(a)模塊化(b)多任務模塊(c)端到端自動駕駛模塊
這種端到端的優化在多項關鍵技術指標上超越了SOTA(目前最好/最先進的模型)。比如,多目標跟蹤準確率超越SOTA 20%,車道線預測準確率提升30%,預測運動位移誤差降低38%,規劃誤差降低28%。
上海AI實驗室青年科學家李弘揚介紹,憑借其充分的可解釋性、安全性、與多模塊的可持續迭代性,UniAD是目前為止最具希望實際部署的端到端模型。該科研成果在產業界的落地應用,將有力地推動自動駕駛技術與產品的規模化發展。
商湯科技聯合創始人、首席科學家王曉剛表示,UniAD是業內首個感知決策一體化的端到端自動駕駛解決方案,并且整體系統和性能取得大幅提升,代表了未來自動駕駛技術的發展趨勢。
加速推動AIGC時代真實感3D內容生成
本屆CVPR上,上海AI元素十分醒目。除了一篇最佳論文外,商湯科技及聯合實驗室還有一篇論文入選最佳論文候選名單。
面向真實 3D 物體的感知、理解、重建與生成是計算機視覺領域一直倍受關注的問題。由于缺乏大規模的真實掃描三維數據庫,最近在三維物體建模方面的進展大多依賴于合成數據集。該候選論文《OmniObject3D: Large-Vocabulary 3D Object Dataset for Realistic Perception, Reconstruction and Generation》提出了OmniObject3D,一個具有大規模高質量真實掃描3D物體的大型詞匯3D物體數據集,覆蓋近200個類別、約6000個三維物體數據,包括高精表面網格、點云、多視角渲染圖像和實景采集的視頻,借助專業掃描設備保證了物體數據的精細形狀和真實紋理。
OmniObject3D是目前學界最大的真實世界三維掃描模型數據集,為未來三維視覺研究提供了廣闊空間。利用該數據集,研究人員精心探討了點云識別、神經渲染、表面重建、三維生成等多種學術任務的魯棒性和泛化性,驗證其從感知、重建、到生成領域的開放應用前景,有望在AIGC 時代推動真實感3D生成方面發揮至關重要的作用。
另外,上海AI實驗室有12篇論文入圍“Highlight”名單,覆蓋視覺基礎模型、通才模型、三維視覺、底層視覺、視頻檢索、物體檢測、姿態估計、自動駕駛等相關領域的研究。商湯科技共計54篇論文被接收。
上海元素在CVPR上星光熠熠。
作者:沈湫莎
圖片:受訪者提供
責任編輯:任荃
*文匯獨家稿件,轉載請注明出處。
標簽:
