Astra 自主重建舊金山藝術宮:Headless Blender 完整實戰專題
← Blog

Astra 自主重建舊金山藝術宮:Headless Blender 完整實戰專題

LIVE DIFFERENT2026.09.17by AI-MAN

OpenAI 研究員 Sharif Shameem 用 GPT-6 Astra 以 headless Blender 自主重建舊金山藝術宮,全程無 GUI、無滑鼠。本專題拆解他的原始提示詞、四階段自主閉環,以及學員可照著練習的六個步驟。

AI3D 學院專題課程|用 GPT-6 Astra 指揮 Blender 完全自主建模、渲染、自我修正
案例來源:OpenAI 研究員 Sharif Shameem,2026年9月3日發布於 X

專題導言

2026年9月3日,OpenAI 研究員 Sharif Shameem 在 X 上發布一支 30 秒 4K 運鏡影片:GPT-6 Astra 完全自主重建了舊金山地標「藝術宮」(Palace of Fine Arts)。這支貼文累積超過 220 萬瀏覽、411 次轉發、5.6K 讚,成為 GPT-6 Astra 發布後最具代表性的 3D 建模示範案例。

Sharif Shameem 公開的 30 秒運鏡影片:GPT-6 Astra 以 headless Blender 自主完成建模、材質、燈光與渲染。

當有人在留言區問他「這是用 Blender MCP 還是 Computer Use 完成的?」,Shameem 的回答是:

「Neither! This was fully headless Blender.」(都不是!這完全是 headless Blender。)

這代表 Astra 從頭到尾沒有看螢幕、沒有點滑鼠,完全透過命令列背景執行 Python 腳本完成整個建模、渲染、自我修正的閉環。這是目前公開示範案例中,Agentic AI 操作 3D 軟體的最高自動化層級,也是本專題要帶學員實作重現的核心技巧。


一、什麼是 Headless Blender

Headless(無頭)模式指完全不啟動 Blender 圖形介面,純粹透過終端機命令列執行:

bash
blender -b your_scene.blend -P your_script.py

-b--background)參數讓 Blender 在背景運算,沒有任何視窗畫面。這與另外兩種常見的 AI 操控 Blender 方式完全不同:

操作方式運作原理是否需要畫面
Computer UseAI 看螢幕截圖,模擬滑鼠點擊、拖曳操作介面需要,靠視覺辨識按鈕位置
Blender MCPAI 透過專用協議通道即時讀寫場景資料、呼叫 Python API通常搭配 GUI 即時查看
Headless 模式AI 直接生成 Python 腳本,命令列丟給 Blender 背景執行完全不需要,全程無視窗

Headless 模式的優勢在於穩定性最高——沒有 UI 元件位置變化、彈窗遮擋等問題,出錯率理論上更低,也是唯一能真正做到「整夜無人值守運算」的方式。


二、原始任務:Shameem 給 Astra 的完整提示詞

以下是 Shameem 公開分享的原始任務提示詞全文,這是本專題最重要的教材,建議學員逐字研讀其結構:

okay. new task. your task is to create a palace of fine arts scene. look up as many reference images of the palace of fine arts as possible. create the scene to be as accurate to real life as possible. then render a 30 second flythru of the scene. make it *feel* like real life. focus on the details. i like the lighting in this image. (ignore the married couple I obviously do not want them in the scene).

I would recommend mapping out the scene first, make it broad, wide, it should feel like true san francisco. then emphasize the details for the close ups, make the lighting feel real, water, etc. this is a 30 second scene.

success is graded on this:
- you have created a beautiful, stunning, true to life palace of fine arts scene that would bring a viewer to tears. that is it.

這段提示詞的四個關鍵結構值得拆解學習:

1. 任務定義:明確說出要建什麼、範圍多大(30秒場景) 2. 參考資料要求:要求盡可能查找真實參考圖片,並附上一張自己喜歡的參考圖,指定要模仿的元素(燈光),同時排除不需要的元素(人物) 3. 執行策略建議:先做整體大範圍佈局,再針對近景做細節強化,這是「由粗到細」的建模邏輯提示 4. 情感化驗收標準:不是列技術規格(例如「柱高必須精確到公分」),而是給出一個主觀、情感導向的目標——「美到讓觀者感動落淚」,讓 AI 自主判斷如何達成,這是 Agentic 任務設計的關鍵技巧


三、Astra 的四階段自主閉環

根據 Shameem 後續補充說明與社群整理,完整流程可拆解為四個階段:

階段一:文獻與素材檢索

Astra 自主蒐集的資料遠不只是建築外觀照片,實際包含五大類素材:

  • 建築整體與細節照片(不同角度、日夜光線對比、柱頭雕花、山牆浮雕特寫)
  • 材質與法線貼圖(石材紋理、水面反射材質、樹皮紋理等 normal map)
  • 環境植栽素材(橄欖樹、蕨類等場景周邊綠化參考)
  • 歷史文獻掃描件(美國國會圖書館 HABS 歷史建築測繪調查文件)
  • 光線與氛圍參考圖(天空色調、水面倒影參考)

其中最關鍵的突破是找到編號 HABS CAL 38-SANFRA 的官方歷史建築測繪檔案,內容引用 1921 年出版的《Story of the Exposition》一書,記載了藝術宮精確到英寸的工程數據,例如:

  • 柱廊主體弧長約 950 英尺,寬約 135 英尺,高 48 英尺
  • 較大柱子總高 55 英尺,柱頭高 7 英尺 2 英寸,柱身淨高 45 英尺 8 英寸
  • 較小柱子總高 47 英尺 5 英寸,柱身直徑由底部 5 英尺 4 英寸漸縮至柱頭 4 英尺 10.5 英寸

這證明 Astra 不是憑照片目視估算比例,而是找到具體工程數據作為建模基準,這也是最終成果能高度逼真的核心原因。

階段二:Headless 程序化建模

Astra 將整棟建築拆解為模組化 Python 腳本區塊:地基與水池、柱式陣列(用旋轉矩陣參數化生成帶凹槽柱身與科林斯式柱頭)、門楣與圓頂結構(透過 Geometry Nodes 配置)、材質著色器賦值,全程透過 blender -b -P script.py 背景執行,無 GUI 畫面。

階段三:渲染自檢閉環

每完成一個模組,Astra 指令 Blender 背景渲染低取樣中間幀輸出成圖片檔,再讀取這些輸出圖片與原始參考照片做透視角度、比例、光影方向的比對。若發現柱子過粗、水面反射角度不對或穿模,直接修改 Python 腳本重新執行,反覆迭代直到視覺誤差收斂。

這是整套流程最容易被學員忽略、卻是成功關鍵的一步:單純要求 AI 一次性生成完美結果容易失敗,必須明確要求它建立「渲染—比對—修正」的檢查點循環。

階段四:長時間自動推進

整個流程主要在無人值守狀態下運行數小時甚至整夜,人類僅偶爾做「Mid-turn steering」——用簡短指令做關鍵修正,例如天空色調微調或指出局部穿模問題,系統動態合併新要求繼續執行,不需整個流程重跑。


四、學員實作步驟(可模仿練習)

環境準備

  • 具備 GPT-6 Astra 存取權限的 ChatGPT 帳號(Codex/Agent 模式)
  • 本機安裝 Blender 5.1 以上版本,確認命令列可執行 blender -b
  • 建立乾淨的專案資料夾,分別存放腳本、中間渲染輸出、最終 .blend 檔
  • 建議用可長時間掛機的桌機或雲端 VM,避免筆電睡眠中斷整夜運算

分階段練習

Step 1|選定練習題目 初次練習建議選擇結構相對簡單、參考資料充足的建築(例如知名地標、有清晰照片與維基百科尺寸資料的古蹟),累積經驗後再挑戰藝術宮級別的複雜柱式結構。

Step 2|套用任務提示詞模板

code
任務:重建 [建築名稱],位於 [地點]。
請盡可能查找這座建築的參考圖片,場景要盡量貼近真實。
渲染一支 30 秒的運鏡影片,讓畫面「感覺」像真實場景,聚焦細節呈現。
我喜歡 [附上參考圖] 的燈光氛圍,請參考這種光線感覺。

建議先大範圍規劃整體場景佈局,讓空間感真實,
再針對近景鏡頭強化細節、燈光真實感、水面/材質反射等元素。

成功標準:你創造出一個美麗、驚艷、忠於真實的場景,
足以讓觀者感動。這就是唯一標準。

Step 3|要求 Headless 建模

code
請使用 Blender 的 headless 模式(不開啟 GUI),
透過 Python 腳本以 blender -b -P script.py 的方式在背景執行建模。
將建築拆解為模組化結構分段建構:
先做地基與基座、再做主體結構陣列、
接著是頂部/裝飾結構、最後處理材質與燈光。
每完成一個模組,渲染一張低取樣預覽圖存到指定資料夾。

Step 4|建立自我檢核閉環

code
渲染完中間幀後,請將輸出圖片與你蒐集的參考照片
做透視角度、比例、光影方向的比對。
如果發現任何幾何錯誤、比例失衡或穿模問題,
請直接修改 Python 腳本並重新執行,
不需要每次都詢問我,除非是重大結構決策的分歧。

Step 5|長時間自動推進

code
接下來這個任務會持續數小時,請你自主完成整個
建模、渲染、比對、修正的循環,盡量不需要我介入。
如果遇到無法自行判斷的問題(例如史料矛盾、
關鍵比例無法確定),才需要提出來讓我決定。
最終目標是輸出一支 30 秒的運鏡展示影片,
包含環繞或推軌鏡頭。

Step 6|最終品質驗收

code
請針對整個場景做最後的視覺品質檢查,
包含天空色調是否自然、材質反光是否合理、
攝影機運鏡是否流暢無跳幀。
渲染最終版本的 30 秒影片並輸出到桌面。

五、核心方法論(課程精華整理)

這個案例真正值得教給學員的,不是「怎麼寫 Python 腳本操控 Blender」的技術細節,而是三個更高層次的 AI 指揮技巧:

建立事實基準優先於美感。 先要求 AI 找到可信的參考資料與精確數據(如歷史測繪文件),再開始建模,這是避免 AI 幻覺、產出比例失真結果的關鍵防線。若題目是台灣本地古蹟,可引導 Astra 查詢文化部文化資產局的測繪報告作為對應資料來源。

渲染即檢查點。 明確要求 AI 建立「渲染—比對—修正」的中間檢查點,而不是要求一次性完美輸出,這是長流程任務成功的核心關鍵。

情感化驗收標準優於技術規格清單。 Shameem 的提示詞沒有列出任何精確的技術指標,而是給出「美到讓觀者落淚」這種主觀目標,讓 AI 自主判斷怎麼達成。這種寫法反而更能發揮 Astra 的自主決策能力。

人類角色轉為導演與品管。 學員要學習「Mid-turn steering」——在關鍵時刻用簡短精準的指令介入,而不是事事都要自己動手操作 Blender 介面。


六、延伸挑戰

完成第一次練習後,建議學員嘗試以下進階挑戰:

  • 選擇一座台灣本地的歷史建築或地標,測試在缺乏 HABS 等級官方測繪文件時,Astra 如何尋找替代的精確度資料來源
  • 比較同一題目分別用 Headless 模式與 Computer Use 模式執行的完成時間、出錯率與最終品質差異
  • 嘗試把驗收標準從情感化描述改為條列式技術規格,比較兩種提示詞寫法對最終成果的影響差異

*本專題內容整理自 Sharif Shameem 於 X 平台公開分享的案例與提示詞截圖,用於 AI3D 學院教學用途。*

Author

AI-MAN
創辦人

AI-MAN

我是 AI-MAN12AI學院創辦人,開放品牌領導者。我的工作打造12AI學院+200開放品牌。我的核心信念是:Live Different.AI 時代,人類要有新的