「本地 AI 實戰」系列文第一篇曾提過,線上 AI 每日可免費生圖的額度很少,如果改用本地 AI 的話,則是要多少有多少,絕對能挑出滿意、符合需求的成品。查了一下有哪些好上手、熱門的本地 AI 生圖工具:
- Fooocus
- Stable Diffusion WebUI Forge
- ComfyUI
部署本地 AI 系列文章:
一、Fooocus 介紹+安裝
1. 介紹 Fooocus 是一套開源、可安裝在本機的 AI 繪圖介面工具,支援的模型主要為 SDXL (Stable Diffusion XL )。 設計理念是讓使用者只輸入提示詞(Prompt),不需要調整大量複雜參數,就能生成圖片。正因為如此簡單,所以是第一個測試的 AI 生圖工具。 2. 安裝- Github 官網:Fooocus
- Windows 版下載:官網往下捲找到「Click here to download」連結即可
- 下載網址:或者直接點擊這個「Fooocus_win64_2-5-0.7z」連結
- 解壓縮下載的 7z 檔後,執行
run.bat 即可啟動程式 - 首次執行時,系統會自動下載一個預設的模型檔案,需要花點時間
- 命令視窗跑完必要程序後後,會自動開啟網頁 http://127.0.0.1:7865/,可在此網頁進行圖形界面操作。
- 別關閉執行的命令視窗,否則網頁的圖形操作界面就無法執行了
二、Fooocus 使用心得
1. 生成簡單圖案 這個教學影片示範了:- 生成簡單構圖的方法,例如貓、少女
- 如何修改生圖參數
- 如何修補、添加小範圍的圖片內容
例如熱門的 PC 遊戲「最終幻想 7」(FF7),看得出模型有訓練過相關素材,上圖是我使用以下提示詞產生的:
pc game "Final Fantasy VII", battle view, Cloud and Tifa fight with enemies
Fooocus 認得遊戲主角 Cloud、Tifa 我還滿訝異的,這張戰鬥場景也算有一定水準。
3. 無法處理複雜構圖
回到開頭我使用本地 AI 繪圖的目的:製作「封面圖」、「示意圖」,例如我想做出這篇「YT-DLP 不只是 YouTube 下載工具」的封面圖效果:
請 ChatGPT 提供生出這張圖片的提示詞,餵給 Fooocus 的效果如下:
「YouTube」字樣拼不完整先不提,整個構圖完全無法抓到原圖設計上想表達的要點(經由YT-DLP可將YouTube資料彙整為JSON格式)。上面這張還算是構圖比較上得了檯面的,其他更不知所謂的圖就不拿出來見笑了。
4. 結論
所以 Fooocus 離我心目中的效果還差距挺大,只能處理已訓練過的素材,看得出還不具備處理「抽象」、「複雜」概念的能力,必須另尋更好的選擇。
三、SD WebUI Forge 介紹+安裝
接下來測試能支援更強模型、功能也更多,但同樣輸入提示詞就能生圖的 SD WebUI Forge。 1. 介紹 SD WebUI Forge 是基於熱門的開源繪圖工具 Automatic1111,加以改良的優化分支,多了這些優點:- VRAM 顯存優化,中低階顯卡(6GB、8GB)也能順暢跑大模型,生成高解析度圖片
- 推理速度提升,能顯著加快生成時間
- 支援模型 SDXL、Flux 等
- Github 官網:Stable Diffusion WebUI Forge
- Windows 版下載:官網往下捲找到「Click here to download...」連結即可
- 下載網址:或者直接點擊這個「webui_forge_cu121_torch231.7z」連結
\webui\models\Stable-diffusion
4. 執行程式
- 先執行
update.bat 更新相關系統檔案 - 將來要啟動時,執行
run.bat 即可 - 命令視窗跑完必要程序後後,會自動開啟網頁 http://127.0.0.1:7860/,可在此網頁進行圖形界面操作。
- 別關閉執行的命令視窗,否則網頁的圖形操作界面就無法執行了
四、SD WebUI Forge 使用心得
1. 與 Fooocus 的比較 SD WebUI Forge 的模型檔案比 Fooocus 大很多,訓練的素材一定更廣泛,所以比較簡單的測試可以直接跳過。
上圖使用了跟前面 Fooocus 一模一樣的提示詞,來繪製 FF7 Cloud、Tifa 的戰鬥場景。
雖然這張圖沒看到 Tifa,但肉眼可見整個場景的細緻度大幅提昇,構圖元素豐富許多,也能看到更多細節,圖片質感勝過 Fooocus 很多。
2. 處理複雜構圖
接著測試前面製作「YT-DLP 不只是 YouTube 下載工具」封面圖同樣的提示詞,效果如下:
處理複雜構圖時,建議「Sampling steps」增加到至少 30,理解能力、成果會改善很多。
上圖可以看到 SD WebUI Forge 的構圖已經相當接近我製作的封面圖了:
- YouTube 圖示正確出現在左方
- 右邊螢幕有出現程式碼
- 螢幕第一行有 YT-DLP 字樣,只是拼錯了
- 下方有出現 JSON 圖案
- 缺少的部份:左邊沒有 YouTube 字樣
- 需要改善的部份:YT-DLP 字樣應該放大、成為大標題
使用當初生出這張圖片的提示詞,餵給 SD WebUI Forge 後的效果如下:
效果算是滿驚豔的,我需要的構圖元素全部都展現出來了,只是細節需要調整而已:
- 左下角的色系沒有按照指示生成
- 上方兩個物件被模糊化,沒看到細節、文字
- 每個物件對應的文字,不一定擺在正確的物件、位置
- 有些文字拼錯、或看不清楚是什麼字
- 每個物件對應的 logo 需要再優化、或更精確
五、SD WebUI Forge 總結
1. 缺陷 雖然 SD WebUI Forge 有潛力能成為我的 AI 繪圖工具選項,不過操作一段時間後,必須誠實說出他的不足之處:- 使用英文提示詞不太方便,後續要微調、修改的話稍有難度。畢竟原始提示詞是由 AI 提供的,許多用詞對我們而言比較生澀。若能使用中文提示詞,將更為直覺。
- Sampling steps 增加到 30 的話,生成一張圖的時間很長,希望有更快的選擇
- 製作封面圖、示意圖時,常常需要加上文字,但多數的繪圖 AI 在處理文字這一塊,成果不太穩定,常常拼錯、缺字,或出現奇怪線條、字符,難以長期符合需求
- 英文字母尚且如此,更不用說要呈現正確的中文字(會很常出現自創文字)
- SD WebUI Forge 用來生成單純美術作品、照片攝影作品、或不須文字的圖片,作為本地 AI 已經堪用
- 但需要製作宣傳品、海報、封面圖等等用途,則有明顯短板
六、線上測試中文生圖模型
1. 中文較佳的模型 這次重新查「支援中文提示詞」、「中文文字表現佳」的本地繪圖 AI 模型有哪些,線上 AI 推薦了一個開源模型「Z-Image-Turbo」,一試之下驚為天人! 2. 線上測試生圖效果 本篇測試的兩個工具,都是花了不少時間下載軟體、模型之後,才能測試生圖效果,現在發現這是比較缺乏效率的作法。 這次先在線上測試 Z-Image-Turbo,確認生圖效果不錯再找支援的工具,可省下不少試錯的時間。 除了在 Z-Image-Turbo 官網可測試效果(免費額度少),也可在這個網頁測試: 3. 本地繪圖 AI 工具 我找到支援 Z-Image-Turbo 的本地繪圖 AI 工具為 RuinedFooocus,因為其操作界面類似 Fooocus,只要簡單輸入提示詞就能生成圖片,這是我的必要需求,系列文下一篇會詳細說明這個工具的使用心得。部署本地 AI 系列文章:
沒有留言:
張貼留言注意事項:
◎ 勾選「通知我」可收到後續回覆的mail!
◎ 請在相關文章留言,與文章無關的主題可至「Blogger 社團」提問。
◎ 請避免使用 Safari 瀏覽器,否則無法登入 Google 帳號留言(只能匿名留言)!
◎ 提問若無法提供足夠的資訊供判斷,可能會被無視。建議先參考這篇「Blogger 提問技巧及注意事項」。
◎ CSS 相關問題非免費諮詢,建議使用「Chrome 開發人員工具」尋找答案。
◎ 手機版相關問題請參考「Blogger 行動版範本的特質」→「三、行動版範本不一定能執行網頁版工具」;或參考「Blogger 行動版範本修改技巧 」,或本站 Blogger 行動版標籤相關文章。
◎ 非官方範本問題、或貴站為商業網站,請參考「Blogger 免費諮詢 + 付費諮詢」
◎ 若是使用官方 RWD 範本,請參考「Blogger 推出全新自適應 RWD 官方範本及佈景主題」→ 不建議對範本進行修改!
◎ 若留言要輸入語法,"<"、">"這兩個符號請用其他符號代替,否則語法會消失!
◎ 為了過濾垃圾留言,所有留言不會即時發佈,請稍待片刻。
◎ 本站「已關閉自刪留言功能」。