上一篇測試了 AI 繪圖工具「Fooocus 與 SD WebUI Forge」,使用一段時間後體會到中文、漢字支援度的重要性,如果 AI 繪圖模型特別針對中文及相關素材進行訓練的話,可解決這些痛點:
- 通常 AI 繪圖工具不會一次就生成完全符合需求的圖片,會有不少細節需要微調或置換
- 如果 AI 對中文理解能力強,那麼直接用「中文提示詞」進行修改、補充,可以逐步提昇圖片品質
- 如果模型對「漢字」素材訓練過的話,圖片若包含「中文字」多半能正確顯示
部署本地 AI 系列文章:
(圖片出處: Z-Image-Turbo)
一、繪圖模型+工具介紹
1. Z-Image-Turbo Z-Image-Turbo 是由阿里巴巴開發的免費開源 AI 圖像生成模型,是 Z-Image 系列的「蒸餾加速版」,特點如下:- 生圖速度極快:傳統模型須 20~50 步的過程,他只要 9 步就能完成
- 硬體要求低:大幅減少顯卡記憶體使用,一般家用顯卡(RTX 3060/4060)也能順暢執行
- 圖片品質極佳:雖然是輕量級模型,但圖片品質在開源模型中名列前茅
- 中文能力強:支援中英語提示詞,且圖片能清晰渲染中文字
二、安裝+使用+下載模型
1. RuinedFooocus 安裝- Github 官網:RuinedFooocus
- Windows 版下載:官網往下捲找到「Click here to download」連結即可
- 下載網址:或者直接點擊這個「RuinedFooocus_main_2.0.0.win64.7z」連結
- 解壓縮下載的 7z 檔後,執行
run.bat 即可啟動程式 - 首次執行時,系統會自動下載一個預設的模型檔案 sd_xl_base_1.0_0.9vae.safetensors,大小約 7 G,需要花不少時間
- 每次執行時,系統都會自動更新版本、環境相關依存檔案(如有需要的話),需要花點時間
- 命令視窗跑完必要程序後後,會自動開啟網頁 http://127.0.0.1:7860/,可在此網頁進行圖形界面操作。
- 別關閉執行的命令視窗,否則網頁的圖形操作界面就無法執行了
- Flux 模型有兩種形式:GGUF 與 Safetensors
- 安裝 GGUF 檔案的話,還需要額外安裝文字及 VAE 編碼器,流程相當麻煩
- Safetensors 可以看成懶人包,把模型檔、所有相關編碼器都打包成一個檔案
- 我的硬體 RTX4060 對 AI 工具來說算低階,最好下載「z-image-turbo-fp8-aio.safetensors」這個檔案,約 10G
- 硬體設備較好可以下載 z-image-turbo-fp16-aio.safetensors,約 20G
- 希望生成圖案偏「動漫風格」的話,可下載檔名有「anime」字樣的檔案
你的RuinedFooocus路徑\RuinedFooocus\models\checkpoints
5. 禁止下載預設模型的技巧
如果覺得首次執行時,下載預設模型很浪費時間,可以在下載完 Z-Image-Turbo 模型檔,並放到正確路徑後,用文書軟體修改這個系統設定檔:
你的RuinedFooocus路徑\RuinedFooocus\settings\settings.json
找到字串 "base_model" 後,把預設值 "sd_xl_base_1.0_0.9vae.safetensors" 改成新下載的 Z-Image-Turbo 模型檔,例如 "z-image-turbo-fp8-aio.safetensors",再儲存即可。
三、RuinedFooocus 設定
1. RuinedFooocus 系統設定 成功執行 RuinedFooocus 後,在開啟的網頁上方,分頁切換到「Settings」,以下是常用的系統設定:
- Image Number:每次生成的圖片數量
- Checkpoint Folders:放模型的路徑
- Performance:生成圖片的方式設定,可為一組自訂值取名,例如圖中的「WFU」
- Resolution:生成圖片的長寬尺寸,同樣可取名,例如圖中的「WFU」
- Base Model:可切換模型檔案,例如圖中已將預設模型改為 Z-Image-Turbo
- Output Foler:生成圖片的路徑
- CFG:1 或 0
- Sampler:euler
- Scheduler:simple 或 beta
- 左上方分頁 Main → 右上方分頁 Setting
- Performance:可選擇既有設定修改,也可選「Custom」(自訂)後,下方 "Name" 的輸入框填入自訂名稱
- 選好後下方會彈出 4 個選項進行設定
- Custom Steps:可填入 9~20 步,Z-Image-Turbo 基本上 9 步就能生出品質很棒的圖片,更多步驟可展現更多細節
- CFG:如前所述,建議填入 1
- Sampler:如前所述,建議改為 euler
- Scheduler:如前所述,建議改為 simple 或 beta
四、封面圖實做流程
上一篇提過,我使用本地 AI 繪圖工具的主要目的,是製作「封面圖」、「示意圖」,接下來以系列文第一篇文章「LM Studio 安裝優化部署與免費模型選擇技巧」為例,如何利用 Z-Image-Turbo 做出這張封面圖:
1. 構圖設計
自己發想、設計圖片是很花時間的,利用線上 AI 可大幅縮短這個歷程。我把文章標題餵給線上 AI 後,請他幫我提供幾個構想,經過一段時間往返激盪後,我聯想到一個 idea,AI 則幫我設計出構圖:
因為 LM Studio 可以搜尋、下載、執行多個免費開源模型,所以想到一個意象圖,讓 LM Studio 在正中央驅動四周的知名熱門開源模型,例如 GPT-oss、Gemma 等等,而 DeepSeek 提供的視覺構圖、Logo 設計、背景、風格、配色等等,所有細節看起來都不錯,便請他提供這個設計構想的中文提示詞。
2. 提示詞 初步效果
AI 提供的第一版提示詞如下:
傑作,最高畫質,
3D渲染,等角視角,黑暗科幻風格,
畫面中央是一個發光的圓形晶片核心,上面有閃電符號,代表「LM Studio」,發出強烈的青藍色與橘黃色光芒,
從核心向外延伸出四條光纖能量管線,連接到周圍四個漂浮的圖標:
左上角是一個開源標誌(節點網絡),代表 GPT-oss,
右上角是一朵紫色發光花朵,代表 Gemma,
左下角是一個羊駝頭剪影,代表 Llama,
右下角是一個漢字「千」與雲朵組合,代表 Qwen,
四條光纖顏色分別為綠色、紫色、橘色、紅色,
背景是深藍到黑的宇宙星空,帶有微弱電路板紋路,
史詩感,科技感,乾淨,無人物,無多餘文字
首次生成的圖長這樣:
我覺得效果還可以,當然有很多細節需要修改,但至少沒走歪,完全符合提示詞的構圖意象。
而且一張 1500*750 大小的圖片,扣除載入模型、解析文字等準備動作時間,設定 9 步驟實際生圖的時間只花了三十多秒,品質跟速度遠勝前一篇的 SD WebUI Forge,接下來就是如何進行優化、找到製圖訣竅。
3. 修正提示詞
一開始設定 9 步驟除了可縮短時間,也能多生幾張隨機的圖,來尋找構圖想法。我將首圖的缺點,及其他圖中找到一些值得留下的元素,與 DeepSeek 繼續討論:
- 首圖四個模型只有「GPT-oss」有標上文字,要如何強制一定會顯示特定文字?
- 我想每個模型 logo 下方都加上一個標籤牌
- 有一個模型使用的顏色沒按照指示(左下角),我希望每個元素使用指定的顏色
圖片細節、3D 效果、整體質感提昇許多,主要剩幾個地方要調整而已:
- 左下角 "Llma" 拼錯,正確應該 "Llama"
- 右上角 "Gamma" 拼錯,正確應該 "Gemma"
- 左下角使用了重複的綠色
- 中間的 "LM Studio" 字樣,應比其他四個大一些,比較能突顯主題
- 生成步驟可改為 20~30
- 改成正式的大圖尺寸
- 如果希望看到不同的圖片風格,「Style Selection」可選擇 "Style: Pick Random",產生隨機風格圖片
五、Z-Image-Turbo 如何生成精確文字
1. 顯示正確文字的技巧 從前面的圖可看到,沒使用特別技巧的話,拼錯指定英文字(或大小寫錯誤)的機率不小。跟多個 AI 討論且經實測後,以下技巧是有效的:- 根據「官網相關說明」:"要生成文本,請將您想要的單詞用引號括起來(例如,一個寫著 'Welcome' 或 '歡迎' 的牌子)。"
- 明確描述位置
- 指定字體
- 文字不要太長
- 某個線上 AI 提到,要顯示精準文字之處,用英文描述會很有效
左下角,晶體是一個羊駝頭部剪影圖標,下方標籤,label text reads "Llama",光纖顏色為藍色
我使用這樣的技巧後,需要顯示正確文字的地方就很少拼錯或失敗了。
2. 最終版提示詞
這裡提供最終版的提示詞,前述所有提到的文字、細節問題都已修正,有興趣可以玩玩看:
傑作,最高畫質,3D渲染,等角視角,黑暗科幻風格,畫面中央是一個發光的圓形晶片核心,上面有閃電符號,符號下方清晰寫著「LM Studio」這幾個字,文字尺寸是其他圖標文字的三倍大,圓形晶片核心的尺寸是其他圖標的 1.5 倍大,從核心向外延伸出四條光纖能量管線,連接到周圍四個方形晶體圖標,
每個晶體下方都有一個底座標籤牌:
左上角,晶體是一個 ChatGPT 網絡圖標,下方標籤,label text reads "GPT-oss",光纖顏色為綠色,
右上角,晶體是一朵優雅的紫色發光花朵圖標,下方標籤,label text reads "Gemma",光纖顏色為紫色,
左下角,晶體是一個羊駝頭部剪影圖標,下方標籤,label text reads "Llama",光纖顏色為藍色,
右下角,晶體是一個漢字「千」與雲朵組合的圖標,「千」字不要被其他線條遮住,下方標籤,label text reads "Qwen",光纖顏色為紅色,
標籤牌上的文字使用清晰易讀的無襯線字體,
背景是深藍到黑的宇宙星空,帶有微弱電路板紋路,
史詩感,科技感,乾淨,無人物
六、圖片如何局部修補
1. 局部修補的侷限 Fooocus 有個知名的「局部修補」功能 inpaint,而 RuinedFooocus 同樣也可以使用,只不過這功能沒想像中好用:- 重新生成的局部內容等同抽卡,可能要試很多次才會出現喜歡的
- 生成的局部內容不一定符合構圖中其他元素的風格
- 若要局部修改文字相當困難,就算拼字正確了,文字大小、字體等等,也可能不吻合圖片中其他的文字
RuinedFooocus 圖片生成後,在「main」主分頁中,右邊還有 5 個分頁,inpaint 就藏在其中的「PowerUp」分頁。如果看不到全部分頁,請點上圖右上角的「3 圓點」圖示展開,就能進入「PowerUp」分頁。
勾選「Inpainting」可啟用此功能,接下來的操作方式:
- 左邊圖片主區塊,左側會出現筆刷面板,可調整筆刷尺寸
- 可在圖中進行塗抹,標示出要修補的區域
- 填入提示詞,即可生成修補後的圖片
除了當下生成的圖片,圖片主區塊也可拖曳、或載入已生成的圖片,再勾選「Inpainting」功能,以下示範實際修補圖片的流程:
- 首先確認左側筆刷面板有出現,能成功在圖中進行塗抹
- 以上圖來舉例,我想在短髮女孩頭上增加「全罩式耳機」,可在預計生成耳機的適當位置塗抹成黑色
- 提示詞填入 "頭戴銀色全罩式耳機",按「Generate」即可等待生圖
這是修補後的效果,頭上多出了全罩式耳機這個物件。
4. 補充說明
勾選「Inpainting」功能後,不一定每次都會成功:
- 有時筆刷面板有出現,但主區塊圖片卻消失了
- 有時主區塊圖片還在,但筆刷面板卻沒出現
- 所以只能不斷取消勾選、重新勾選「Inpainting」,測試能否成功
- 或者移除圖片,重新載入圖片後,整個流程再試一次
七、中文字處理心得
本篇文章的封面圖使用了不少中文資訊,沒有細看的話其實構圖、排版、整體質感相當不錯,不容易看出哪裡有問題。然而一筆一劃仔細檢查的話,中文字的細節可以看出一些蹊蹺,以下談談處理中文字的心得。 1. 封面圖提示詞 封面圖初步構想由 ChatGPT 提供,最終版本的構圖、版面配置,則是在 RuinedFooocus 一步步修改,不斷抽卡測試出來。讀者有興趣的話,生圖的完整中文提示詞如下:橫幅構圖,高品質 AI 繪圖模型宣傳封面,整體融合東方古典美學與現代科技感。一位氣質清雅、五官精緻的年輕東方女子,身穿華麗但自然的中國古風漢服,站在盛開櫻花的中式古典庭院中,黑色長髮優雅盤起並垂落肩後,搭配精緻的古風髮飾與櫻花髮簪,服裝具有細膩刺繡與柔和布料質感。女子位於畫面右側,面向鏡頭,神情自然優雅。背景為精緻的中國傳統庭院,有木造亭台、青石小徑、池塘、白牆、傳統中式窗棂與古典建築,庭院中種滿盛開的粉紅色櫻花,櫻花枝條從畫面上方延伸,微風吹過,大量櫻花花瓣緩慢飄落。午後溫暖夕陽從櫻花樹與建築之間照射進來,形成柔和的金色逆光、自然光暈與細膩光影,人物頭髮與衣袖邊緣帶有漂亮的輪廓光。背景具有自然景深與柔和散景,畫面具有電影級攝影質感,細節豐富但不雜亂,寫實與唯美藝術風格融合,高級、精緻、優雅。
畫面左側保留較乾淨、明亮且具有柔和漸層的留白區域,作為資訊與文字的主要視覺區域。左側加入具有現代科技感但不破壞東方美學的發光粒子、細緻光線、流動的數位線條與微弱的 AI 神經網路元素。
左側文字區域採用雜誌級排版設計。距左邊緣 15%、距頂部 20% 處開始排列文字。主標題「Z-Image-Turbo」使用醒目的大型粗體字,色調為暖金色與純白漸層,帶有輕微外發光,字體風格融合現代科技感與東方書法筆觸。主標題下方顯示副標題「中文提示詞 × AI 製圖」,字體大小為主標題文字的二分之一,顏色使用精緻的柔和玫瑰金色。
主標題與副標題下方,以一條纖細的暖金色水平裝飾線區隔。裝飾線下方設計 5 組精緻的垂直文字標籤,標籤文字依序為:
「古風」
「櫻花」
「中式庭院」
「傾城佳人」
「東方美學」
標籤文字大小相同,使用深棕紫色,文字對齊頂端。
標籤使用垂直圓角膠囊卡片,卡片採用半透明乳白色與淡米色玻璃質感背景,具有非常細緻的金色描邊、柔和陰影與微弱外發光。標籤背景保持半透明,讓後方櫻花與庭院仍然若隱若現,與整體粉紅、淡紫、暖金、米白色調自然融合。不要使用厚重、鮮豔或塑膠感的按鈕,不要讓標籤搶過主標題與人物。
主標題醒目但不要遮擋人物臉部。人物、櫻花與古典庭院是主要視覺焦點,文字是第二視覺層級。整體色調以粉紅、淡紫、暖金、米白為主,畫面明亮、唯美、乾淨、高級。超高細節,細膩人物肌膚,真實髮絲,精緻服裝紋理,漂亮光影,電影級構圖,高品質商業宣傳視覺。
2. Z-Image-Turbo 的侷限
仔細看圖,可以發現這些中文字有問題:
- "圖"、"櫻"、"傾" 是簡體字("風" 在生圖時大部分也是顯示簡體)
- "學" 的上半部線條怪怪的,下半部比較像 "于"
- "製" 仔細看的話,左上角跟印刷字體的線條稍微不同
- 某些字會有出現簡體字的機率,就算提示詞強制說明「只使用繁體中文,禁止簡體字」,也是沒有用的,只能期待抽卡抽到繁體字。
- 筆劃越多的字,線條越可能出現誤差
- 有時一個詞會多字、少字,非常隨機,不可控
- 請 AI 把文字區塊留白,自行後製 P 圖
- 先忽略文字的誤差,當本地 AI 生成滿意的構圖、元素後,把最終版提示詞交給線上 AI 生圖,那麼產生的中文字絕對不會有錯
部署本地 AI 系列文章:
沒有留言:
張貼留言注意事項:
◎ 勾選「通知我」可收到後續回覆的mail!
◎ 請在相關文章留言,與文章無關的主題可至「Blogger 社團」提問。
◎ 請避免使用 Safari 瀏覽器,否則無法登入 Google 帳號留言(只能匿名留言)!
◎ 提問若無法提供足夠的資訊供判斷,可能會被無視。建議先參考這篇「Blogger 提問技巧及注意事項」。
◎ CSS 相關問題非免費諮詢,建議使用「Chrome 開發人員工具」尋找答案。
◎ 手機版相關問題請參考「Blogger 行動版範本的特質」→「三、行動版範本不一定能執行網頁版工具」;或參考「Blogger 行動版範本修改技巧 」,或本站 Blogger 行動版標籤相關文章。
◎ 非官方範本問題、或貴站為商業網站,請參考「Blogger 免費諮詢 + 付費諮詢」
◎ 若是使用官方 RWD 範本,請參考「Blogger 推出全新自適應 RWD 官方範本及佈景主題」→ 不建議對範本進行修改!
◎ 若留言要輸入語法,"<"、">"這兩個符號請用其他符號代替,否則語法會消失!
◎ 為了過濾垃圾留言,所有留言不會即時發佈,請稍待片刻。
◎ 本站「已關閉自刪留言功能」。