Midjourney是一個AI工具,允許用戶輸入提示詞來生成圖片。業州愚公是一位自媒體從業者,他發現同樣輸入幾個詞,有些人可以生成出高品質的圖片,而有些人則只能得到糊成一團的光斑。這個差距不在於運氣或會員等級,而是在於提示詞的撰寫方式。業州愚公認為,Midjourney的提示詞需要按主體、環境、構圖、光影、風格、參數六塊積木搭配,這樣才能生成出高品質的圖片。他還提供了填空模板和五問自檢的方法,幫助用戶改善提示詞的撰寫能力。通過這種方式,用戶可以更好地利用Midjourney生成出自己想要的圖片。
菜鳥之友系列:《AI 工具實操與提示詞》・工具篇作者:業州愚公
做自媒體的朋友前陣子興沖沖地訂了 Midjourney,第一句提示詞輸的是「一隻貓,可愛,高清,大師級,獲獎作品,震撼視覺」。四張圖出來,全是糊成一團的光斑,勉強認得出毛色。同一週,另一個同事用同一個工具出封面圖,一發入魂,四張裡三張直接能用。兩個人的差距不在運氣,也不在會員等級——他們輸入的東西,根本不是同一種語言。前者在許願,後者在寫分鏡。這一篇,就把提示詞的結構拆成六塊積木,讓你照著填空就能上手。
Midjourney 長期以 Discord 內的 /imagine 指令為主要入口,官方也在持續更新網頁版介面;具體入口與介面細節以官方最新版本為準。本文講的是提示詞結構本身,與入口無關。
結果先放這裡:把一句提示詞按「主體、環境、構圖視角、光影氛圍、風格媒介、參數」六塊填空,出圖命中率立刻不一樣。這不是玄學,原因說得清楚。
Midjourney 這類文生圖模型,是把句子裡的詞轉成畫面元素的線索。它不像人類讀者會替你理順邏輯,也不懂「可愛、高清、大師級」這種修辭是誇獎——它只會老老實實把這些詞對應的視覺特徵糊進畫面。「大師級」對應什麼視覺特徵?沒有。於是只能憑空猜測,猜出來的就是那團光。形容詞還會互相打架:你寫「極簡背景、華麗構圖、古典油畫質感」,三個詞指向三個方向,模型不會選擇,只會全部揉進同一張圖。好提示詞的第一原則只有一條:每個詞都指向一個具體的視覺決定——光從哪來、鏡頭在哪、像什麼畫出來。
把任何一條能用的提示詞拆開,基本都落在這六塊裡。順序不强制,但按下面的順序寫,條理最清楚:
| 積木 | 它決定什麼 | 填法範例 | 缺了它會怎樣 |
|---|---|---|---|
| 主體 | 畫面主角是誰、長什麼樣 | a fisherman in a yellow raincoat | 模型自由發揮,畫面失焦 |
| 環境 | 主體在哪裡 | on a stormy harbor pier | 背景每次隨機,難復現 |
| 構圖視角 | 鏡頭怎麼擺 | low-angle shot, close-up | 永遠預設中景,千篇一律 |
| 光影氛圍 | 光從哪來、什麼調子 | golden hour light, thin fog | 平光,像證件照 |
| 風格媒介 | 像用什麼畫出來 | watercolor illustration | 塑膠感的數位預設味 |
| 參數 | 句尾的技術旋鈕 | --ar 16:9 --stylize 200 | 比例固定正方形 |
六塊拼起來,就是一條完整的提示詞:
```
a fisherman in a yellow raincoat pulling nets on a stormy
harbor pier, low-angle shot, spray and dim morning light,
35mm film photo --ar 3:2 --no text, watermark
```
主體有職業有動作有衣著,環境有地點有天氣,鏡頭有角度,光有方向有時刻,媒介指定了膠片攝影,句尾參數定了比例、排掉浮水印。八個視覺決定全在一句話裡落實——這就是分鏡腳本跟許願的差別。
參數是寫在提示詞最後、以兩個短槓開頭的指令,不參與畫面內容,只控制生成行為,常用六個:
| 參數 | 作用 | 常見用法 | 使用提醒 |
|---|---|---|---|
| --ar | 畫面比例 | --ar 16:9(橫幅)/--ar 9:16(手機直式) | 封面、壁紙先定比例再寫詞 |
| --no | 排除元素 | --no text, watermark, people | 排除項用逗號分隔 |
| --stylize | 風格化強度 | 數值越高越「美術化」,越低越貼近描述 | 想要精確控制時調低 |
| --chaos | 四張圖的差異度 | 數值越高四張圖彼此差越遠 | 找靈感調高,收斂時調低 |
| --seed | 固定隨機種子 | 記下數字,之後沿用 | 想在同一張圖上微調時必備 |
| --v | 模型版本 | 以官方最新版本為準 | 新版本通常對長句理解更好 |
三個使用心得。第一,--ar 是新手最容易忽略也最該先寫的:公眾號頭圖和手機壁紙比例完全不同,先定比例,構圖才有意義。第二,--no 的價值被低估——文字和浮水印是 AI 出圖的常見瑕疵,一句 --no text 能省掉大量返工。第三,--seed 是「迭代」的鑰匙:不固定種子,每次生成都是全新抽獎;固定了種子,改一個詞就能看清它影響了什麼。
參數的具體名稱與取值範圍可能隨版本更新調整,以官方文件最新版本為準。兩個短槓後面不要加空格,寫成單槓 -ar 或中間夾空格,指令會失效——這是新手最常見的「參數明明寫了卻沒生效」的原因。
第一個坑:形容詞打架。「極簡」和「華麗」同時出現,模型不選邊,直接和稀泥。檢查方法:把形容詞一個個念出來,問自己「它對應哪個視覺決定?」答不上來的,刪掉。
第二個坑:把參數寫進句子。--ar 這類指令必須放在提示詞最後,夾在句子中間可能被當成普通文字,或者乾脆吞掉整段描述。參數歸參數,描述歸描述。
第三個坑:不會給主體分配重量。想讓畫面「貓為主、狗為輔」,只會寫 a cat and a dog,結果兩者平均分配、彼此搶戲。正確工具是雙冒號加權重:寫成 cat::2 dog::1,貓的視覺分量就是狗的兩倍。主體複雜的畫面,全靠這招排兵布陣。
還是那位被光斑勸退的朋友。我把六塊積木的表發給他,他重寫了一條:a tabby cat curled on a windowsill, morning sunlight through lace curtains, soft warm tones, watercolor illustration --ar 3:2。這次四張圖裡有一張直接用作了封面。他說:「原來它不是畫得差,是我一直沒說清楚。」
用一次真實的迭代過程,把前面的東西串起來。目標:一張文章頭圖,主題「深夜便利店」。
| 輪次 | 輸入的提示詞 | 出來的結果 | 這一輪補了哪塊積木 |
|---|---|---|---|
| 第一輪 | night convenience store, beautiful, amazing | 氛圍混沌,看不清重點 | 全缺,只有空話形容詞 |
| 第二輪 | a convenience store at night | 認得出便利店,但像手機隨手拍 | 補了主體與環境 |
| 第三輪 | a lone customer at a convenience store counter at night, fluorescent light spilling onto wet street, wide shot, 35mm film photo --ar 16:9 | 接近想要的電影感 | 補了光影、構圖、媒介、比例 |
| 第四輪 | 固定第三輪的 seed,把 fluorescent light 換成 warm tungsten light 微調 | 收斂到可以直接用 | 用參數做最後一里 |
規律很清楚:每一輪只加一兩塊積木,加完看清效果,再加下一塊。這正是 --seed 的意義——種子固定,變數只有你改的那個詞,因果一目了然。反過來,每一輪都整句重寫,永遠不知道是哪個詞起了作用,學十輪也攢不下經驗。
最後把整篇壓縮成你能直接抄走的東西。
填空模板:
```
[主體] with [一個關鍵細節], [環境地點與天氣], [構圖視角],
[光源與氛圍], [風格或媒介] --ar 比例 --no 想排除的東西
```
動筆前的五個自檢問題:
提示詞寫作不是許願,是攝影師的分鏡腳本加上美術指導的工作單。你把視覺決定做得越具體,留給隨機的部分就越少。下次打開 Midjourney,先花三十秒把六塊積木在心裡擺一遍——這三十秒,抵得上抽獎抽一下午。
工具推薦隨身機器人(新用戶免費試用 7 天)
卡在「提示詞寫好之後還要反覆調」?「隨身機器人」幫你把需求轉成結構化提示詞草稿,再陪你一輪輪迭代,新用戶免費試用 7 天。
下一篇預告:圖有了,配樂呢?下一篇我們實測 Suno AI 音樂生成——從一段歌詞到一首有前奏有副歌的完整歌曲,新手第一次生成該避開哪些坑,實操記直接開錄。
業州愚公 | SY 視野(sylogs.com)原創內容,轉載請註明出處。
編輯評論 / Editor's Note
這種創作工具的使用方法需要一定的技巧和創意,才能產生出高質量的結果。通過了解和掌握這六塊積木的搭配技巧,使用者可以更好地控制和優化自己的創作效果。同時,這也反映出人工智慧在創作領域的應用和發展潛力。