AI TOOLS · PROMPT 特輯 · 2026
QUICK ANSWER
這是一組把旅遊照變成獨立出版品封面的 AI 生圖 prompt:3:4 直式,上下切成一比一,上半保留原照片只做編輯級調色,下半用手繪紙感插畫把同一個場景重畫一次,主體只佔下半的一到兩成,其餘全是留白。它之所以不像 AI 生圖,是因為整段指令的重點不在叫 AI 創作,而在把版式、比例、色數、材質全部鎖死。
昨晚整理去年拍的日本照片,把同一組 prompt 丟進生圖模型跑了十張。道頓堀的招牌牆、新倉山的五重塔、新世界的通天閣、河口湖本町商店街、清水寺紅葉、東京鐵塔——場景差異大到不像同一批素材,但輸出全部長得像同一本雜誌的內頁。
這件事本身比圖好看更值得講。多數人用 AI 生圖的痛點不在單張出不來,在第二張跟第一張長得不一樣,第三張又飄到別的地方去。要做一整套視覺,一致性遠比單張驚豔難。
這組 prompt 解掉的就是這件事。它把整張畫布當成一份設計規格書在寫,AI 只剩下填空的空間。
CHAPTER 01 · WHAT IS IT
整組 prompt 的骨架只有一句話能講完:一張 3:4 的直式畫布,橫向切成高度完全相等的兩半,上半放原始照片,下半放同一個場景的極簡手繪版本。
上半要求「盡可能忠實保留原照片」——構圖、光線、人物、物件、空間關係全部不動,只做細膩的編輯級調色,讓它看起來像高級雜誌的攝影頁。如果原照片比例不是 3:4,允許延伸天空、地面、牆面這類環境背景把畫布補滿,但主體一個像素都不准動。
下半是整組 prompt 真正的重心。它要求從上半那張照片裡萃取「最有辨識度的元素」,重新畫成一張手繪紙感插畫:不完美的手繪線條、少量壓克力風格的平塗色塊、粗糙紙張紋理、看得見的筆觸邊緣。主體要小、要置中、只佔下半面積的一到兩成,剩下全是米白紙質的空白。
這種「上實下虛」的排版在獨立出版跟藝術書封面很常見,日本的旅行手帳、歐洲的攝影小誌都愛用。看習慣了會覺得理所當然,實際做起來難在兩件事:插畫要簡到什麼程度才不失辨識度,以及留白要留到多空才不會顯得偷懶。這組 prompt 把兩件事都寫成了數字。
CHAPTER 02 · WHY IT MATTERS
AI 生圖那種一眼可辨的塑膠感,來源大概三種:畫面每個角落的細節密度都一樣高、沒有真正的空白、以及模型忍不住把整張圖重畫一次。三種毛病共用同一個成因,模型預設要把畫布填滿,因為訓練資料裡的圖幾乎都是滿的。
這組 prompt 對這三件事都下了硬限制。上半用「never stretch, distort, reshape, replace, or modify the main subject」把重繪的手綁起來;下半用一到兩成的佔比把細節密度壓到只剩主體;留白用「large amount of negative space」寫死。三條加起來,模型的自由度被砍到只剩線條質感跟色塊形狀。
“
一個小小的主體,被大量的留白包圍。
這句是原 prompt 裡的「視覺概念」總綱,位置放在整段指令的後段。它的功能不是描述,是在所有細節規則之外再加一層總體約束——當模型不確定該不該加東西的時候,這句話會把它拉回來。寫過長 prompt 的人都知道,指令越多越容易互相打架,這種「總綱句」是很有效的收斂手段。
另一個關鍵是負面清單。原 prompt 用一整段列出不要什麼:色鉛筆質感、蠟筆、暈染水彩、純線稿、複雜寫實插畫、厚重油畫、光滑的數位插畫、3D 算圖、商業卡通、可愛角色、電商廣告美學、罐頭海報模板。這串看起來像贅字,實際上它擋掉的正是模型聽到「hand-drawn illustration」時最容易滑進去的那幾個坑。我在寫作 skill 上也走過同樣的路——與其教它要什麼,不如先把它慣性會犯的錯釘死,這在 去 AI 味的寫作 skill 那篇談得更完整。
CHAPTER 03 · HOW IT WORKS
原 prompt 是一長串英文,讀起來像散文,但結構其實非常工整。拆開會發現它是六個獨立模組堆起來的,每個模組管一件事,彼此不重疊。
MODULE 01
整體版式
3:4 直式、上下高度精確 1:1、兩半必須像同一本刊物的封面。也在這裡下「一張照片一張海報、不准做拼貼」。
MODULE 02
上半照片
忠實保留原圖、只做編輯級調色、必要時延伸環境背景補比例、主體絕對不動。
MODULE 03
下半插畫
保留什麼(主體、輪廓、姿態、敘事關係)、用什麼畫(手繪線條、平塗色塊、紙紋筆觸)、佔多大(10–20%)。
MODULE 04
色彩
直接從原照片取色、壓到 4 色以內、大膽但克制的平塗、保留紙張顆粒。
MODULE 05
文字層
可放少量文字(標題、地名、年份、編號),極簡低調,「不合適就不要硬塞」。
MODULE 06
風格禁區
十四項負面清單,把模型最容易滑進去的插畫慣性全部擋掉。整組最被低估的一塊。
值得注意的是模組之間的順序。版式在最前面,因為那是最不能妥協的骨架;風格禁區在最後面,因為它是收尾的濾網。中間四塊由外而內,從畫布到主體到顏色到文字,這個順序跟平面設計師實際排一張稿的順序一模一樣。
CHAPTER 04 · THE CONSTRAINTS
一組 prompt 裡真正影響輸出的句子通常不到三成,其餘都是氛圍詞。這組裡撐起整個風格的是三個數字。
1 : 1
上下高度精確對切
10–20%
插畫主體佔下半的比例
≤ 4
下半可用的主色數量
1:1 對切 看起來只是版式,實際上它決定了整張圖的閱讀節奏。上下一樣重,視線就會在兩半之間來回,把照片跟插畫讀成同一件事的兩種說法。如果切成 6:4 或 7:3,下半會退化成註腳,整個對照關係就垮了。這跟網頁排版裡用一套固定間距把層級撐開是同一個道理,我在 8pt 網格與四層間距 那篇講過,比例本身就是語意。
10–20% 是整組最狠的一條。它逼模型做真正的取捨——道頓堀那張原照裡有幾十塊招牌,塞不進兩成的面積,模型只好挑出最紅的那三塊、把其他全部化成墨色團塊。這個壓縮動作本身就是設計,只是這次由 prompt 代替設計師下了刀。
4 色以內 而且要「直接從原照片取色」,這兩個條件綁在一起才有效。單獨講四色,模型會給你四個好看但跟照片無關的顏色;加上取色的要求,下半就變成上半的色彩摘要,兩半自然對得起來。清水寺那張的紅、東京鐵塔那張的橘紅配綠,都是這樣來的。
畫面配置示意
原照片|50%
上半 50%:原照片、編輯級調色、主體不動。
下半 50%:米白紙底,插畫主體只佔這一半的 10–20%(示意圖裡那個小方塊),四周全留白。
實務上模型很容易把小方塊畫大。輸出後第一件事就是量它,超過三成就重跑。
CHAPTER 05 · GETTING STARTED
流程本身很短:丟照片、貼 prompt、檢查三件事、要就重跑。難的是選照片,這一步決定七成成敗。
01
選一張有明確主體的照片
建築、地標、街景、有輪廓的物件最好。均勻的風景照(整片海、整片森林)萃取不出主體,下半會變成一坨色塊。
02
貼上完整 prompt,一次一張
原 prompt 開頭就寫明「每張照片各自輸出一張海報、不准合成拼貼」。一次丟六張照片,多數模型還是會偷偷合併。
03
輸出後只檢查三件事
分割線有沒有落在正中間、插畫主體有沒有超過下半的三成、上半的主體有沒有被偷改。三項都過就收,任一項沒過就重跑而不是微調。
04
要調就調限制,不要加形容詞
插畫太滿就把 10–20% 改成 8–12%,顏色太亂就把 4 色改成 3 色。加「更精緻」「更有質感」這種詞不會有任何效果。
模型方面,這批圖是在 ChatGPT 的原生生圖模型上跑的。它對「保留原圖不動」這件事處理得最穩,因為原生多模態的圖像理解跟生成在同一個模型裡,參照原圖的能力比靠 image-to-image 拼出來的方案好。想知道各家生圖工具現在的分工,可以看 2026 年設計師的六大生圖工具選型。
▲ OpenAI 官方對原生生圖的介紹。整段的重點在「圖像生成是語言模型的原生能力」,這正是這組 prompt 能吃住複雜排版指令的前提
CHAPTER 06 · THE PROMPT
兩個版本。精簡版拿去快速試手感,完整版拿去做正式輸出——差別在完整版的負面清單跟材質描述比較厚,一致性明顯高一截。
兩版都用英文。這不是偏好問題,是語料密度問題:editorial、negative space、flat color shapes 這幾個 art direction 術語在英文訓練資料裡的出現頻率遠高於中文對應詞,模型的服從度差很多。
精簡版
Create an independent high-end editorial poster from the uploaded photo. One poster per photo, never a collage. Strict 3:4 vertical canvas, split horizontally into two halves of exactly equal height (1:1). TOP HALF: the original photograph, preserved faithfully. Keep composition, subjects, faces, proportions, poses, clothing, objects and spatial relationships unchanged. Keep realistic photographic texture, natural light and the original color mood. Apply only subtle editorial color grading. Extend sky, ground or surrounding background if needed to fit the frame, but never stretch, distort, reshape or modify the main subject. BOTTOM HALF: a minimal hand-drawn paper-cover illustration reinterpreting the same scene. Keep only the most recognizable subject, its silhouette, key pose and essential objects. Use delicate slightly imperfect hand-drawn lines, a few bold acrylic-style flat color shapes, rough paper texture and visible brush marks. The illustrated subject must be small and centered, occupying about 10-20% of the bottom half, surrounded by a large amount of negative space on warm off-white paper. COLOR: extract the dominant colors from the photograph and compress the palette to no more than 4 restrained, harmonious colors. TYPOGRAPHY: optionally a small amount of minimal editorial text (a short title, a place name, a year). Do not force text in if it does not fit. MOOD: quiet, poetic, refined, minimal, artistic. The concept is "a small subject surrounded by a large amount of empty space." AVOID: colored pencil, crayon, bleeding watercolor, pure line art, complex realistic illustration, heavy oil painting, smooth polished digital illustration, 3D rendering, commercial cartoon aesthetics, cute character design, e-commerce advertising look, generic poster templates, excessive decoration, busy compositions, excessive typography.
完整版
Create one independent high-end editorial poster for each uploaded photo. Do not combine multiple photos into a collage. Each photo must be processed and output as a separate poster. OVERALL FORMAT Strict 3:4 vertical composition. Divide the canvas horizontally into two exactly equal sections, with a precise 1:1 height ratio. The top half occupies exactly 50% of the canvas. The bottom half occupies exactly 50%. The two sections should feel visually connected as one refined art publication cover. TOP HALF — ORIGINAL PHOTOGRAPH Preserve the original photograph as faithfully as possible. Keep the main composition, subjects, identity, facial features, body proportions, poses, expressions, clothing, objects and spatial relationships unchanged. Preserve the realistic photographic texture, natural lighting, shadows, atmosphere and original color mood. Apply only subtle, sophisticated editorial color grading, creating the feeling of a premium magazine photograph, contemporary art book or high-end independent publication. The image should remain photorealistic and authentic, never overly retouched or artificially stylized. If necessary to fit the 3:4 composition naturally, extend the sky, ground, walls or surrounding environmental background. Background extension must feel seamless and photographic. Never stretch, distort, reshape, replace or modify the main subject. BOTTOM HALF — MINIMAL HAND-DRAWN PAPER ILLUSTRATION Extract the most recognizable visual elements from the original photograph and reinterpret them as a minimalist hand-drawn paper-cover illustration. Preserve: the most recognizable subject, essential silhouette and proportions, key pose or gesture, important objects, and the core narrative relationship between people and objects. Highly simplify the image. Remove unnecessary details and retain only the visual information needed for immediate recognition. Use delicate, slightly imperfect hand-drawn lines; a small number of bold, clearly defined acrylic-style flat color shapes; rough paper texture; visible handmade brush marks; slightly irregular, organic edges; and subtle imperfections that make it feel genuinely handmade. The main illustrated subject should be small, centered and carefully composed, occupying approximately 10-20% of the bottom half. Leave a large amount of negative space around the illustration. The background should primarily resemble rough white paper, warm off-white paper, pale natural paper or minimal editorial book-cover stock. Use only a few lines or small color shapes to suggest the surrounding environment. COLOR PALETTE Extract the dominant colors directly from the original photograph. Compress the palette into no more than 4 main colors. Keep the colors restrained, sophisticated and harmonious. Use bold but controlled flat color blocks. Avoid excessive color variation. Preserve subtle paper grain and handmade brush texture. The illustration should visually feel like a simplified color interpretation of the photograph. TYPOGRAPHY A small amount of simple typography may be included when appropriate: a short title, keyword, object name, location, year, number or short phrase. Text should be minimal, understated and editorial. Typography should naturally interact with the large areas of negative space and the small illustration, evoking art book covers, independent publishing, contemporary editorial design and thoughtful children's picture books. Do not force text into the composition if it does not naturally fit the photograph. VISUAL LANGUAGE The final poster should feel quiet, poetic, refined, minimal, innocent, relaxed, artistic, thoughtful, high-recognition and premium. The visual concept should be: "A small subject surrounded by a large amount of empty space." The result should resemble a carefully designed independent art publication cover, rather than a commercial advertisement. AVOID Colored-pencil aesthetics, crayon textures, bleeding watercolor, pure line-art illustration, complex realistic illustration, heavy oil-painting effects, smooth polished digital illustration, 3D rendering, glossy 3D textures, commercial cartoon aesthetics, cute commercial character design, e-commerce advertising aesthetics, generic poster templates, excessive decorative elements, busy compositions, excessive typography. FINAL ART DIRECTION The top half should feel like a beautiful, authentic editorial photograph. The bottom half should feel like a small, handmade visual poem derived from that photograph. The two halves should clearly belong to the same visual story, while maintaining a strong contrast between photographic realism above and minimal handmade illustration below. Prioritize recognition, restraint, negative space, material texture, subtle imperfection, editorial sophistication and artistic storytelling over decorative complexity.
CHAPTER 07 · IN PRACTICE
這組 prompt 的骨架可以整個抽換材質,換掉的是下半的畫法,版式跟比例全部留著。把「hand-drawn paper illustration」那段換成別的媒材描述,就是另一套視覺系統。
換成單色網版印刷的質感,會得到一套印刷風海報;換成細墨線加淡彩,會偏建築速寫本;換成粗網點加高對比黑白,會走向 zine 的味道。我之前拆過 單色印刷風海報怎麼用 AI 做,那套的兩塊印版邏輯直接接進這裡的下半,效果比原版更有印刷感。
文字層則是最容易客製、也最容易搞砸的地方。原 prompt 給了「不合適就不要硬塞」的逃生口,這句要留著。真的要固定格式,就把它寫死:地名全大寫、字距拉開、置中、放在插畫下方三分之一處。給範圍不如給規則。
用途上,這種雙格版型最適合需要「一整套」的場合:旅行照做成系列明信片、課程或專欄的固定封面格式、店家的季節海報、IG 的九宮格。單張的驚豔度未必贏過其他生圖玩法,但擺成一排的時候,一致性就是整組作品的品質。
這張值得單獨講。原 prompt 只寫了「用少量線條或小色塊暗示周圍環境」,沒有教它怎麼處理框景。模型自己判斷混凝土開口是這張照片的敘事核心,把它畫成一圈撕裂的紙緣,中間留出天空。這是整組指令裡「保留核心敘事關係」那句話真正發揮作用的時刻——它不是要模型複製元素,是要它讀懂哪個關係不能丟。
CHAPTER 08 · WITH PEOPLE
我原本把人像列為這套的禁區,理由是模型忍不住動臉。後來又丟了三張有人的照片進去,結論得改一半。
這張是純風景之外最好的一張,原因在人。沒有那個小人,那片米白就只是空白;有了他,同一片空白立刻變成整座山的距離。人是天然的比例尺,10–20% 的規則遇上人物,效果反而比純風景更強。
服裝在這套裡是資產不是負擔。制服的深藍、滑雪裝的橄欖綠,本身就是大面積的單色塊,正好餵給「少量平塗色塊」那條規則。相比之下,穿得花的人物反而難處理,因為色數會爆掉。
三張跑下來,真正的變數不是「有沒有人」,是臉在畫面裡佔了多少像素。背影、側身、遠景、戴帽子或面罩的人物都很穩,因為模型根本沒有足夠的臉可以動。而下半的插畫層本來就要求高度簡化,五官在那個尺寸下會被自動省成兩三筆,反而完全避開了 AI 畫臉最容易失手的區域。
另一個沒預期到的好處:人的形狀辨識度極高,簡化到只剩輪廓還是認得出來。風景簡化過頭會變成無意義的抽象色塊,人物不會。所以想試「更狠的留白」——把佔比壓到 8% 以下——人物照的容錯空間比風景照大得多。
CHAPTER 09 · LIMITS
跑了幾十張之後,失敗集中在四個地方。
正面近距離特寫是人像唯一真正的地雷。上一章那三張之所以穩,是因為臉小或根本沒露;一旦換成半身以上的正面肖像,模型就會開始「順手修一下」,五官比例跟臉型都會飄。prompt 裡寫死的保留五官那句話在這種構圖下擋不住,要嘛換一張構圖,要嘛做好重跑五次的心理準備。
招牌上的文字會亂。下半的插畫版本尤其明顯,日文招牌重畫後常常變成似字非字的符號。近看破功,遠看反而像刻意的簡化處理。介意的話,選照片時避開文字資訊量大的畫面。
1:1 分割常常變成 55:45。模型對精確比例的執行力向來不好,這是已知的老問題。差一點點肉眼看不出來,差太多就重跑,或是輸出後自己裁一刀。
色數則是壓不太住。四色上限實際跑出來常常是六到八色,只是色相集中所以看起來還算克制。想真的壓乾淨,把數字改寫成三色會比較接近。
另外一件跟成品品質無關但值得知道的事:主流生圖模型的輸出多半帶有隱形浮水印與來源簽章,要拿去商用或投稿之前值得先搞清楚規則,這部分我整理在 AI 生成內容的隱形浮水印與 C2PA 簽章。
CHAPTER 10 · TAKEAWAYS
· 骨架是 3:4 直式、上下 1:1 對切,上半原照、下半手繪
· 撐住風格的是三個數字:1:1、10–20%、4 色以內
· 下半的顏色必須從原照片取,兩半才對得起來
· 十四項負面清單擋掉的是模型的插畫慣性,不要刪
· 選照片要有明確主體,均勻風景照不適合
· 要調就調限制值,加形容詞沒有用
· 人像可以用,背影、側身、遠景都穩,臉越小越安全
· 服裝的大面積單色是資產,穿得花的人物反而難處理
· 正面特寫、招牌文字、精確比例是三個已知弱點
這組 prompt 拆到最後,會發現它跟一份給插畫外包的設計規格書沒什麼兩樣。尺寸、分割比例、主體佔比、色數上限、材質要求、風格禁區——每一條都是設計師開會時會講的話,只是這次講給模型聽。
這也是我一直覺得 AI 生圖的門檻被誤解的地方。多數人以為門檻在會不會下 prompt,其實在你腦子裡有沒有那套語言。知道「留白要留到主體剩一成」的人,才寫得出那個數字;知道「顏色要從原圖取才對得起來」的人,才會把兩條規則綁在一起。工具把執行的成本壓到近乎為零,剩下值錢的就是判斷。Sagmeister 說合格很便宜、好看很貴的時候,講的大概也是同一條線。
所以這篇真正想給的不是那幾張圖,是那六個模組的切法。下次你要把任何一種視覺風格寫成可重複的模板,順序都一樣:先鎖版式,再鎖主體,再鎖顏色,最後把慣性擋掉。
RELATED READS
AI 插畫首選還是 Midjourney 嗎?2026 年設計師的六大工具選型
六家生圖工具的實際分工,決定這組 prompt 該丟去哪裡跑。
閱讀 →單色印刷風海報怎麼用 AI 做?兩塊印版、留白比例與七種字體角色
另一套可以直接接進下半插畫層的印刷質感邏輯。
閱讀 →Claude Code 怎麼做出沒有 AI 感的網站?三步驟把 AI 調教成懂品味的設計師
同一套「用限制取代形容詞」的思路,換到網頁端的版本。
閱讀 →Midjourney V8.2 更新了什麼?成為預設模型一個月後,設計師該重測的三件事
想把這組 prompt 搬到 Midjourney 上跑之前該知道的差異。
閱讀 →Adobe for ChatGPT 是什麼?70+ 個 Adobe 工具進駐 ChatGPT 完整解析
生完圖之後的後製與輸出,可以留在同一個對話裡完成。
閱讀 →AI 時代的設計師為什麼最焦慮?2026 調查數據與兩位 AI 設計主管的診斷
當執行成本歸零,設計師剩下什麼值錢——這篇的另一面。
閱讀 →FAQ
A:中文版可以跑,但服從度明顯較低。editorial、negative space、flat color shapes 這類 art direction 術語在英文語料裡的密度高很多,模型對它們的理解穩定得多。建議 prompt 用英文,文字層要出現的中文另外指定。
A:主體不明確的照片最容易失敗,例如整片海、整片森林、大逆光剪影。人物照可以用,背影、側身、遠景都很穩,只有正面近距離特寫會讓模型忍不住改臉。建築、地標、街景、有輪廓的物件成功率最高。
A:prompt 開頭就寫了每張照片各自輸出、不准拼貼,但多數模型一次收到多張還是會合併或彼此污染。實務上一次一張最穩,十張就跑十次。
A:直接改數字,把 10-20% 降成 8-12%,同時把色數上限從 4 降到 3。不要加「更簡潔」「更有留白」這種形容詞,模型對數值的反應比對形容詞明確太多。
A:不建議。那十四項擋掉的正是模型聽到「手繪插畫」時最容易滑進去的預設風格——蠟筆、暈染水彩、可愛角色、3D 質感。刪掉之後前三張可能還好,跑到第十張就會開始飄。
A:版型本身是通用的編輯設計手法,沒有專屬權。要注意的是原照片的版權(用自己拍的最安全)、以及各家模型對商用的服務條款與生成內容標示規範,投稿或販售前先確認一次。
A:改下半的「保留清單」。人像把 key pose or gesture 提到最前面、加一句保留服裝輪廓,實測背影與側身不必再多做設定就會過;食物把 important objects 改成器皿與擺盤關係。上半那段跟版式完全不用動。