一句话描述就能生成图片,还能读懂你的 Google 相册——2026 年的 Gemini 让 AI 生图变得前所未有的简单。免费用户也能用 Nano Banana 2 生成个性化图片,无论你是想"画"一张插画、做一张"时空合照",还是设计理想中的家,这篇教程都能帮你快速上手。

一、核心模型:Gemini 用什么"画"图?
Gemini 的图像生成能力由两个核心模型驱动:
Nano Banana 2
即 Gemini 3.1 Flash Image,主力图像生成模型,兼具 Pro 级别的视觉质量和 Flash 级别的速度。生成一张 1K 分辨率图片约需 4 秒。免费用户可用。
Nano Banana Pro
即 Gemini 3 Pro Image,企业级高精度模型,支持 4K 分辨率输出。面向付费和企业用户,适合对画质要求极高的专业场景。
此外,Gemini 还整合了 Imagen 3——Google 最先进的文生图模型,能从简单的文字提示生成高质量、细节丰富的图像。
二、准备工作:三步开启生图功能
登录 Gemini
在浏览器打开 gemini.google.com,用你的 Google 账号登录。
开启"个人智能"(Personal Intelligence)
这是 Gemini 图像生成的核心开关——必须开启才能使用个性化图像生成功能。开启后,Gemini 可以访问你授权的 Google 服务(Gmail、Google 相册、YouTube、搜索等),从而理解你的偏好和上下文。这是可选功能,可随时关闭或调整权限。
⚙️ 设置 → Personal Intelligence → 打开开关
连接 Google 相册(可选但推荐)
如果你希望 Gemini 生成包含你本人或家人形象的图片,建议在设置中授权 Gemini 访问 Google 相册。开启后,不再需要每次手动上传照片。
三、两种生成方式
📝 基础文生图(最简单)
最直接的生成方式——输入描述,AI 出图。
- 在 Gemini 对话框输入描述,建议以 "生成一张…的图片"或"创建一张…的图片"开头
- 按回车发送,等待生成(约 4 秒)
"生成一张写实风格的图片:一只橘猫坐在咖啡馆窗台上,阳光透过玻璃洒进来,背景有绿色植物"
🎨 个性化图像生成:AI 能"认识"你
这是 Gemini 区别于 ChatGPT 等竞品的核心功能。操作步骤:
- 开启"个人智能"(见上文准备工作)
- 输入简短描述——无需详细列出所有偏好,Gemini 会自动从你的 Google 数据中补全
- 点击生成
"生成一张包含咖啡、烘焙、猫、温暖色调的插画"
"生成一张包含我最喜欢的事物的插画"——Gemini 会从你的数据中推断出你喜欢咖啡、烘焙和猫
🔥 热门玩法:"时空合照"
2026 年 Gemini 最火的玩法之一——让成年的自己和童年的自己"同框合影"。操作步骤:
- 在对话框点击"生成图片"
- 上传两张照片:一张童年照片 + 一张近期照片
- 输入以下指令(可直接复制):

"我想把两张照片合成在同一张画面里。画面中,成年版的他搂着小时候的自己肩膀,两人并肩站在一起自拍,呈现出真实手机拍照的效果。两人都要看着镜头,脸部特征尽量维持与原始照片一致,逼真度要高。整体氛围:红色空间,背景是一面鲜红色墙壁。"
"Combine two photos into a single frame. The adult version of the person is putting an arm around the shoulder of their younger self. Both are standing side-by-side, taking a selfie with a realistic phone camera effect. Both subjects should be looking at the camera, with facial features as consistent as possible with the original photos, aiming for high realism. The overall atmosphere is a red space, with a vibrant red wall in the background."
同样的方法也适用于生成"与偶像同框"的照片。
四、编辑功能:改图不用重画
Gemini 不仅支持"从零画",还支持对已生成或已上传的图片进行对话式编辑:

局部修改
指定画面中的某个元素进行替换或调整
风格变换
将图片从一种风格转为另一种
扩展画面
在原有图片基础上扩展画幅
"把这张图片的背景从白天改成夜晚,添加星星和月亮"
五、提示词技巧:怎么"说"AI 才懂?
技巧 1:用"Persona + Task + Context + Format"四段式结构
Google 官方推荐的提示词结构:
| 要素 | 说明 | 示例 |
|---|---|---|
| Persona(角色) | AI 以什么身份回应 | "你是一位插画师" |
| Task(任务) | 要做什么 | "生成一张赛博朋克风格的城市夜景图" |
| Context(上下文) | 补充条件 | "用于手机壁纸,竖屏比例" |
| Format(格式) | 输出形式 | "4K 分辨率,PNG 格式" |
组合示例:"你是一位插画师。生成一张赛博朋克风格的城市夜景图,用于手机壁纸,竖屏比例。4K 分辨率。"
简短精炼,聚焦感官细节
Nano Banana 2 能理解长句,但不需要赘字。应专注使用具有感官细节的形容词。
专注于"正面引导"
模型对"不要出现什么"的理解力较弱。应专注描述你想要什么,而非你不想要什么。
善用"思考型"模式
在生成复杂图像时,建议将 Gemini 切换到 "思考型"(Think)模式。模型会先展示推理过程,再给出更精准的输出。
由浅入深,逐步迭代
建议先从基础描述开始生成,看到效果后再逐步增加细节:
- 第一轮:"生成一张猫的图片"
- 第二轮:"把猫改成橘猫,坐在窗台上"
- 第三轮:"加阳光和绿植背景"
六、免费额度与限制
截至 2026 年,Gemini 免费版图像生成的主要限制如下:
| 项目 | 免费版 |
|---|---|
| 每日生成额度 | 约 20 张图片 |
| 可用模型 | Nano Banana 2(1K / 2K 分辨率) |
| 个性化生成 | ✅ 支持(美国地区用户) |
| 编辑功能 | ✅ 支持(18 岁以上) |
| 4K 输出 | ❌ 仅付费 / 企业版 |
| 地区限制 | 个性化生成目前主要面向美国地区用户 |
写在最后
Gemini 生成图片的核心逻辑可以概括为三句话:
会"听"
你不需要写复杂的提示词,简单描述就能出图。
会"认"
开启"个人智能"后,AI 能读懂你的偏好,甚至从 Google 相册调用你的照片。
会"改"
生成不满意?直接对话修改,不用重画。
打开 gemini.google.com,开启"个人智能",从第一句描述开始——这就是全部步骤。
免费版每天约 20 张的额度足够日常使用,用顺手了再考虑升级。
参考资料:
本文基于 2026 年公开资料整理,各功能、额度和地区可用性可能随时调整,请以官方最新信息为准。
