Whisk是谷歌实验室(Google Labs)推出的实验性生成式人工智能图像工具,于2024年12月在美国上线[1]。与依赖长文本提示词的常见图像生成工具不同,Whisk采用图像作为输入,用户可分别提供表现主体、场景和风格的图片,由模型提取其关键特征后融合生成新图像[1]。其背后由Gemini负责图像理解与描述,再由Imagen 3生成画面,后加入Whisk Animate功能,可用Veo 3把生成结果转为短视频[2]。
定义
Whisk是谷歌实验室推出的生成式人工智能实验工具,定位于快速视觉构思,而非传统的图像编辑软件[1]。它的核心特点是用图像代替文字作为提示:用户拖入图片即可开始创作,无需撰写冗长细致的提示词[1]。
使用者在主体、场景、风格3个位置各放入一张图片,工具会把这些要素混合重组成新的画面,例如把一张手绘稿变成毛绒玩具、珐琅徽章或贴纸[1]。谷歌将其描述为一种新型创意工具,意在帮助使用者浏览数十种方案并下载其中喜欢的作品,而不追求逐像素的精确编辑[3]。
原理
Whisk的工作流程分为理解与生成两步。用户上传图片后,Gemini模型会为每张图自动撰写一段详细的文字描述,这些描述随后被送入谷歌的图像生成模型Imagen 3,由后者绘制出新的图像[1]。
由于系统只从输入图像中提取少量关键特征,最终结果保留的是主体的“神韵”而非精确复刻,因此主体、场景和风格能够被自由地重新组合。生成过程中用户可以查看并随时修改这些底层提示词,以调整画面细节[4]。
后续加入的Whisk Animate功能基于Veo 3视频模型,把已生成的图像转成短片[2]。其底层模型链路可概括为:输入图像经Gemini转写为文本,再交由图像模型渲染,若需动态则接入视频模型。
发展历程
2024年12月16日,谷歌在美国上线Whisk,同日发布新版Imagen 3与视频模型Veo 2,Whisk成为谷歌实验室用最新生成式模型开展实验的载体之一[5]。
2025年2月11日,谷歌宣布Whisk从美国扩展到100多个国家和地区。此后该工具进入韩国、土耳其等市场,并陆续增加新的功能[4]。
在图像生成之外,Whisk加入了动画能力:Whisk Animate借助Veo 3把静态生成图转为短视频,支持地区内的用户每月可免费生成5段视频,额度按月重置,订阅谷歌AI Pro或Ultra可获得更高上限[2]。
应用
Whisk的典型用途是快速产生视觉创意,可输出数字毛绒玩偶、珐琅徽章、贴纸等形象,也可用于节日贺卡或故事开篇的画面构想[1]。
在使用方式上,它更像构思阶段的辅助工具。使用者可以反复重混主体、场景和风格,快速浏览多组方案并挑选下载,适合个人创作、概念设计与灵感探索,而不是成品的精细修图[3]。
围绕Whisk也出现了第三方扩展,例如浏览器端插件可把脚本批量转成提示词、维持角色一致性并提供预设风格模板,用于减少反复生成的重复操作[6]。
局限
Whisk只从输入图像中提取少数关键特征,因此生成结果可能偏离预期,例如所生成主体的身高、体重、发型或肤色与原始图片不同[1]。谷歌为此提供了查看和编辑底层提示词的功能,但这意味着它难以承担要求高度还原的创作任务[4]。
该工具的设计目标是快速视觉探索,而不是逐像素精确编辑,所以不适合替代专业图像处理软件,输出结果也常常需要用多轮重新生成来筛选[1]。
视频生成能力存在额度限制,免费视频数量按月重置且不可累积,超出后需订阅相应服务;可用范围也受地区限制[2]。
参见
参考资料
- Whisk: Visualize and remix ideas using images and AI . blog.google [引用日期2026-10-04]
- Whisk Help Center . labs.google [引用日期2026-10-04]
- google-ai-whisk-image-prompts . cnn.com [引用日期2026-10-04]
- blog.google 上的网页 . blog.google [引用日期2026-10-04]
- blog.google 上的网页 . blog.google [引用日期2026-10-04]
- WHISK FACTORY . google.com [引用日期2026-10-04]
浏览次数:1 次
阅读量:0 次 · 阅读完成量:0 次
最近更新:2026-10-03T18:19:20Z
完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。