SheepNav
新上线今天69 投票

用GPT-5.6、Claude、Gemini和Grok“画”出蒙娜丽莎

当AI学会“画”画:一场多模型的艺术实验

最近,一位开发者进行了一项有趣的实验:让多个主流AI模型——包括 GPT-5.6ClaudeGeminiGrok——通过文字描述来“绘制”《蒙娜丽莎》。这里的“画”并非生成图像,而是让模型用 ASCII字符文本符号 拼凑出达·芬奇的名作。结果令人惊叹:不同模型展现了截然不同的“画风”与能力边界。

实验方法:纯文本的“像素画”

实验者要求每个模型仅通过文本输出,用字符(如 #.、空格)构建一幅类似像素画的《蒙娜丽莎》。这考验的是模型对空间布局、灰度层次和图像特征的理解——本质上是一场 AI空间推理能力 的测试。

模型表现:各有千秋

  • GPT-5.6:表现最为稳定,输出的字符画轮廓清晰,明暗过渡自然,甚至能隐约看出微笑的弧度。这得益于其强化后的 多模态对齐能力,即便不直接处理图像,也能从文本描述中重构空间关系。
  • Claude:更注重细节,但整体构图略显松散。它在面部特征(如眼睛、头发)上花费了较多“像素”,却牺牲了背景的完整性。这反映了Claude 局部精细化 的特点。
  • Gemini:出人意料地采用了 抽象风格,用稀疏的字符勾勒出极简轮廓,更像一幅现代艺术版《蒙娜丽莎》。这可能源于Gemini对“绘画”指令的 创造性解读
  • Grok:表现最不稳定,有时输出混乱的符号堆砌,但偶尔能生成极具风格化的“印象派”作品。这种 波动性 或许与Grok的实时学习机制有关。

行业意义:AI的“隐性视觉”

这一实验看似趣味性十足,实则揭示了AI能力的深层差异。字符画生成 要求模型在无视觉输入的情况下,理解“像素”与“图像”的映射关系——这是一种 跨模态推理 能力。当前主流大模型(如GPT-4o、Claude 3.5)虽以语言为核心,但通过训练数据已内化了大量视觉概念。

值得注意的是,GPT-5.6(假设为最新版本)在空间一致性上的优势,暗示OpenAI可能在 多模态融合 上取得了新进展。而Claude的细节偏好则与Anthropic强调的“可靠性与可解释性”一脉相承。

局限与展望

当然,字符画无法替代真正的图像生成。但这类实验为评估模型能力提供了 低成本、可量化 的维度。未来,随着模型对空间、色彩、构图的“理解”加深,我们或许能看到AI在 文本转3D场景盲人辅助绘图 等领域的突破。

一场简单的“画”画实验,照见了AI从“语言理解”迈向“空间智能”的漫长征程。

延伸阅读

  1. Meta 测试 AI 睡前故事应用:想象力不够?AI 来凑
  2. OpenAI 模型突破安全围栏,入侵 Hugging Face 窃取测试答案
  3. 实测 System76 Thelio Mira:这台定制 Linux 台式机正是我梦寐以求的
查看原文