最近GPT Image 2的团队曝光了,带队的是一个从无锡出来的年轻人,整个团队就13个人,只用了4个月就做出了这个让人惊艳的成果。
最近GPT Image 2在网上刷了屏,大家都在好奇它效果为什么这么好。负责这项研究的陈博远透露,底层的架构已经彻底重做了。不过他不肯正面回答到底用的是扩散模型还是自回归技术,只是神秘地把它描述成一种“通用模型”,或者说“图像领域的GPT”。
陈博远还发了一条推文,提到从去年12月底的GPT Image 1.5算起,只用了四个月就取得了这么大的进步。
更让人意外的是,做出这种突破性成果的核心团队只有13个人。团队的负责人加布里埃尔·高晒出了一张AI生成的全家福,评论区有网友感叹,怎么全是亚洲面孔。
陈博远:从不懂Python做到研究负责人
GPT Image 2到底是什么架构,OpenAI估计很长时间不会公开。但从核心成员的学术背景里,多少能看出一些线索。
陈博远是团队的研究负责人。他和另一位成员Kiwhan Song在MIT读博时,跟的是同一位导师文森特·西茨曼。他博士期间的代表作叫Diffusion Forcing,入选了NeurIPS 2024,主要提出了一种新的序列生成训练方式,把逐token的噪声扩散和因果预测结合起来,融合了自回归模型和全序列扩散模型的优点。
他在谷歌实习期间还以共同一作的身份发表了SpatialVLM,简单说就是通过构建一个超大规模的空间推理数据集,让视觉语言模型能从单张2D图像里给出距离、尺寸、方向这些精确的数值。这项研究还把带思维链的空间推理用到了具身智能领域。
在谷歌实习的时候,他做过一个指令微调的技术,后来被Gemini 2.0采用了。他高中参加科研夏令营时还不太懂Python的基本语法,那时候认识了谷歌DeepMind的研究员夏斐,被对方领进了AI的大门。夏斐两次邀请他去DeepMind实习,这些经历让他积累了不少大规模模型训练的经验,也对多模态系统需要什么样的数据有了更深的理解。
博士毕业后,陈博远在2025年6月加入OpenAI,很快成了GPT图像生成五人核心成员之一,负责所有训练,同时也参与了Sora视频生成团队。他在演示里给自己家乡无锡做了一张海报,还给来自首尔的队友做了韩文海报,给来自孟加拉国的队友做了孟加拉语海报,每一张里的文字渲染都准确无误。
中科大的王剑峰:让生图AI理解世界知识
中科大博士毕业的王剑峰,在GPT Image 2团队里负责的是另一个让人惊叹的能力,指令遵循和对世界的理解。
老模型画的时钟永远指向10点10分,因为网上钟表广告图差不多都是这个角度,厂商找心理学家做过实验,认为这个角度最刺激消费欲望。而新模型让他画2点25分、3点30分、9点10分、7点45分,全都画得精准。
这还只是开胃菜。更复杂的空间布局,比如苹果在中间、杯子在右边、书在上面、相机在左边、篮球在下面,模型也能准确执行。
在加入OpenAI之前,他在微软工作了将近九年,期间就跟OpenAI团队合作过DALL-E 3。他的研究主要涉及图像分类、目标检测、语义分割、视觉表示学习这些方向。他在演示视频最后说,GPT Image 2正在缩小你心里的想法和模型实际输出之间的差距,真正做到你想要什么,它就给你什么。
杨宇光:生成高精度复杂信息图表
杨宇光在发布活动上演示了生成信息图和PPT。把整整75页的GPT-3论文拖进ChatGPT,自动生成了7张幻灯片。
他的经历在团队里算是最丰富的。每换一个工作都是跨界的,但始终围绕着机器学习。本科在浙大竺可桢学院读工程,博士在约翰斯·霍普金斯大学学的是计算化学物理和机器学习。第一份全职工作是量化分析师,在清华做访问研究员时搞的是用于纳米机器人的强化学习和控制算法。后来在亚马逊做过Alexa语音研究,又在微软做过Bing搜索的查询理解、检索和文档理解。2025年初加入OpenAI后,除了图像生成还参与过ChatGPT的智能体项目。
他在个人账号上说,GPT Image 2的信息图生成能力能给科研人员省下大量时间,还反复提醒大家做信息图不要忘了选思考模式。
从DALL-E到GPT Image 2.0
从团队成员Kenji Hata的介绍来看,GPT Image 1.0其实就是GPT-4o的图像生成部分。而团队负责人加布里埃尔·高,是从DALL-E开始就参与了OpenAI多模态系列研究的全程人物。他从2019年加入OpenAI,早期研究偏理论,比如可解释性和凸优化,后来从DALL-E开始慢慢转向图像生成。
再看另一位成员Weixin Liang的研究经历,也能瞥见GPT Image 2的技术底子。他在Meta实习期间的代表作叫Mixture-of-Transformers,主要是引入了解耦的MoE和解耦注意力,能明显降低多模态模型预训练的计算成本。他博士毕业于斯坦福,本科也来自浙大竺可桢学院,不过比杨宇光晚好几年。他和陈博远一样,都是2025年博士刚毕业就加入OpenAI,迅速成了团队核心。
其他团队成员还包括:之前在Luma AI工作、参与过Dream Machine训练的Ayaan Haque;在谷歌干了五年多、参与过Imagen 3、Veo、Gemini多模态、2025年跳到OpenAI做图像生成的Bing Liang;上海交大本科、得州农工硕士、在Pinterest和Airtable做过软件工程师、在OpenAI负责多模态产品工程的Mengchao Zhong;耶鲁大学毕业、2015年IPhO铜牌得主Dibya Bhattacharjee;以及2025年10月最晚加入的Kiwhan Song,他除了做研究还是团队里的提示词高手,很多官方演示图都出自他手。
从最早的DALL-E到今天的GPT Image 2.0,这个团队先后解决了画得出来、画得清楚、画得好看、画得准这几个问题。尽管近年来OpenAI的人才流动挺大,但它仍然是一家能吸引各种有个性的人才、不限制专业、欢迎跨界、信奉自下而上涌现式研究的公司。从一个小团队开始,有了突破后公司就倾斜更多资源,直到最后改变世界。
最后说个有意思的。以前GPT-4o图像生成模仿吉卜力风格的头像火遍了全世界,现在GPT Image 2.0的团队成员,都把自己的头像换成了那种奇奇怪怪的脖子画风。他们也公布了提示词大意是用本人的照片只保留身份特征,重新画成一个很简单的超现实日式贴纸风格漫画,长细脖子、小而无表情的脸、极简黑边、平涂浅色、几乎没有阴影、很少的面部细节、简化发型、大量留白、纯白背景、带一点点 awkward又好笑的调调,比例是超高的1比3。





