让 AI 一直起名,它究竟能给出多少个不重复的名字?
我们的答案是:不同 AI 的差距非常大。在这次测试里,Grok 最能维持完整姓名不重复,DeepSeek 最早进入高重复区间。但这项排名只回答“能给出多少种不同写法”,不回答“谁起的名字最好”。
这两个问题必须分开。否则,数量很容易掩盖名字在真实使用中的成本。
表现最好的 Grok,和最早重复的 DeepSeek
我们固定了一类起名需求:女宝宝、双字名、用神水、喜神金,再让 7 个 AI 分别为 8 个姓氏连续起名。
每个“AI × 姓氏”组合单独进行,每轮给出 10 个名字,并要求尽量不与此前结果重复。某一轮如果有至少 8 个完整姓名已经出现过,就视为进入高重复区间并停止;没有达到则最多进行 30 轮。
56 组有效测试共完成 953 个有效轮次,得到 9,530 个名字。结果拉开了明显差距:
| AI | 平均进行轮数 | 每姓平均不同姓名数 | 本次结果 |
|---|---|---|---|
| Grok | 30 | 约 292.6 | 8 个姓氏全部跑满 30 轮,均未进入高重复区间 |
| Mistral | 23.25 | 约 184.1 | 7 个姓氏进入高重复区间,1 个跑满 30 轮未进入 |
| GPT | 21.25 | 约 156.5 | 8 个姓氏最终都进入高重复区间 |
| Gemini | 18 | 约 133.8 | 8 个姓氏最终都进入高重复区间 |
| GLM | 9.125 | 约 72.4 | 8 个姓氏最终都进入高重复区间 |
| Qwen | 9 | 约 69.8 | 8 个姓氏最终都进入高重复区间 |
| DeepSeek | 8.5 | 约 61.6 | 8 个姓氏最终都进入高重复区间 |
只看维持完整姓名不重复的能力,Grok 是这次表现最好的,DeepSeek 是最差的。Grok 平均每个姓氏给出了约 292.6 个不同姓名,DeepSeek 约为 61.6 个,前者接近后者的 4.75 倍。
这里比较的是平均表现,不是每个姓氏都会在同一轮重复。同一个 DeepSeek,最早的一组在第 4 轮触发高重复,最晚的一组到第 15 轮;GPT 则分布在第 15 至第 27 轮。这说明换一个姓氏,实际结果也可能明显变化。
为什么“不重样”不能直接等于“更会起名”
完整姓名没有重复,只能说明字符组合不同。
在真实使用中,一个名字还要经过读音、识别、书写、含义和场景的检验。模型只要换一个偏旁、使用更少见的字,或者重排相近字素,就可以继续制造不同字符串。但对父母来说,这些变化未必带来新的选择,反而可能增加辨认、输入和解释成本。
本次表现最好的 Grok 就展示了这个边界。它在 30 轮内始终没有触发 80% 的完整姓名重复,但结果中也出现了较多水旁字、金玉字和生僻字的组合扩张。换句话说,它很擅长继续给出不同写法;这些写法是否自然、常用、适合孩子,则需要另一套判断。
DeepSeek 较早重复,也不能直接推导成它提供的名字最差。它在“不重复数量”这一项上落后,可能更早回到已经使用过的组合;但某个常见、顺口的名字,仍可能比一个从未见过却难认难写的名字更适合日常使用。
所以,这份排名的准确读法是:
- Grok 最能延长精确不重复的输出;
- DeepSeek 最早触发这次实验设定的高重复标准;
- 这不是模型综合起名质量排名;
- 不重复数量只是可用性判断的第一层。
真正有用的,不是继续堆数量
父母连续使用 AI 起名时,很容易把“多看一些”当成“更接近答案”。9,530 个名字给出的提醒恰恰相反:候选数量增加到一定程度后,新增内容可能走向两端——要么重复旧名字,要么依靠更少见的写法维持表面差异。
这时更有效的动作不是继续说“再来 10 个”,而是检查现有候选为什么不合适:
- 连姓读起来是否顺,有没有谐音;
- 哪些字太常见,哪些字又太难认、难写;
- 家庭想要的气质是否已经说清楚;
- 有没有固定字、避讳字或明确排除项;
- 名字放进称呼、介绍、登记和输入场景后是否自然。
如果还能提出新的真实条件,就按条件继续收窄;如果提不出,就应该从生成转向比较和淘汰。对起名来说,十个能认真比较的名字,往往比三百个只在字面上不同的名字更有价值。
与其押注一个模型,不如让多个模型共同判断
这次测试最值得转化成起名方法的,不是哪一个模型赢了,而是单一模型会呈现相对稳定的输出偏向。Grok 更能维持不同写法,DeepSeek 更早回到已有组合;换到名字质量上,也不能假定某一个模型会同时顾及音韵、出处、五行、现代语感和日常使用。
因此,更好的方案不是选定一个 AI 后反复追问,而是采用多模型、多角度共同思考:让不同模型分别提出候选,让不同判断视角检查同一个名字,再把真正成立的部分汇总起来。这样做不是为了得到更多名字,而是为了减少单一模型的盲区,让候选之间的差异更有意义。
圆桌起名采用的正是这种方式。由不同模型配置支持的多位 AI 起名老师围绕同一份家庭需求协作,分别关注八字五行、音形义、文化出处、现代语感、辨识度、日常使用和重名情况,再通过比较、筛选和持续沟通逐步收窄方向。
这也是 9,530 个名字后更完整的结论:只看不重复,Grok 在本次测试里最好,DeepSeek 最差;真正要得到可用的名字,则不应把希望押在某一个模型上。让多个模型、多个角度共同判断,才更接近家庭真实的起名过程。了解圆桌起名的多位老师协作方式。

