有个朋友跟我开玩笑说:“都说你是起名大师,但我怎么觉得现在 AI 起的名字比你强呢?”我知道这话里带着调侃,但确实让我心里一紧:AI 起名真的有那么厉害吗?我这个“名师助阵 · 方法系统”的饭碗难道要被抢了?既然如此,借助 Codex 的帮助,我和团队设计了一系列实验,试图用数据和事实来验证 AI 起名的真实能力和边界。做完这些实验,我终于有底气说一句:AI 起名现在还真没我强,当然了,也没有圆桌起名强。
如果你觉得好奇,不妨继续往下看。看看我们做了哪些实验,又是如何得出这个结论的。
既然是比较人和AI起名的能力孰强孰弱,那么大家走的流程就应该基本一致:先根据出生日期推算五行喜用,再根据五行喜用给出名字,最后检查名字的音、形、义各方面是否合适。为了测试得更细一些,我们又把这套流程拆成了七个实验。
第一个问题,同一个AI,面对同一组出生信息,前后两次给出的五行判断能不能一致?
第二个问题,同一组出生信息交给不同AI,它们算出的五行喜用是不是一样?
第三个问题,姓氏、性别和五行都不变,让AI连续起名,它到底能给出多少个不重复的名字?
第四个问题,只换姓氏、不换五行,AI会不会把同一个名字推荐给不同家庭?
第五个问题,只换五行、不换姓氏,AI推荐的名字会不会真正跟着变化?
第六个问题,AI连续给出大量新名字时,会不会越起越生僻,最后名字虽然不重复,却不好认、也不好用?
第七个问题,AI说某个名字出自《诗经》《楚辞》或其他古籍,这些出处回到原文里,到底还能不能成立?
这七个问题连起来,其实就是一次完整的起名过程:五行算得稳不稳,名字起得好不好,最后给出的解释靠不靠谱。我们先从第一步开始,看AI的五行判断能不能站稳。
实验一:同一模型,多问几次,五行判断一致吗?
测试方法:我们准备了30组完整四柱,让五个模型(Claude、Codex、Qwen、DeepSeek、Gemini)分别按照两套都合理、但分析结构不同的提示进行判断,再比较同一模型前后两轮给出的主用神、喜神主次组合是否一致。
测试结果:Claude前后两次一致的有16组,占53.3%;Codex有14组,占46.7%;Qwen有7组,占23.3%;DeepSeek有5组,占16.7%;Gemini有4组,占13.3%。五个模型合在一起看,150组前后判断中只有46组一致,整体一致率为30.7%。
结论:换一种正常的问法再问一次,AI给出的五行判断就很可能发生变化,整体只有30.7%的前后判断能够保持一致。这样的结果,很难直接用于实际起名:如果五行判断本身不稳定,后面按五行推荐的名字也就缺少稳定基础。
实验二:同一日期,不同模型,五行判断一致吗?
看到第一个结果,我们自然会想到一个办法:一个 AI 不够稳,那就多问几个,少数服从多数,行不行?
测试方法:我们把同样的30组四柱分别交给五个模型独立判断主用神和喜神,共形成150票,观察同一组四柱在不同模型之间的主次组合是否一致。
测试结果:
- 只有1组(3.3%)完全五模型一致。
- 至少4个模型一致的有7组(23.3%)。
结论:同一组出生信息,五个AI能够完全算出相同五行喜用的情况只有3.3%,至少四个AI一致的也只有23.3%。多问几个AI,并不能让五行判断变得更可靠,反而很可能得到几套不同答案。用这样的结果继续起名,家长最后连该按哪一套五行选名字都无法确定。
实验三:同一姓氏、同一五行,连续起名会不会重复?
测试方法:我们固定女孩、用神水、喜神金三个条件,让七个模型分别为八个姓氏连续起名。每轮要求10个名字;当一轮中已有名字的占比达到80%时停止,否则最多进行30轮。最终得到56组有效实验,共953次调用、9530个名字。
测试结果:
- Qwen、DeepSeek 和 GLM 平均约在第9轮达到80%精确重复阈值。
- Gemini 和 GPT 更晚达到类似水平。
- Mistral多数姓氏达到阈值,但有一个姓氏跑满30轮仍未达到。
- Grok 在8个姓氏测试中,30轮后仍未达到80%重复率。
结论:在七种受测模型中,有六种最终出现了大量重复;其中Qwen、DeepSeek和GLM大约给出80—90个名字后,就达到了80%的重复标准。也就是说,在姓氏、性别和五行条件都不改变的情况下,多数受测AI能够持续提供的新名字是有限的,有些模型的常用候选空间大约到80—90个就开始明显重复。继续要求更多名字,要么会直接重复,要么会围绕相似的字反复组合,甚至转向更生僻的字,很容易造成名字扎堆。AI起名不是给得越多越好,真正需要的是在有限候选中去重、筛选和判断。
实验四:五行相同、姓氏不同,AI会不会复用名字?
测试方法:沿用实验三的数据,固定女孩、用神水、喜神金,只改变姓氏。我们去掉姓氏后,比较同一模型为八个不同姓氏推荐的名字是否重复出现。
测试结果:七个模型都出现了跨姓复用,只是程度不同。以Qwen为例:
- 236个不同名字中,有139个被用于两姓以上。
- 49个至少用于四个姓氏。
- 4个甚至用于全部八个姓氏。
结论:改变姓氏,没有让八组候选形成彼此独立的名字集合。结果看起来像是模型先形成一批常用名字,再与不同姓氏组合,但这只是根据输出作出的解释,实验并没有观察模型内部的生成机制。对家庭来说,不能只看去掉姓氏后的名字是否文雅,还要把完整姓名连起来检查声调、谐音、停顿、字形和实际称呼感受。
实验五:姓氏相同、五行不同,推荐名字会不会变化?
前两个实验说明,同一条件连续生成会出现精确重复,不同姓氏之间也会复用名字。可这还不能证明 AI 不看五行条件。于是我们继续问:如果用神、喜神真的换了,它推荐的名字会不会相应改变?
测试方法:我们固定女孩,选取Qwen、GPT、Grok三个饱和特征不同的模型,以林、欧阳两个姓氏分别测试七组用神、喜神条件。每个模型、姓氏、条件固定十轮,每轮十名,共得到4200次推荐,再分别比较不同五行条件下完整名字集合与单字集合的平均重合程度。
测试结果:
- 不同条件之间,完整名字的平均重合程度很低,介于0.12%到0.67%。
- 拆到单字后,平均重合程度约为11.28%到16.61%。
结论:五行条件变了,AI推荐的完整名字确实会跟着变。但拆开来看,它还是喜欢围绕一批熟悉的字重新组合。换五行条件能让名字表面上发生变化,却不能完全解决用字扎堆的问题。
实验六:AI推荐的名字,是常用好认,还是生僻难用?
测试方法:我们从七个模型、八个姓氏的连续推荐结果中分层抽取300个全名,依据《通用规范汉字表》8105字的层级检查用字;随后让三位语言模型分别做盲评,共得到900条评审结果。
测试结果:在规范字层级上:
- 93个名字只含一级规范字。
- 171个含二级规范字。
- 32个含三级规范字。
- 4个含不在8105字表内的字。
以“至少两位评审愿意列入候选”为口径:
- 一级字名字中,67.7%被至少两位模型评审认可为候选。
- 二级字名字认可比例是42.7%。
- 三级字名字认可率仅9.4%。
- 未收录字名字认可为0%。
结论:名字里的字越生僻,进入候选的比例就越低。一级字名字还有67.7%得到至少两位评审认可,到了三级字只剩9.4%,表外字一个也没有。AI为了继续给出不同的名字,很容易把字越用越偏。这样的名字看起来不重复,真正使用时却可能难认、难写、难输入。起名不是生僻字比赛,名字能不能顺利使用,比表面上的独特更重要。
实验七:AI给出的名字出处,逐条核验能成立吗?
测试方法:我们从512条带解释的名字推荐中分层抽取60条,样本有意覆盖出处说明中的异常情况,再逐条核对名字、原句、篇章和归属关系。
测试结果:
- 9条没有明确来源主张。
- 51条中:
- 18条出处成立,且能找到对应文献。
- 10条属于同句拆字组合。
- 8条仅是联想或部分匹配。
- 5条归属或引文错误。
- 9条疑似拼接或生成。
- 1条未决。
例如,“清婉”对应“清扬婉兮”,两个字都在同一句里,却不是连续词组,应当归为同句拆字组合,不能写成名字直接出自原文。“若有人兮山之阿”原句可查,但属于《九歌·山鬼》;如果标成《离骚》,就是篇章归属错误。
结论:在51条明确声称有出处的名字中,只有18条能够直接成立,占35.3%。其余有的是从同一句里拆字组合,有的只是意思接近,还有的直接弄错了篇章或引文。AI最厉害的地方,是能把这些解释说得都像真的;最危险的地方,也正在这里。名字的出处不能只听AI讲,必须回到原文里核对。
圆桌起名如何应对这些问题?
实验做到这里,我也不能只顾着说AI哪里不行。既然问题看见了,就要想办法解决。圆桌起名做的几项调整,也正好对应前面发现的问题。
五行分析先共用一套基础,不让老师各说各话
系统先根据同一份出生信息,把用神、喜神、采用的方法和判断过程整理清楚,再交给不同老师继续起名。老师可以有不同的审美和思路,但不能一位说用水,另一位转头又把火放在前面。这样至少能避免同一个孩子、同一次起名,几位老师先在五行上各说各话。
名字不靠一个老师闷头想,也不靠多数票定输赢
多位AI起名老师会分别从五行与文字实用、音韵意象、家庭称呼、传播辨识度等角度参与。有人看方法能不能落到具体用字上,有人看连姓之后是否顺口,有人关心名字放进日常称呼里是否自然。一个人容易顺着熟悉的路一直走,多几个角度,名字才不容易困在同一种套路里。
候选先统一去重,再进入解释
候选进入解释和多老师共同解读前,会先做规范化、精确去重和数量限制。完全相同的名字先剔除,不让同一个候选换一段说法又出现一次。名字不是越多越显得有本事,留下真正值得比较的一批,比堆出几十个相似答案更重要。
出处先查语料,查不到就不临场编一个
候选进入解释阶段时,系统会批量查询已有出处语料,优先使用能够匹配原文和来源的资料。没有明确出处,就应该如实说明,而不是为了让名字显得有文化,临场补出一句古文。即使语料命中,也还要核对篇章、作者,并区分名字是原文直接出现、从同一句拆字组合,还是只借用了意象。
结语
现在再回头回答朋友那句“AI起名是不是比你强”,我心里就踏实多了。
AI确实快。你给它一个姓氏、一组五行条件,它转眼就能写出十个、几十个名字。但起名从来不是比谁写得多。五行判断前后不一,换个姓氏还在推荐同一批名字,起得越多越容易重复,想显得特别又开始使用生僻字,最后连古籍出处都可能说错。任何一关没有处理好,名字再漂亮,也经不起仔细推敲。
所以这一轮,我的饭碗算是保住了。不是因为AI不会起名,而是因为真正的起名还需要方法、筛选、核对和取舍。AI可以一下子给出一大片麦田,但最后哪一株麦穗值得留下,仍然不是靠生成速度决定的。
如果你想进一步了解研究方法、完整数据和适用边界,可以访问AI 起名研究专题。如果你想先把自己的要求展开、获得一批候选,再按照本文的方法逐步筛选,也可以试试免费 AI 起名工具。
希望你能用好AI,也保留自己的判断。

