现在,AI 已经渗透到生活的方方面面,很多家长也开始用 AI 给宝宝起名。
这当然无可厚非。AI 有非常广泛的语言和文化知识,能快速理解“清爽一点”“不要太古风”“希望有书卷气”这样的模糊要求;沟通起来也足够流畅、耐心,可以一轮一轮地陪家长修改。
单看这些能力,AI 确实很适合起名。
但作为一个本身就在使用 AI 的起名平台,我们也免不了担心:通用 AI 会不会直接把我们取代?
如果家长只要打开一个大模型,输入宝宝的出生时间和起名偏好,就能得到可靠、完整的名字方案,那圆桌起名这样的专业平台还有多少存在价值?
如果 AI 能力真的足够强,我们被取代,可能也只是时代变化。与其回避,不如先认真测一次,看看它目前到底能做到哪一步。
我们选择的切入点,是宝宝八字的喜用神判断。
先简单解释一下:出生日期和时间可以用来排出四柱八字;喜用神则是在排盘之后,根据四柱结构进一步判断起名可以参考的五行方向。两者不是一回事。
这个环节很适合测试 AI。因为现在不少大模型和起名工具都能很快给出“喜金”“用木”“名字宜补水”之类的结论,而且往往解释得很专业。问题是:这些答案到底稳不稳定?换一个模型还会不会一样?能不能直接拿来决定名字用什么字?
带着这些问题,我们准备了 30 个完整八字,分别交给 Claude、GPT、Gemini、DeepSeek 和 Qwen,让它们独立判断日主强弱、所用方法、主要用神和辅助喜神。
我们想验证的也不是“AI 起名准确率是多少”。因为喜用神目前没有一套已经完成独立人工复核的标准答案,不能简单统计谁对谁错。
我们真正想知道的是:
面对同一批八字,五个主流模型能不能得到稳定、一致、可以直接用于起名的喜用神结论?
实验过程
第一轮,我们让各个模型独立判断。
每个模型只能看到当前八字和必要的命盘信息,看不到其他模型的回答,也不知道其他模型得出了什么结果。我们要求它们分别给出:
- 日主偏强还是偏弱;
- 主要采用扶抑、调候、从格还是其他方法;
- 哪个五行是主要用神;
- 哪个五行是辅助喜神;
- 为什么这样判断。

*图 1:实验比较的是模型结论是否稳定、一致、可复现,不是计算命理准确率。*
第一轮结果出来后,我们发现问题不只出在最终结论。
有的模型引用了并不存在的干支关系,有的把五行生克方向写反,有的给出的五行与自己的理由互相冲突。还有一些回答虽然读起来很完整,却没有真正回答主用神和辅助喜神分别是什么。
于是我们又做了统一信息后的复测。
这一轮不再让模型自己整理命盘事实,而是给它们同一份客观信息,包括表层五行、藏干、十神、季节、根气,以及可能存在的干支组合。模型只能引用这份信息,五行生克方向也要经过程序校验。
同时,我们把结果拆成四层检查:
- 命盘事实和回答结构是否满足要求;
- 日主强弱判断是否接近;
- 使用的主要方法是否一致;
- 最终用神和喜神的主次是否一致。
这四层不是模糊地凭感觉打分。第一层要求五个模型的回答都满足基本事实和结构要求;日主强弱至少要有 4 个模型接近;主要方法至少要有 3 个模型一致;最终用神和喜神的主次至少要有 4 个模型一致,才算通过全部门槛。
这样一来,我们就能分清:模型到底是看错了基础事实,还是面对同样的事实,依然采用了不同的判断方法。
一个典型案例:强弱判断相同,喜用神仍然分成四种
下面是统一协议复测中的一个典型案例。它是丁火日主,出生在夏季,局中火势比较集中。表格展示的是五个模型经过结构校验后的有效回答。
这一次,五个模型对第一层判断并没有明显分歧:它们都认为日主偏旺或极旺。但继续往下判断时,结果很快分开了。
| 模型 | 日主强弱 | 主要方法 | 主要用神 | 辅助喜神 |
|---|---|---|---|---|
| Claude | 极旺 | 扶抑 | 水 | 金 |
| GPT | 极旺 | 从格 | 火 | 木 |
| DeepSeek | 极旺 | 调候 | 水 | 金 |
| Gemini | 极旺 | 从格 | 木 | 火 |
| Qwen | 极旺 | 从格 | 土 | 木 |
这组结果很有代表性。
五个模型都认为“旺”,却选择了三种主要方法,最后给出四种不同的用神和喜神组合。甚至同样采用从格思路的三个模型,主用神也分别选择了火、木和土。
这说明分歧不只来自“有没有排错八字”。即使基础强弱判断相同,后面的分析顺序、取用方法和主次关系仍然可能不同。
这个案例只用于展示分歧发生在哪里,不能据此判断哪个模型正确。
实验结果
结果并不理想。
30 个案例、5 个模型家族,第一轮一共形成了 150 次判断。其中只有 114 次满足基本的结构和事实要求。
这 114 次“有效”,并不代表答案正确,只代表它们至少没有在第一道事实和格式检查中被挡住。
换成案例来看,30 个案例中只有 6 个案例的五份首答全部有效,其余 24 个首先停在事实或结构层。
在剩下的 6 个案例中,又有 3 个因为日主强弱判断没有达到门槛而停止,1 个在最终用神和喜神主次上停止,最后只有 2 个通过了全部四层的一致性门槛。
换句话说,按照本次预先设定的四层检查标准,五个模型在 30 个案例中只有 2 个案例能够全程达成一致,案例级全程一致率只有 6.7%。

*图 2:这里的 6.7% 是五个模型通过全部一致性门槛的案例比例,不是命理准确率。*
我们后来允许未通过结构校验的模型重新回答。这样做以后,150 份回答都满足了基本要求,30 个案例中有 8 个通过了全部门槛。
数字看起来提高了,但另一个问题出现了:36 次重新回答中,有 13 次改变了用神和喜神的组合,11 次连主要用神都变了。

*图 3:同一次重答可能同时改变“主要用神”和“组合”,图中各项可以重叠,不能相加。*
也就是说,让模型“重新整理一下答案”,并不只是改格式。它有可能连自己的核心判断一起推翻。
更值得注意的是,与上一轮实验相比,采用统一客观信息和结构化回答协议以后,各个模型使用的术语确实更接近了,但主要用神的结论并没有变得更一致。
我们比较了上一轮和新协议重试后,10 组模型配对在 30 个案例上的平均一致率:主要方法的一致率从 36.7% 上升到 53.7%,但主要用神的一致率反而从 46.3% 下降到 44.7%。

*图 4:一致率只衡量两份答案是否相同,不代表相同的答案就是正确答案。*
它们只是更像在用同一种格式和术语回答,并不代表它们更接近同一个喜用神结论。
所以,这次实验可以说“不同模型的案例级全程一致率只有 6.7%”,却不能说“AI 的命理准确率只有 6.7%”。我们没有经过独立人工复核的标准答案,无法据此判断其余 28 个案例都是错的。
对普通家长来说,这个区别并不会让困惑减少多少。当你把同一个八字交给多个模型,得到不同答案并不是偶发现象;问得越多,往往越容易产生新的疑问:为什么 Claude 说用水,GPT 说用火,Gemini 又说用木?我最后到底该听谁的?
至少在喜用神判断上,多问几个 AI,未必更接近答案,反而很可能得到更多相互冲突的解释。
但对于普通家长来说,这次实验已经说明了一件足够重要的事:
如果同一个八字换一个模型、换一种提问方式,主要用神就可能改变,那么这个结论暂时还不适合不经核对,直接拿来决定名字用字。
原因分析
为什么会这样?
问题并不完全是 AI “不知道”,有时恰恰是它接触过的说法太多,却没有一套固定、透明的判断顺序。
四柱、天干地支、藏干和表层五行等,是相对明确的命盘事实。但从这些事实走到喜用神,还要继续判断:
- 月令、透干和根气分别应该占多大权重;
- 应该先看日主强弱,还是先处理寒暖燥湿;
- 什么情况下考虑从格、化气或通关;
- 主要用神确定以后,辅助喜神应该怎样排序;
- 五行没有出现,是不是就代表名字一定要补。
不同方法对这些问题的回答并不完全相同。
生成式 AI 可能同时见过扶抑、调候、格局等多种说法。它这一轮采用哪套方法、各项规则怎样加权,往往没有明确写出来。于是即使输入相同,也可能得到不同结果。
还有一个容易被忽略的问题:AI 太会解释了。
哪怕结论不稳定,它也能迅速组织出一段完整、流畅、听起来有理有据的说明。普通用户很容易把“解释得像真的”当成“结论已经被验证”。
美国国家标准与技术研究院的生成式 AI 风险框架也指出,生成式 AI 可能自信地输出错误或前后矛盾的内容,甚至补出貌似合理的逻辑,使人过度相信自动生成的答案。
多找几个模型投票也不能彻底解决问题。
五个模型意见一致,只能证明它们在这个案例上给出了相同答案;如果它们共同使用了同一种简化规则,或者受到相似语料影响,一致也不等于正确。
所以我们这次最大的收获,不是找出了“哪个模型最懂八字”,而是确认了:
提供更完整的事实,可以减少 AI 看错命盘;但要得到稳定的喜用神,还需要一套经过人工复核、能够重复执行的判断规则。
我们的方案
对圆桌起名来说,这次实验清晰地印证了我们的判断:
全程依靠生成式 AI 起名是不现实的。要提供更好的起名体验,必须把起名老师的判断方法、程序算法的稳定性和 AI 的知识与沟通能力有效组合起来,而不是让任何一方单独包办全流程。
这不意味着圆桌起名要放弃 AI。相反,我们把 AI 放在它更擅长的位置上。
AI 的语言理解、知识覆盖和沟通能力,很适合用来:
- 理解家长的起名偏好和家庭期待;
- 把模糊需求整理成清楚的起名方向;
- 扩展不同风格的名字候选;
- 分析名字的读音、字义、字形和整体气质;
- 根据喜欢、不喜欢和避讳要求持续调整;
- 把复杂信息解释得更容易理解。
这些环节需要的是丰富、灵活和耐心,正是 AI 能明显提升起名体验的地方。
但是,对准确性和一致性要求更高的环节,我们采用另一套方式:
第一,出生时间、四柱排盘、藏干和五行特征等基础信息,由程序化规则计算和校验,尽量避免生成式 AI 自由发挥。
第二,喜用神这类需要稳定方法的判断,由人工建立并复核判断标准和案例,再交给自研的确定性算法执行,并通过人工样本、留出案例和实际运行对照持续验证。
第三,AI 继续负责偏好理解、名字生成、解释比较和多轮沟通,但不再把自己生成的喜用神结论当作未经核验的基础事实。
简单来说,就是:
让 AI 负责丰富,让算法负责稳定,让家庭保留最终选择权。
这并不是要把喜用神包装成能够决定孩子未来的科学结论。它仍然属于传统文化中的起名参考。我们要解决的,是在选定的方法和产品口径下,让基础信息更可复现,让判断过程更一致、也更容易追溯。
给你的建议
如果你正在用 AI 给宝宝起名,不需要因为这次实验就完全放弃它。
它仍然很适合帮助你找灵感、整理偏好、比较名字和继续修改。但涉及喜用神时,建议多做几步检查。
先分清排八字和判喜用神
排出四柱,不等于已经正确判断喜用神。前者偏向历法和规则计算,后者还包含方法选择。
不要只看“五行缺什么”
某种五行没有出现,只能说明一个表面统计结果,不能直接推出名字必须补什么。“缺金补金”“缺水补水”如果没有后续判断依据,只是一种简化规则。
不要用多数票代替核验
不同模型答案冲突时,继续增加模型数量未必能解决问题。先看它们的分歧发生在基础事实、日主强弱、判断方法,还是用神喜神的主次。
不要让喜用神压过名字本身
不管最后参考什么五行,一个名字仍然要好读、好写、含义清楚,避免明显谐音和过高的解释成本,也要符合家庭真正喜欢的方向。
所以,回到标题的问题:用 AI 给宝宝起名,靠谱吗?
我们的答案是:
可以用,而且很好用;但至少在喜用神判断上,目前还不能直接信。
AI 可以给你丰富的知识、耐心的沟通和大量思路。但需要稳定结论的地方,还是应该交给能够验证、复现和追溯的方法。
如果你希望使用 AI 的知识和沟通能力,又不想只得到一批缺少比较、无法继续讨论的名字,不妨考虑一下圆桌起名。
圆桌起名是一个结合传统文化与 AI 的全新在线起名平台。它不是让一个通用模型从头说到尾,而是由多个不同专业方向的 AI 起名老师协作:狄思远侧重八字五行,齐文澜侧重诗词音韵,康知夏关注心理感受与日常使用,欧枢元考虑跨文化传播,谷昂星提供自然意象方向,舒卫原核对典籍出处,再由宗老师角色澄清需求、汇总意见并给出取舍建议。
你可以通过聊天说明姓氏、生辰、家庭期待、喜欢的风格和需要避开的字,再根据第一轮名字继续反馈、比较和调整。按照圆桌起名的方案,程序负责基础信息和需要稳定执行的规则,AI 老师负责理解需求、扩展思路和解释差异,最后的选择仍然留给家庭自己。
如果你正准备给宝宝起名,可以先到圆桌起名首页了解这种组合方式是否适合你。
实验数据说明: 本次实验保留了各模型原始输出、结构校验结果、分层统计和复测记录。本文按模型家族称呼测试对象,结论只代表测试当时版本在本次样本和协议下的表现,不代表这些模型今后的所有版本。由于喜用神基准答案尚未完成独立人工复核,所有图表都只用于讨论模型的一致性、稳定性和可复现性,不提供命理准确率结论。

