不同模型会给出不同的五行喜用分析
同一命盘交给不同模型,可能在日主强弱、采用方法、用神和喜神组合上出现分歧。本研究测量的是模型间一致性,不把任何模型多数意见视为命理科学真值。
7 个模型,加上圆桌起名系统的同口径补充测试,看看五行判断、连续推荐和跨姓复用究竟有多大差别。
同一命盘交给不同模型,可能在日主强弱、采用方法、用神和喜神组合上出现分歧。本研究测量的是模型间一致性,不把任何模型多数意见视为命理科学真值。
在固定条件下,Qwen、DeepSeek、GLM 平均约 9 轮达到单轮 80% 精确重复;Gemini、GPT、Mistral通常更晚。Grok 在 30 轮实验窗口内未达到阈值,但输出逐渐转向偏旁和生僻字组合扩张。
七个受测模型都出现跨姓氏复用,但程度差异明显。姓氏会影响部分推荐,却没有让每个姓氏形成彼此独立的名字集合。
通过测试发现,通用大模型在五行判断稳定性、连续推荐多样性和避免实验内高频模板名方面差异明显。圆桌起名加入同指标比较后,固定规则引擎的五行结果保持一致,连续 10 轮未进入高度重复,跨姓名字集合平均重合度为 5.67%。它在这三项测试中表现较稳定,但这些指标不直接代表名字审美、出处真实性或最终家庭接受度。
测试方法对相同的 30 组四柱,让 Claude、Codex、Qwen、DeepSeek、Gemini 分别完成前后两轮判断,比较“用神→喜神”主次组合是否完全相同;圆桌起名使用自己的固定规则引擎,对同一批四柱重复计算。大模型两轮采用不同但合理的提示结构,圆桌起名不依赖提示词生成五行结论。
| 模型或系统 | 30 组中两轮答案相同 | 答案保持一致的比例 |
|---|---|---|
| 圆桌起名 | 30 / 30 | 100% |
| Claude | 16 / 30 | 53.3% |
| Codex | 14 / 30 | 46.7% |
| Qwen | 7 / 30 | 23.3% |
| DeepSeek | 5 / 30 | 16.7% |
| Gemini | 4 / 30 | 13.3% |
测试结论五个通用大模型的最高稳定率为 53.3%;圆桌起名的固定规则引擎为 100%。这里比较的是相同四柱前后输出是否一致,说明规则引擎不会随提示结构改变结论;一致不等于命理判断已经被证明正确。
测试方法把相同的 30 组四柱同时交给 Claude、Codex、Qwen、DeepSeek、Gemini 独立判断,统计五个模型对“用神→喜神”有多少票完全相同。共得到 150 个有效模型票。
| 五个模型的回答情况 | 30 组出生信息中有几组 | 所占比例 |
|---|---|---|
| 5 个模型答案完全一样 | 1 / 30 | 3.3% |
| 4 个模型答案一样 | 6 / 30 | 20.0% |
| 3 个模型答案一样 | 10 / 30 | 33.3% |
| 没有 3 个模型答案一样 | 13 / 30 | 43.3% |
测试结论五个模型完全一致的概率只有 3.3%。拿着同样的出生日期,不同模型大概率会给出不同的五行喜用结果,作为起名依据的价值相当有限。
测试方法固定女孩、用神水、喜神金和双字名,让 7 个模型与圆桌起名分别针对 8 个姓氏连续起名。单模型每轮要求 10 个新名字;圆桌起名每轮由 6 位老师各给 3 名,共 18 名。统一判断本轮是否至少 80% 的完整姓名在此前轮次已经出现。
| 模型或系统 | 获取名字数 | 平均何时出现高度重复 | 8 个姓氏的测试结果 |
|---|---|---|---|
| 圆桌起名 | 1,440 | 测试到第 10 轮 | 8 个姓氏均未出现 |
| Qwen | 720 | 约第 9 轮 | 8 个姓氏全部出现 |
| DeepSeek | 680 | 约第 9 轮 | 8 个姓氏全部出现 |
| Gemini | 1,440 | 约第 18 轮 | 8 个姓氏全部出现 |
| GPT | 1,700 | 约第 21 轮 | 8 个姓氏全部出现 |
| Grok | 2,400 | 测试到第 30 轮 | 8 个姓氏均未出现 |
| GLM | 730 | 约第 9 轮 | 8 个姓氏全部出现 |
| Mistral | 1,860 | 约第 23 轮 | 7 个姓氏出现,1 个未出现 |
测试结论Qwen、DeepSeek 和 GLM 平均到第 9 轮左右进入高度重复;Gemini、GPT 和 Mistral 更晚,Grok 在 30 轮内未达到阈值。圆桌起名测试到第 10 轮,8 个姓氏均未出现单轮 80% 历史重复,并得到 1440 个不重复的同姓完整姓名。
测试方法保持系统、性别、用神、喜神和名字字数不变,只替换林、王、李、陈、江、阮、靳、欧阳 8 个姓氏,再计算任意两个姓氏去姓后名字集合的 Jaccard 相似度,并取 28 组姓氏配对的平均值。
| 模型或系统 | 任意两个姓氏的名字平均重合程度 |
|---|---|
| Qwen | 23.42% |
| GPT | 18.26% |
| Gemini | 14.03% |
| Grok | 10.15% |
| GLM | 7.89% |
| DeepSeek | 6.81% |
| 圆桌起名 | 5.67% |
| Mistral | 5.36% |
测试结论只改变姓氏、不改变其他需求,所有受测系统都会出现一定程度的名字复用。圆桌起名的平均重合度为 5.67%,接近本次单模型结果最低的 Mistral(5.36%),明显低于 Qwen(23.42%)、GPT(18.26%)和 Gemini(14.03%)。这衡量的是实验内跨姓名字集合重合,不是现实人口重名率。
测试方法固定女性名,使用 Qwen、GPT、Grok,分别对林、欧阳测试 7 组喜用条件。每个模型×姓氏×条件固定 10 轮、每轮 10 名,共 42 个实验单元、4,200 次推荐。
| 模型 | 姓氏 | 不同喜用条件下,完整名字的平均重合程度 | 名字用字的平均重合程度 |
|---|---|---|---|
| Qwen | 林 | 0.39% | 13.24% |
| Qwen | 欧阳 | 0.67% | 11.28% |
| GPT | 林 | 0.21% | 15.41% |
| GPT | 欧阳 | 0.20% | 16.61% |
| Grok | 林 | 0.34% | 13.95% |
| Grok | 欧阳 | 0.12% | 13.77% |
测试结论改变喜用条件后,模型通常会换一批完整名字。但其实本质并未改变,相同五行下,它们仍会反复使用汐、涵、清、昕、晴、钰、瑶等固定类型的字。表面上名字变了,实际往往只是从对应五行的常用字池中重新排列组合。所以,用户仍不可认为大模型对五行的支持很好。
测试方法从 7 模型×8 姓氏的饱和轨迹中分层抽取 300 个全名,检查规范汉字层级;再由 DeepSeek、Qwen、Gemini 在盲化条件下独立评分,共得到 900 条辅助评价。
| 名字中最生僻字的级别 | 名字数 | 平均可读性 / 5 | 平均接受度 / 5 | 至少 2 位评审愿意列入候选 |
|---|---|---|---|---|
| 仅一级字 | 93 | 4.57 | 3.92 | 67.7% |
| 含二级字 | 171 | 3.81 | 3.25 | 42.7% |
| 含三级字 | 32 | 2.74 | 2.45 | 9.4% |
| 含字表外字 | 4 | 2.08 | 1.75 | 0.0% |
测试结论模型为了避免重复,可能逐渐使用更生僻的字,但名字也会随之变得更难读、更不自然。含三级字的名字只有 9.4% 获得多数候选票,含字表外字的样本为 0%;一味追求“独特”并不等于名字更好。
测试方法从首版 512 个推荐中按来源类型分层抽取 60 条,使用公开原典或可靠全文页面逐项核对原句、作者、篇章和名字是否连续出现。
| 核验结果 | 条数 | 占 60 条样本 |
|---|---|---|
| 直接出处成立 | 18 | 30.0% |
| 同句拆字组合 | 10 | 16.7% |
| 仅联想或部分匹配 | 8 | 13.3% |
| 归属或引文错误 | 5 | 8.3% |
| 疑似拼接或生成 | 9 | 15.0% |
| 公开证据不足 | 1 | 1.7% |
| 无来源主张 | 9 | 15.0% |
测试结论AI 给出的诗词出处不能直接相信:有些只是从同一句中拆字组合,有些只存在局部联想,还有一些出现篇章归属错误或疑似拼接。使用这类名字前,仍然需要回到原典逐字核验。
公开数据集包含清洗后的研究表、字段字典、分析代码、质量审计和组件级权利声明。
从实验总览、重复与出处,到提示词、候选筛选和使用场景,继续阅读全文。

同一组出生信息,换个模型甚至换种问法,五行喜用就可能改变。真正值得比较的不是谁说得更肯定,而是谁能把判断思路讲清楚。
阅读全文
名字明明不同,却总像从同一片水光、晨色和花木里走来。问题不只是用了哪些字,而是 AI 是否真的换了理解诗意的角度。
阅读全文
当不同家庭向 AI 提出相似要求,得到的可能不只是相似风格,甚至是同一批名字。网红名效应不是偶然撞名,而是共同选择被模型进一步放大。
阅读全文
名字还在不断刷新,真正的新选择却可能早已停止增加。9,530 个名字揭示不同模型会在什么时候开始重复,又会怎样制造“仍在创新”的错觉。
阅读全文
完整名字换了,不代表起名思路真的变了。把名字拆成单字以后,AI 对水光、晨色和玉石意象的依赖会变得非常明显。
阅读全文
AI 写得越完整,出处越容易让人信以为真。但名字、原句、篇章和作者之间,任何一环都可能对不上。60 条核验告诉你该查什么。
阅读全文
AI 很适合整理需求和打开方向,却不该顺势接管五行、去重、出处与最终取舍。关键不是拒绝 AI,而是知道什么时候该把判断收回来。
阅读全文
AI 起名不是速度比赛。七项测试把五行、重复、跨姓复用、出处和可用性逐一拆开,看看它究竟在哪些地方还守不住最后一关。
阅读全文