摘要由 AI 生成
研究人员评估了来自美国、波兰和中国的三款开源大语言模型(Gemma3-12B、Bielik-11B-v3、Qwen3-4B),发现 Qwen3-4B 在其本国中国人口上的表现最差,归因度最高。针对五个最坏情况人群进行目标 LoRA 微调(需少于 1,200 对训练数据,单卡 GPU 耗时不足 15 分钟),使 Bielik-11B 的偏差减少 16.8%(p_Bonf = 0.002)。然而,按国家分解显示微调仅重新分配而非消除偏差:Bielik 的最坏情况人群从美国老年群体完全切换至中国老年群体,前后修正集无重叠。这是已知首个针对最坏人口特征进行 LoRA 微调以缓解跨文化偏差的研究。
关键实体KEY ENTITIES
Bielik-11B-v3Gemma3-12BQwen3-4B
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
关键词热度
- Gemma3-12B1
- Bielik-11B-v31
- Qwen3-4B1
全部报道(1)SOURCES
↗
研究人员评估了来自美国、波兰和中国的三款开源大语言模型(Gemma3-12B、Bielik-11B-v3、Qwen3-4B),发现 Qwen3-4B 在其本国中国人口上的表现最差,归因度最高。针对五个最坏情况人群进行目标 LoRA 微调(需少于 1,200 对训练数据,单卡 GPU 耗时不足 15 分钟),使 Bielik-11B 的偏差减少 16.8%(p_Bonf = 0.002)。然而,按国家分解显示微调仅重新分配而非消除偏差:Bielik 的最坏情况人群从美国老年群体完全切换至中国老年群体,前后修正集无重叠。这是已知首个针对最坏人口特征进行 LoRA 微调以缓解跨文化偏差的研究。