首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

ACL + ICML 上新 | 下一代AI如何理解不同文化、尊重不同价值观?

摘要

(本文阅读时间:15分钟) 编者按: 欢迎阅读 “ 科研上新 ” 栏目。这里汇聚了微软亚洲研究院最新的创新成果与科研动态,助你快速捕捉前沿技术脉搏,保持对 AI 领域发展的敏锐嗅觉。近期,人工智能与自然语言处理领域的两大全球顶会 ICML 和 ACL 即将陆续召开,微软亚洲研究院有多项研究成果入选。

CAReDiO 性与差异 科研上新 多元文化 值观对齐
2026-07-05 1 阅读 约10分钟阅读 微软研究院AI
分享:
字号:
(本文阅读时间:15分钟) 编者按: 欢迎阅读 “ 科研上新 ” 栏目!这里汇聚了微软亚洲研究院最新的创新成果与科研动态,助你快速捕捉前沿技术脉搏,保持对 AI 领域发展的敏锐嗅觉。 近期,人工智能与自然语言处理领域的两大全球顶会 ICML 和 ACL 即将陆续召开,微软亚洲研究院有多项研究成果入选。本期 “ 科研上新 ” 整合了6 篇代表性论文,聚焦一个日益紧迫的命题:大模型的多元文化感知与价值观对齐。这6 篇论文从评测框架、价值观建模、数据优化、可控对齐算法到上下文对齐方法,系统性地回应了 “ 如何让 AI 真正理解并尊重多元文化 ” 这一重要挑战。 哪篇研究最触动你的思考? 欢迎参与投票选出你最感兴趣的论文! 我们将邀请 论文作者做客直播间 ,与你在线交流技术细节,共探智能技术的人文新边界! 「 本期内容速览 」 01 基于人格提示的大语言模型能否模拟文化子群体价值观偏好? 02 CAReDiO :基于代表性与差异性的大语言模型文化对齐数据优化方法 03 DisAlign : 解耦共识与价值表征,实现大模型可控多元价值观对齐 04 基于价值观编码表的大模型文化价值观对齐分布式开放评测 05 MMA-ASIA :面向原生文化感知的多语言多模态文化对齐评测框架 06 PICACO :基于总相 关性优化的多元上下文价值观对齐 01 基于人格提示的大语言模型能否模拟文化子群体价值观偏好? 论文链接: https://arxiv.org/abs/2604.12851 现有大语言模型价值观对齐多采用单一、以西方视角为主的统一价值观标准,忽视了多元社会内部不同文化子群体的差异、甚至冲突的观念,易造成模型对部分群体输出不适配、带有偏见的内容。为解决这一问题,研究员们以多元种族宗教并存的新加坡为研究场景,依托世界价值观调查第七批数据 (World Value Survey) ,构建了包含 2 万余样本的子群体价值观数据集,提出模态多样性得分( MDS )用于量化群体间的价值共识与冲突程度,并设计了面向未见过的交叉人口组合的泛化评估框架。 图 1 :实验框架概述。 (A) 先利用模态多样性评分构建社会价值观景观图。( B–C )基于结构化偏好对模型进行微调,以验证: i )对未见过的交叉属性特征(如年龄 × 宗教)的组合泛化能力; ii )向开放式生成任务的迁移性能。 (D) 虽然 SFT 在分布外( OOD )子群体上实现了显著的准确率提升,但 (E) 分析显示其性能仍明显偏向主流人口群体。 实验显示,未微调基线中, GPT-4.1 等主流大模型对子群体模态偏好的预测准确率仅 57.4% ;在结构化数据上做简单监督微调后,分布外子群体的预测准确率平均提升 17.4% ,归一化平均绝对误差降低 0.096 ,部分对齐能力可迁移至开放式生成任务。然而,模型存在显著的预训练偏差,对年轻、男性、华裔、基督教背景的价值观模拟效果更好;微调虽然提升了整体预测准确率,但会拉大各子群体在距离感知指标( NMAE )上的性能差距,暴露出平均指标掩盖公平性的风险。 这一结果表明,基于结构化数据的轻量微调可实现细粒度的子群体价值观对齐,但需将公平性纳入核心考量,避免放大社会固有偏见,为构建文化敏感、群体公平的智能系统提供了实证依据。 02 CAReDiO:基于代表性与差异性的大语言模型文化对齐数据优化方法 论文链接: https://arxiv.org/abs/2504.08820 大语言模型跨文化部署时,普遍存在以西方视角为主的固有文化偏差,而专用于文化对齐的训练数据存在两大短板:要么难以抓取本土群体共识、文化代表性不足,要么无法区分不同文化间独有特质、差异性不足,对齐效果受限。 为此,研究员们提出了 CAReDiO 数据优化框架,基于文化共识理论设计了信息增益目标以筛选具有文化代表性的问答案例,根据认知冲突理论设计了文化散度目标以增强样本在目标文化上的独特性,并采用基于上下文学习的迭代方案交替优化问题、回答,自动生成兼具代表性与差异性的文化数据集 CARDSet ,数据集覆盖全球 15 种文化。 图 2 : CAReDiO 框架包含两个基于信息论的目标模块(分别用于提升代表性与独特性),以及一个迭代方案以交替优化问题与回答。 多模型微调与多基准测评表明, CAReDiO 产出的数据承载更丰富、更有代表性的本土文化信息,跨文化聚类区分效果更强;仅 200 条训练样本即可完成高效文化对齐,在选择题与开放式生成任务中均稳定优于已有的文化对齐数据集。针对中日韩这类文化相近区域,该框架能有效拉开群体价值观的边界、降低模型文化混淆。母语人工评测结果也证实,基于 CARDSet 微调的模型输出更贴合本地人群真实的价值观念。 CAReDiO 为低成本、细粒度的多元文化大模型对齐提供了可扩展的标准化数据构建方案。 03 DisAlign :解耦共识与价值表征,实现大模型可控多元价值观对齐 论文链接: https://openreview.net/pdf?id=0xiTAhvLj6 在传统大语言模型多元化价值观对齐时,常因价值维度天然耦合,导致在调整某一项价值观偏好的同时连带干扰其余价值目标与基础能力,难以实现精细可控的多元价值观对齐。而现有模型融合方法大多未考虑这种内在纠缠,导致精细化价值对齐失败。 针对这一问题,研究员们提出了 DisAlign 多元化价值观对齐框架,从信息几何的角度将多种价值观表征拆解为共识与独特性两部分:先通过乘积式专家模型构建共识点,再对专家残差表征做广义特征值谱分解,提取低秩的价值观共识子空间和独特价值观子空间,实现多价值观的独立调控。该方法无需重复训练,仅通过参数线性组合即可适配任意用户指定的价值观权重组合。 图 3 : (A) 单轮对话中存在多个值表达式。 (B) 由于数据混合,会出现参数耦合现象。 (C) DisAlign 框架求解共识子空间与唯一值子空间的示意图。 在道德基础、日常困境、价值棱镜三类数据集上的实验显示, DisAlign 在多维度、随机维度、全维度价值观对齐任务中准确率均超现有最优基线。针对关怀、忠诚等对立冲突价值观可平滑切换调控。 消融实验证实,共识子空间主要保留模型通用能力与共识价值部分,价值观独特子空间则精准承载不同价值的差异性偏好。二者结合后,可实现模型数学、代码等基础能力基本无损耗的多元化对齐。该方法为大模型在安全合规前提下适配多元用户价值观偏好提供了可解释、可控制的技术路径。 04 基于价值观编码表的大模型文化价值观对齐分布式开放评测 论文链接: https://arxiv.org/abs/2604.06210 伴随着大语言模型的全球部署,文化价值观对齐是模型安全与用户体验的核心保障,但现有评测体系普遍存在“效度 - 构成 - 语境 ” 三重挑战:依赖选择题的评测范式仅能检验表层文化知识,无法还原模型真实的价值观倾向,易受问卷选项、社会期望偏差干扰;依靠平均分的分数聚合方式则忽略同一文化内部不同子群体的价值观异构性;评测场景以封闭式问答为主,与真实开放式生成场景脱节。 对此,研究员们提出了基于价值观编码表的分布式开放评测框架 DOVE 。该框架从美、中、日、韩四国收集了 1
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱