点击右上角微信好友

朋友圈

请使用浏览器分享功能进行分享

正在阅读:国内多数模型训练使用中文数据占比超60%
首页> 数字化频道> 要闻 > 正文

国内多数模型训练使用中文数据占比超60%

来源:人民日报2025-08-21 18:59

  人民日报北京8月18日电(记者 王云杉)记者从国家数据局获悉:中文数据在国内大模型的训练性能提升方面发挥着重要作用。国内多数模型训练使用的中文数据占比已经超过60%,有的模型达到80%。中文高质量数据的开发和供给能力持续增强,推动我国人工智能模型性能快速提升。

  在人工智能时代,Token(通常所说的词元)是处理文本的最小数据单元。国家数据局局长刘烈宏介绍,2024年初,我国日均Token的消耗量为1000亿,截至今年6月底,日均Token消耗量已经突破30万亿,1年半时间增长了300多倍,反映了我国人工智能应用规模的快速增长。

[ 责编:孔繁鑫 ]
阅读剩余全文(

相关阅读

您此时的心情

光明云投
新闻表情排行 /
  • 开心
     
    0
  • 难过
     
    0
  • 点赞
     
    0
  • 飘过
     
    0

视觉焦点

  • 中外青少年在沪比拼机器人技能

  • “百万英才汇南粤”

独家策划

推荐阅读
河南省商丘市永城芒山镇杏树基地,满山遍野杏花盛放,吸引众多游客赏花游玩
2026-03-15 17:21
广西桂林市阳朔县遇龙河沿岸步道,众多大学生在徒步行进,欣赏山水美景、品味油菜花季
2026-03-15 17:18
贵州省黔东南苗族侗族自治州锦屏县敦寨镇亮司大坝,阡陌农田上油菜花竞相绽放,与村庄、河流、山峰、道路等构成一幅美丽的春日画卷,浪漫的花海把大地编织成动人的织锦
2026-03-15 16:54
福建省福州市连江县官坞村海域养殖区一派繁忙。渔民们驾驶渔船穿梭于碧波之上,精心管护紫菜、牡蛎、鲍鱼,勾勒出一幅"海上春耕"的生动图景
2026-03-15 16:53
有着"挂在瀑布上的古镇"美誉的湖南湘西永顺芙蓉镇,众多游客汇聚在标志性的瀑布景观前,定格山水春光,乐享自然与人文交融的独特魅力
2026-03-15 16:52