Kakao开源轻量视觉语言模型,下载量登顶韩国榜首
来源:李智衍发布时间:2026-07-13269浏览
询问 AI据韩国媒体ET News报道,全球知名AI开源社区平台Hugging Face的统计数据显示,韩国互联网巨头Kakao推出的视觉语言模型(VLM)“Kanana-1.5-v-3b-instruct”在近一个月内的下载量达到约38.45万次。该数据不仅创下韩国同类模型的最高纪录,还大幅超越了竞争对手Naver旗下的“HyperCLOVA X-SEED-Vision-Instruct-3B”(约13.75万次)。此外,与乐金AI研究院的“Exaone-4.5-33B”(约24.74万次)以及Naver的另一款模型“HyperCLOVA X-SEED-Think-32B”(约13.73万次)相比,该模型的下载表现同样位居前列。
“Kanana-1.5-v-3b-instruct”属于轻量级视觉语言模型,具备同时处理图像与文本输入并生成自然语言回复的能力。该模型于2025年7月正式开源,初期月下载量约为1.52万次。经过一年时间,其单月下载量增长超过20倍。截至2026年7月8日,该模型的累计下载量已达到159万次,其中近一个月的下载量占比约为24%。
在应用层面,这款参数量为3.6B的轻量级模型主要面向图形处理器(GPU)算力受限的初创企业、科研机构及公共部门。目前,该模型已被引入韩国知识产权局的“商标审查业务AI支持服务建设”项目中,用于辅助商标审查工作。
Kakao方面指出,该模型备受认可的主要原因在于其较高的易用性与性能。目前,Kanana模型已正式支持开源推理框架“vLLM”。作为业内领先的开源推理框架,vLLM能够协助AI模型快速、高效地部署至实际服务中,从而减轻开发者在额外配置与部署方面的工作负担。
在性能测试中,尽管其规模较小,但在韩语和英语的处理能力上具备较强竞争力。Kakao内部测试表明,与参数规模相近的“Qwen2.5-VL-3B-instruct”相比,“Kanana-1.5-v-3b-instruct”在韩语图像基准测试以及英韩双语多模态指令理解任务中均取得了更优的成绩。
Kakao相关人士表示,近期的应用成果表明,针对韩语环境优化的开源多模态模型具备实际需求。多模态模型不仅能理解语言,还能掌握用户场景、自主判断并完成复杂任务,是构建完整智能体AI(Agentic AI)的关键要素。
新闻来源:李智衍,文中所述为作者独立观点,不代表icspec立场。更多精彩资讯请下载icspec App。如对本稿件有异议,请联系微信客服specltkj。

