AI大众化:Meta对开源模型的愿景
来源:DIGITIMES科技网发布时间:2023-10-052477浏览
询问 AI生成式人工智能(Generative AI)开源模型的数量,目前正以极快的速度成长当中。而若提到对这个领域的发展最具热忱的业者,Meta当可数其中之一。Meta相信,开源的做法不仅可以促进创新,反过来为己所用,也能提升技术的安全性,并令AI工具的使用更加大众化,可谓一举数得。
为了摆脱被单单视为一家社群媒体公司的形象,以及表明投入打造元宇宙(Metaverse)的决心,Facebook先前已正式更名为Meta。不过,从最近几季的法说会谈话来看,明显AI被提到的次数,大大超出了「Metaverse」这个词,可见AI已经成为Meta追求发展的核心领域。
2022年,Meta资本支出达到约320亿美元,相较2021年有明显增加,主要是来自于对AI生产力的投入。虽然资本支出在进入2023年以后大幅减少,Meta财务长Susan Li在2023年第2季法说会上,也将2023全年资本支出预期,由300亿~330亿美元下修至270亿~300亿美元,不过强调下修的主要原因,在于追求降低成本,特别是非AI应用服务器的部分,以及计划推迟与设备延迟交货等问题,并非是整体投资计划遭到削减。同时,也看好2024年资本支出将见成长,动力来自于Meta主要为满足AI需求,而对数据中心与服务器所进行的投资。
开源与闭源 业界看法不一
Meta表示,观诸公司发展历史,Meta一直是开源的大力支持者。目前对于AI开源与闭源孰优孰劣的问题,业界看法仍莫衷一是。例如,采取专有(proprietary)软件途径的OpenAI,就常被批评透明性不足,包括其目前最先进的GPT-4模型,诸如训练材料来源、原始码、神经网络权重、架构等细节,至今都不为外界所知。
AI新创Hugging Face研究人员曾指出信息不透明的弊端:任何针对闭源模型所做的研究结果,都无法被重现并验证。另一家知名业者Stability AI也认为,开源是正确的方向,「将模型开源是为促进透明化以及培养信任感。研究人员可以借此深入进行效能验证、研究AI可解释性(interpretability)技术、识别潜在风险与协助防御机制的开发」。
但是另一方面,亦有不少人担心,开源可能导致技术遭到有心人士滥用,甚至有AI专家将Meta的开源做法,比做交出核武的制造秘密。部分专家批评,开源模型有被用于不道德行为上的高度风险,例如撰写网络钓鱼邮件或是协助恶意软件攻击等。
Meta全球事务总裁Nick Clegg曾在接受日经亚洲(Nikkei Asia)专访时,谈到他对于开源的看法。「打造这些新型生成式AI大型语言模型(LLM)所需要的电脑容量与数据量,是如此庞大,以至于全球仅有少数企业有能力办到。然而,我们不认为,让这些技术掌握在少数几家大企业手中,是理想或可行的做法」。
Clegg表示,过去10年以来,Meta都有在参与AI的开源研究,也将许多研究结果公布给外界知晓,「开放的创新能够催生出更好的新点子,我们可以将其整合进产品当中,这对我们有好处」,也因此能够有更多的工程师参与测试,可协助提升AI的安全性。
Clegg强调,人们对于发展快速的新兴科技抱有疑虑是可以理解的,「问题在于,如何尽可能负责任且安全地进行开源」。他曾在英国广播公司(BBC)节目中警告,对AI危险性的炒作,跑得比技术本身的发展还要快,「我认为许多的生存性威胁警告,牵涉到的是现今仍不存在的模型,即所谓超智能、超级强大的AI模型——也就是AI会自己发展出自主性与能动性,能够独立思考并自行复制的预测」。然而,我们目前开源的模型仍远远不及这种程度。事实上,从许多方面来看,这些想法相当愚蠢」。
开源模型的蓬勃发展,已令AI领域的竞争对手无法忽视。据美国月刊杂志连线(Wired)报导,先前曾有一份匿名备忘录在网络上流传,明显是出自Google研究人员的手笔。当中警告,虽然Google高层对于OpenAI文字生成技术,对Google所带来的竞争威胁争吵不休,但却疏于注意,开源软件「正在无声侵吞我们的午餐」。
多种开源模型任君选择
Meta对开源的热忱并非光说不练,光是近期内就持续推出功能多种多样的开源AI模型。例如,2023年7月发表开源自我回归语言模型Llama 2,采用优化过的变换器(transformer)架构,可作为诸如聊天机器人等聊天界面的开发基础。与第一代Llama仅授权研究用途不同,Llama 2免费提供外界商用,同时比起第一代,投入训练的数据规模更加庞大,模型参数更多,表现也更加出色,被认为有可能撼动整个大型语言模型的版图,并巩固Meta在开源AI领域的主导地位。
甚至有论者将Meta发表Llama 2的决定,比做Google在2007年为挑战苹果(Apple)iOS而推出Android开源手机操作系统的事迹。而即便是OpenAI的着名支持者微软(Microsoft),也决定提供Llama 2的下载,供开发人员在云端或Windows操作系统上使用。
MetaCEOMark Zuckerberg在Llama 2发表时的声明中指出,Meta投入开源已经有很长一段时间,做出很多显着的贡献,「相信如果生态系更加开放,就会带来更多的进步。这也是为何Meta选择让Llama 2开源」。
Wired评论,透过提供成本更低的选项,Meta Llama 2帮助小型公司或是独立程序设计师,可更方便地开发新产品与服务,很可能令如今的AI热潮更上一层楼。一名Hugging Face研究人员也指出,虽然目前专有模型仍具有优势,但相信往后时代的Llama就会赶上,而且要不了多久,就可以执行目前OpenAI ChatGPT常见的大部分功能。
此外,根据华尔街日报(WSJ)最新引述消息人士说法指出,Meta还在开发一款强大的AI大型语言模型,预计2024年初开始训练,被期望能够比Llama 2强上数倍,并比肩OpenAI目前最先进的GPT-4模型。这款模型预期将开源提供给其他企业,用作诸如文本、分析或其他内容生成服务或产品的开发基础。
Meta名为SeamlessM4T的AI多语言与多工基础模型,功能包括自动语音识别,以及语音到语音、文字到文字、或是语音与文字之间来回的翻译,适用于近百种语言。但在翻译功能中,若输出的是语音形式,则仅支持35种语言(包括英语)的语音。这款开源模型被提供给公众进行非商业性质的使用,有望成为未来大规模通用型翻译系统发展的基础。
特别的是,若输入语句中夹杂多种语言,SeamlessM4T也可以辨认出来,并全部翻译成同一种目标语言。这等于是将先前个别模型拥有的单一文字或语音翻译功能,结合在单一系统中,对于AI技术在语言应用领域的发展,是相当重要的一步。Zuckerberg先前也曾设想,要利用这类型工具,让来自世界各地的使用者,能够在元宇宙中无碍交流。
针对程序设计应用,Meta则推出名为Code Llama的一系列开源生成式AI模型,顾名思义是建立在Llama 2语言模型的基础之上。Code Llama的功能,包括可以按照使用者所输入的指令来撰写程序码,还能使用于程序码自动完成或是除错,以及建立开发人员笔记或是程序说明书等。
Code Llama支持许多被广泛使用的程序语言,以协助各种领域的软件工程师增进工作效率,例如研究、产业、开源计划、非营利组织、商业等应用,有望成为由OpenAI修改过的GPT-3模型所驱动的Codex、由Codex所驱动的微软GitHub Copilot、或是Stack Overflow的OverflowAI等程序设计产品的有力竞争对手。
开源以求减少模型偏见
随着生成式AI在文字转文字、文字转图像等应用领域不断发展,电脑科学家们也持续利用机器学习技术,探索其他可能的媒体应用形式。Meta由3款AI模型组成的AudioCraft工具组,就能够按照使用者输入的文字叙述,自动生成音乐或效果音等声音作品。
AudioCraft作为开源AI工具组,可供商业与学术研究使用。Meta承认,用于训练AudioCraft模型的数据集多元性不足,特别是其所使用的音乐数据集当中,仅包含那些配有由英文写成的文字内容或后设数据的音档,而且有一大部分,都是西方风格的音乐。而透过将AudioCraft的程序码公开分享,「我们希望其他的研究人员,可以更轻易地针对新方法进行测试,以求防止或削减生成式模型当中可能存在的偏见,或对模型的滥用情况」。
责任编辑:王桢莹
新闻来源:DIGITIMES科技网,文中所述为作者独立观点,不代表icspec立场。更多精彩资讯请下载icspec App。如对本稿件有异议,请联系微信客服specltkj。




