什么是“开放”的人工智能模型?企业用哪种模型好?
在公司争相采用基于LLM的强大生成性人工智能工具后,他们开始意识到,更小、更专注的开放模型可能更适合这一要求。
2022年底,随着OpenAI的ChatGPT的到来,科技行业面临着某种清算,这是一个简单的聊天机器人,似乎可以神奇地回答问题。OpenAI的早期前沿大型语言模型(LLM)以及Anthropic和谷歌等竞争对手可以使用自然语言推理、解决问题并回答向他们提出的详细查询。但没有人确切知道LLM黑匣子中支撑这些服务的是什么。很快,Meta的Llama和Mistral等人工智能模型出现了,打破了专有的人工智能垄断。这些类型的模型可以自由下载和修改,以适应特定的应用程序。
2024年末,中国公司DeepSeek发布了V3,据报道,这是一种开放式模型,其训练成本仅为美国前沿实验室的一小部分。推理模型R1于2025年1月问世,被视为对前沿模型的合法威胁。在过去的一年里,阿里巴巴的Qwen和Kimi等开放模型在推理、代理和物理人工智能方面也在企业中越来越受欢迎。
结果是一个明显的趋势:每一代开源模型都需要一半的时间才能赶上那个时代的第一个闭源模型。”。开放模型变体解释了许多版本的“开放”人工智能模型现在都在流传,包括“开放权重”模型和“开源”模型。虽然它们听起来很相似,但了解它们的不同之处很重要。企业中最常见的“开放”模型是开放权重模型。这些让公司可以根据自己的内部需求定制人工智能服务和工具。企业领导者和IT决策者可以查看模型内部,对其进行审计,并将其调整为自己的特定数据。开放权重是通过数学技术处理以产生输出的参数。企业可以通过微调权重、添加内部数据并在内部部署来定制模型。开放式权重模型有助于提供这种保证,允许组织控制自己的数据,评估和调整模型以满足自己的需求,并将其部署到业务需求所需的任何地方。”。但是,主要区别在于,开放权重模型隐藏了代码和训练数据等信息,因此某些部分无法修改。根据开放源代码倡议组织(OSI)的说法,一个真正的开源模型也会发布它所训练的数据,以及其他允许研究、检查、使用、修改和自由分发这些模型的信息。企业对开放模型的使用可以肯定的是,ChatGPT、谷歌的Gemini和Anthropic的Claude等公司提供了全面的人工智能功能;他们短期内哪儿也不去。但这些服务价格昂贵,对于特定的企业用途来说可能过于昂贵。许多企业可以通过专注于其特定需求的小型语言模型(SLM)或LLM得到更好的服务。
