TNT日报

访问手机版在线投稿

当前位置:主页 > 国际

AI模型百家争鸣 「模型评估」成企业新课题

来源: 未知 时间:2026-08-15 16:01 作者:丁浚航 浏览: ->手机浏览此文章

AI模型进入百家争鸣时代,旧金山湾区企业如今更加重视「模型评估」。业者和学者受访表示,企业面对更多AI模型选择,如何找出最符合需求的模型,正成为AI导入的重要环节,相关评估能力也比以往更加重要。

「模型评估」泛指透过一系列测试与指标,衡量AI模型的能力、准确性、可靠性,以及是否符合特定应用需求。

美国许多企业如今面临模型选择难题,一方面要衡量AI成本,一方面又得在令人眼花撩乱的众多AI模型中做出选择。从医疗科技到企业软体公司,都已出现将模型评估列入主要工作内容的职缺。

1名熟悉模型评估的业者向记者表示,不仅美国,包括台湾都需要相关单位和人才。

圣荷西州立大学(San Jose State University)工程系教授巴纳法(Ahmed Banafa)接受中央社访问表示,随著各家AI模型之间的效能差距持续缩小,严谨的模型评估将成为企业采用与部署AI时「非常关键的一环」。

巴纳法说,企业的焦点也正在从单纯比较哪一款模型排名最高,逐渐转向「哪一款模型最适合企业使用情境,同时又能符合成本、安全性与营运需求」。

他认为,企业和组织未来在评估AI模型时,将采用更广泛的标准,包括推理能力、软体开发表现、事实准确度、产生幻觉的频率、回应速度、营运成本、安全性、多语言支援、工具整合能力,以及针对特定产业的实际效果。

AI资料科学家玛哈玛提(Nina Marhamati)告诉中央社,目前模型评估仍需要人工确认,专业领域的评估成本也可能相当高。

她进一步阐述,一般对话内容的评估未必需要高度专业知识,但若AI模型要应用于特定领域,例如医疗、化学,就需要具备相关专业知识的「领域专家」(domain experts)参与。

玛哈玛提表示,专业人才通常工作繁忙、相关人力不易取得,使模型评估往往耗时,成本也较高。这也凸显在AI模型选择日益多元情况下,模型评估的重要性更加受到重视。

本文转自:TNT时报

广告↓

本月排行