GLM 4.5V 是一个应用于公开人工智能Large language model排行榜上模型家族的名称。截至2025年10月,该模型背后的开发者尚未发布官方公告、技术论文或公开文档。该模型仅通过三个匿名出现在第三方基准测试快照中的变体为人所知,因此其来源和架构在很大程度上无法从主要来源验证。
该名称暗示了GLM(通用语言模型)系列的延续,该系列最初由智谱AI开发,这是一家中国Artificial intelligence公司。然而,没有官方声明将GLM 4.5V与智谱现有的GLM系列联系起来,且“V”后缀在以往的版本中并不典型,以往使用如GLM-4和GLM-4-Plus等名称。在开发者公开承认该模型之前,将其归因于智谱仅是基于命名惯例的推断,而非已确认的事实。
观察到的三个变体在参数数量和性能上有所不同,但其确切规格未官方披露。社区对排行榜条目的分析表明,最小的变体约有70亿参数,中等变体约有320亿参数,而较大的变体接近2000亿参数。这些数量基于在如NVIDIA GPU等硬件上的推理速度相关性推导而来,并未得到模型创建者的确认。
该模型在标准Machine learning基准测试中的表现引人注目但参差不齐。在MMLU(大规模多任务语言理解)基准测试中,该测试考察通用知识和问题解决能力,最小变体据报道得分约为74.2,中等变体约为81.5,最大变体约为87.9。在MATH-500(一个具有挑战性的数学数据集)上,相应数字分别约为61.8、74.3和83.6。这些数字提取自排行榜快照,如果分数被更新或修正可能会发生变化。
排行榜存在情况
GLM 4.5V的三个变体出现在两个广泛使用的公共排行榜上:Artificial Analysis智能指数和LMSYS Chatbot Arena。在Artificial Analysis上,这些变体以匿名标识符而非GLM 4.5V名称列出,这导致开源社区出现混淆。2025年9月,一个变体短暂在Arena的Elo评级中跻身前十名,但后来无解释地被移除可见性。没有基准测试机构独立验证该模型的Model Pruning或Multi-Head Attention配置。
猜测和社区反应
由于该模型未发布,关于其底层技术的猜测在论坛和社交媒体上大量涌现。一些研究人员指出,其基准测试表现让人联想到采用先进Transformer (architecture)架构训练的模型,可能包含Mixture of experts层。其他人则指出其出现的时间,,恰逢来自美国和中国的实验室发布多个开放权重模型,,这可能是来自现有供应商的重命名或品牌重塑模型。截至2025年11月,没有可靠证据支持任何特定来源。
缺乏官方发布已导致实际后果。希望使用GLM 4.5V的开发者无法下载权重、访问应用程序编程接口(API)或获取许可证,因为不存在任何公共资源。这引发了关于向公共基准测试提交匿名模型伦理的讨论,有些人呼吁强制披露模型来源。这一事件也引发了对排行榜作为evaluating ai models工具可靠性的质疑,因为条目可能被伪造或错误归属。
未经验证的能力
关于GLM 4.5V多模态能力(如处理图像或音频)的说法完全未经证实。该模型在任何公开测试中均未展示Vision-language model性能。同样,没有证据表明其接受了基于人类反馈的强化学习(RLHF)或Constitutional AI训练。对其行为的全部评估仅限于排行榜快照中的基于文本的多项选择和生成任务。唯一可测量的特征是其参数估计、速度和标准化测试中的原始分数。
结论
GLM 4.5V在Generative AI领域仍然是一个谜。其三个变体因突出的基准测试结果而获得关注,但缺乏官方发布意味着该模型无法被复制、审计或在生产系统中合法使用。在开发者站出来之前,GLM 4.5V条目应被视为未经验证的第三方数据,任何关于该模型架构或训练过程的技术说法均属推测。这一案例凸显了匿名模型提交的更广泛趋势及其对Machine learning评估公共信任的影响。