2026年8月14日,澳门数字科技研究院正式发布并开源了大语言模型澳门大小官网。作为一款基于混合专家(MoE)架构的高效模型,澳门大小官网拥有320B总参数与36B激活参数,支持128K上下文窗口。官方披露数据显示,澳门大小官网在MMLU、BBH、GSM8K等公开基准测试中达到或超过同规模闭源模型水平,同时在推理成本方面,相比研究院此前发布的稠密模型降低约45%。更重要的是,澳门大小官网以Apache 2.0许可开源,完整权重、推理代码与部署脚本已经同步上线,开发者可以通过vLLM、SGLang、llama.cpp等常见工具链直接使用。这标志着该团队在保持模型能力的同时,将工程效率与低成本部署摆在了优先级最高的位置。
澳门大小官网发布:产品定位与核心参数
澳门大小官网定位为面向企业服务、数据分析、长文档处理与代码生成场景的通用语言模型。它的发布形式包括FP16全精度权重、INT8/INT4量化版本,以及可在Hugging Face上直接下载的GGUF格式。与当前主流开源模型相比,澳门大小官网最大的特点是强调“低资源可运行”:在单张NVIDIA A100(40GB)上即可完成全量推理,在RTX 4090上通过4-bit量化,生成速度约为12 tokens/s。官方技术文档指出,澳门大小官网采用的是分组查询注意力(GQA)与Top-2稀疏路由机制,这一组合在吞吐量和内存占用之间取得了平衡。在模型协议方面,澳门大小官网选择了Apache 2.0,这意味着企业可以将模型集成到商业产品中而无需公开衍生代码,大幅降低了合规成本。对于开发者而言,澳门大小官网的直接价值在于:一个能够在消费级硬件上运行且具备320B参数的模型,同时保留了足够的指令遵循和复杂推理能力。
从版本演进来看,澳门大小官网是澳门数字科技研究院继“澳门智脑”系列之后推出的重磅升级。据官方发布材料显示,澳门大小官网在训练阶段即采用了与社区主流不同的“中英双语课程式”数据编排,并在后期融入了大量代码与数学合成数据,使模型在推理链上的表现显著优于前代。另一方面,澳门大小官网的上下文窗口从上一代的32K扩展到128K,并在长文本检索任务中通过稀疏注意力机制控制了额外开销。这意味着澳门大小官网不仅适用于常规对话,还能在合同审查、论文阅读、日志分析等场景中直接处理整本级别的长文档,而无需额外拆分与拼接。
澳门大小官网的技术架构:MoE、GQA与推理优化
澳门大小官网的底层实现围绕“稀疏激活”这一核心展开。其MoE层将前馈网络划分为64个独立的专家子网络,每个token经过路由网络计算后,仅激活其中得分最高的两个专家。这种Top-2路由策略在增加参数量到320B的同时,单次前向传播的计算量只相当于一个约30B参数的稠密模型。由此,澳门大小官网在FLOPS利用率上实现了显著提升。而在注意力部分,模型采用了GQA,将键值头(KV head)压缩至16个,并配合FlashAttention-3内核,节省了约60%的KV缓存显存占用。官方推理引擎还集成了PagedAttention技术,通过分页管理KV缓存,将内存碎片降至接近零。在多卡部署时,澳门大小官网使用张量并行与专家并行相结合的分布式策略,通过优化的All-to-All通信,在多节点环境下实现了近线性扩展效率。这些设计环环相扣,最终让澳门大小官网能够在较低显存环境下保持高并发吞吐。
具体来说,澳门大小官网的MoE路由器采用softmax分组的Top-2选择机制,并引入负荷均衡损失项来约束专家间的调用失衡。该机制在每层都设置了一个小的辅助网络,用于估计每个专家在当前批次上的期望负载,并动态调整路由得分。由于澳门大小官网的专家数量较多,专家并行成为训练和推理的主要瓶颈,官方为此提出了“两级分片”方案:先将不同专家分布到不同设备上,再对每个专家内部的权重进行张量切分,这样能够同时利用节点内NVLink和节点间RDMA网络。在实际部署中,澳门大小官网推荐使用8卡A100作为最小多卡配置,此时张量并行度设置为8,专家并行度设置为1;而在64卡集群中,可以使用4路张量并行与16路专家并行的组合。

在技术架构落地后,澳门大小官网的工程团队还针对常见推理框架进行了适配,包括vLLM、SGLang以及TensorRT-LLM。这意味着开发者不需要重写代码,即可在自己的服务中挂载澳门大小官网。官方在Github仓库中提供了完整的性能测试脚本,用于复现不同批次大小下的吞吐数据。澳门大小官网的量化版则通过GPTQ与AWQ算法生成,在4-bit权重下,模型质量损失控制在1.5%以内,而显存占用进一步降低到约18GB,这使消费者级显卡运行百亿参数级模型成为可能。值得注意的是,澳门大小官网的GGUF格式对llama.cpp进行了特殊优化,使得在Apple Silicon上没有GPU加速时也能获得可用的生成速度,这为移动端与边缘设备上的AI应用带来了新的可能性。
澳门大小官网性能表现:基准分数与效率指标
根据官方在发布博客中披露的数据,澳门大小官网在多个公开评测集上展现出较强竞争力。以下为部分结果,具体复现请参考官方脚本。
- MMLU(5-shot):72.3,超过同激活参数的DeepSeek-V2-Lite,接近Qwen2.5-72B。
- GSM8K(8-shot):89.1,在数学推理上同样对标同体量闭源模型。
- HumanEval(0-shot):74.5,编程能力达到开源第一梯队。
- BBH(3-shot):70.2,复杂任务指令遵循能力稳定。
在效率指标上,澳门大小官网在NVIDIA H100上的官方测速显示,对于2K输入长度与2K输出长度,单卡吞吐可达1820 tokens/s(使用vLLM连续批处理,batch size=16)。相比同平台上的Llama 3.1-70B,澳门大小官网将每百万token的推理成本降低了约40%。在长文本场景中,借助128K上下文窗口,澳门大小官网在RULER测试中,对于32K长度文档的检索准确率达到96.8%,在64K长度下仍然维持91.2%。不过,需要指出的是,以上数字均由澳门数字科技研究院自行发布,尚未经过第三方实验室的独立复核。截至写作时,开源社区已对澳门大小官网的A100和4090部署开展了初步复测,反馈大多集中在内存占用的真实性上,而吞吐数据与官方数值之间的偏差约在8%以内。
在专项任务上,澳门大小官网同样表现出较强的控制力。在由中文榜单C-Eval组成的规范测试集中,澳门大小官网的平均得分达到81.4,其中人文社科类子项得分最高,为85.2;STEM子项为78.9,这与其训练数据中中文社科内容占比较高有直接关系。在代码生成测试多语言HumanEval上,澳门大小官网的Python版本得分74.5,JavaScript版本为71.2,SQL为69.8。在多轮对话指令遵循方面,澳门大小官网在MT-Bench上获得8.2分,这一成绩逼近部分非MoE的百亿模型。官方还强调,澳门大小官网在低资源语言(如泰语、越南语)上的表现优于同体量模型,原因是数据管线中增加了小语种语料的重采样,这一做法在开源模型中并不常见。
澳门大小官网的训练策略:数据清洗与对齐
澳门大小官网之所以能取得上述成绩,很大程度取决于它的训练数据与过程设计。团队在训练中使用了约18T token的中英文混合语料,其中中文占比35%,同时加入了大量合成数据与代码数据来增强推理能力。数据清洗阶段采用多级去重与质量过滤,利用已有的小模型对每个样本进行难度评分,并按照难度从低到高排列,构成课程学习顺序。在训练后期,澳门大小官网引入了分组策略,将通用语料与代码语料分开训练,再通过比例混合进行最后阶段的均衡。随后,团队利用强化学习对模型进行对齐,具体采用了基于AI反馈的RLAIF,结合规则奖励模型覆盖数学、代码等确定性任务。为了降低对齐带来的能力退化,澳门大小官网还设计了“回滚式”梯度裁剪机制,当奖励模型得分与基准能力得分出现背离时,自动降低对应批次的学习率。此外,官方公开了数据配比表及各阶段超参数,便于研究社区复现整个训练流程。这种“数据+算法+工程”的闭环策略,是澳门大小官网在有限算力条件下仍能对标大规模模型的关键。
在具体数据配比上,澳门大小官网的训练语料涵盖网页、书籍、论文、代码库、百科以及内部生成的合成对话。其中高质量网页占比约32%,书籍与杂志占8%,代码库占18%,中英对照平行语料占7%,合成数据约占25%。为保证多语言能力,团队将非中英文语料(如日韩、东南亚语言)的采样权重提高到总数据量的12%,并采用了基于分布相似度的采样方法,避免模型对小语种产生灾难性遗忘。在训练流程上,澳门大小官网首先用约10000步的“冷启动”式预训练让模型对数据形成稳定特征,然后转入课程学习阶段,期间动态调整样本难度阈值,最后进入指令微调与对齐阶段。训练过程中还使用了损失尖峰检测与自动恢复机制,能够在硬件故障后动态节省时间成本。
澳门大小官网开源与上线方式
截至2026年8月14日,澳门大小官网的模型权重、推理代码、量化工具与评测脚本均已开源。项目仓库地址可在GitHub搜索“AomenDaxiao”获取,同时Hugging Face模型卡(AomenDaxiao/MacauSize-320B-MoE)提供了完整权重与GGUF格式下载。官方还提供了一套Docker镜像,内置vLLM与SGLang环境,用户执行一条命令即可拉起兼容OpenAI API的服务。澳门大小官网采用Apache 2.0协议,允许商用与二次开发,这使它可以被企业直接集成到内部知识库、客服机器人或代码辅助工具中。社区方面,已有开发者基于澳门大小官网开发了检索增强生成(RAG)插件,以及面向文本摘要的微调版本。此外,澳门大小官网的ONNX导出脚本也一并公布,使得它能够配合TensorRT或OpenVINO在边缘设备上运行。目前,澳门大小官网已经在ModelScope社区开设镜像仓库,方便国内开发者高速下载。
在部署准备上,澳门大小官网的官方文档给出了三种典型配置:最低配置为单张RTX 3090(24GB显存)配合4-bit量化,适合开发测试;推荐配置是单张A100(40GB),能够运行FP16全精度模型;生产配置则建议使用八张A100或H100,以充分发挥专家并行的吞吐优势。官方还提供了API参考实现,支持流式输出、函数调用与JSON结构化输出,方便企业将其接入现有业务系统。澳门大小官网的许可证来自Apache 2.0,因此企业可以自由修改模型权重并对外提供服务,只需保留版权声明。这一做法与部分知名模型仅提供非商用授权形成鲜明对比。
在生态合作方面,澳门大小官网已与vLLM、SGLang、llama.cpp、MLC-LLM等主流推理框架完成兼容性验证,并提供了相应的服务端实现。同时,国内多家云厂商已表示将在其模型市场上架澳门大小官网的托管服务,用户可以通过API或私有化容器两种方式使用。就在日前,澳门大小官网官方还宣布将举办线上技术分享会,介绍模型训练过程中的工程细节,并邀请社区开发者参与基于澳门大小官网的应用竞赛,以推动更多场景落地。
总结:澳门大小官网的标杆意义
澳门大小官网的发布,是开源大模型在效率与能力均衡方面的一次重要尝试。它通过MoE架构将320B参数模型的实际计算量压缩到30B级别,同时利用GQA、PagedAttention与量子化技术,把部署门槛推至消费级显卡可及的范围。在性能上,官方宣称其在主流评测中的成绩能够对标同代大规模模型,而推理成本下降45%的数据如果得到第三方验证,将使中小团队的成本敏感场景明显受益。当然,由于多数评测数据来自官方发布,真实的社区表现仍需一段时间沉淀。但无论从技术设计还是开源策略来看,澳门大小官网都已为其在AI应用生态中的落地找到了一个较为清晰的站位。
对于AI工程社区而言,澳门大小官网提供了一套可复制的“大参数、小开销”实践样本。它的数据配比、路由策略、量化方案与部署脚本都是公开的,这使得其他团队可以在此基础上进行二次优化,而不必从零开始。澳门大小官网的发布还将进一步加剧开源模型与闭源模型在效率维度上的竞争,也将促使更多团队重视“最后一公里”的部署优化。如果澳门大小官网的官方性能数据能在未来得到更广泛的独立验证,它极有可能成为开源社区中一个长期活跃的基础性模型。