量子计算和机器学习,谁成就了谁?谁更需要谁?
NISQ时代的量子计算机确实一直在坡上爬,但真能放得出去的猛料还很少,这其中的一部分原因就是量子机器学习界太需要一个足够大、足够标准的数据集了。

2026年5月26日,日本大阪大学、理化学研究所联合团队发布的MNISQ数据集直击痛点,为NISQ时代的量子机器学习探索提供了第一个大阵势的基准评估体系,也使量子、经典机器学习之间的“整齐仗”大体成为可能。

量子机器学习,卡在哪儿了?
量子计算机之所以备受瞩目,那是因为它可以以极高的并行性解决很多经典计算机都无法解决的问题。
但是当下,NISQ量子设备误差大、比特数少,不太容易跑出“量子优势”。量子机器学习一直是NISQ设备前景最好的应用方向之一。
但令人困惑的是,要训练一个“好的QML模型”,就要有好的数据集。
而已有的量子数据集要么小,比如只有一个几百条数据的集,不适合深度学习等训练任务;要么专,比如只服务于某一类物理系统,难以套用;要么只给出量子态本身,不能直接用来训练经典模型来结果复现和对比。
更主要的,好的数据集应可以同时服务于这两个目标:
用量子的方法跑出比经典模型更好的结果(量子优势);用经典的方法去理解甚至辅助优化量子电路(机器学习助力量子计算)。MNISQ就是为了这事儿出来的。

怎样把MNIST“塞进”量子电路?
MNISQ的名字,也告诉了它的“出身”:MNIST+NISQ。没错,MNISQ的 “血脉” 都是巨无霸图像数据集:MNIST、Fashion-MNIST、Kuzushiji-MNIST等。
但计算机不认像素值,只认量子态。所以第一关是一个挡箭牌:将一个经典图像编码成量子态。研究团队采用的是一种叫做自动量子电路编码(AQCE)的算法。
简单地讲,AQCE会给每个输入的图像自动生成一个量子电路。执行该量子电路时,在量子比特概率幅上“存储”了该图像信息。

换言之,AQCE类似一个“编译器”:输入一张手写数字图像,输出一个量子电路描述(QASM语言)。但是这么做的好处就是:得到的数据可以重复被使用。
而且研究者控制数据生成过程的“fidelity”(量子态接近真态的程度)各自的希望值不少于80%、90%、95%分别生成了几个子数据集,fidelity越大,量子电路越深,信息越可靠。

量子和经典,谁更牛?
数据集造出来了,再真刀真枪地来实验。团队设计了两种实验“道路”。
(一)“量子道路”:QSVM打赢97%的“对决”
在量子道路上,他们选择了量子支持向量机(QSVM)。与经典SVM不同,QSVM核函数不是手写出来的,而是用一个量子电路来求两个数据的“相似度”。
把两者的量子电路串联起来,再测量出全零态的概率值,就计算出了一个核函数值。这个计算过程完全经典计算机是无法有效模拟的。
实验结果很漂亮,例如,QSVM在MNIST数据上做了95%的fidelity作业,分类正确率达到97.91%。其实连难度更高的Fashion-MNIST和Kuzushiji-MNIST也分别超过了86%和90%。
这是一个结论,就是如果能够让经典的数据放入量子态中,再用量子核方法来做分类,结果是可以办到的。
(二)经典赛道:S4模型相当“出彩”
当然下一条就是,团队把同样的数据交给经典模型去做,可是里面的输入不是数字本身,而是QASM的代码文本。也就是说经典模型观察到的是量子电路的“程序文本”,不是图像本身。
任务没有变:识别这个电路代表一个多少数字。对经典模型来说,这是一个非常不好做的事情。QASM里面代码包含了最多的门操作和复数矩阵,没有一些非常简单的视觉和语义特征。
团队试了3个主流模型:LSTM、Transformer和S4。
结果还挺有意思:S4最好,在MNIST上的准确率能达到77.78%。LSTM表现还行,约为66%。Transformer表现最差,甚至在fidelity高的情况、序列长的情况下,准确率是下降的。
S4的胜利不奇怪。它本来就是长序列依赖模型,而高fidelity的电路QASM文件更长、结构更复杂,S4不是最擅长的地方吗?
更“有意义”的是数据增强对经典模型的帮助特别大。在95%fidelity下,MNIST分类的准确率提高到了81.36%——从77.78%。
这也再次印证了一个不讲理的真相:数据量,仍是最硬核的机器学习参数。

一个数据集带来的贡献
MNISQ出现至少有三方面实质性的贡献。
第一,它提供了一个大规模、结构化、可重复读取的量子电路数据集。这是目前公开的最大规模的一种资源,它总共有495万个数据点。
不管是用来拟合QML模型,还是用作经典模型去理解量子电路的实验平台,都有大量的数据可操作。
第二,MNISQ初步体现了量子方法在分类任务上的优势。97%的正确率,并不等同于“好杀”经典模型(后者对原始图像也能做到99%以上)。
但它之不同在于:量子模型看到的是量子编码后的数据,不是原始的像素数据,这是一种“特征抽取”方式,很可能是那些特殊任务下能够产生优势的因素。
第三,它揭示了一个容易被忽略的现实:经典模型其实已经“读懂”了一部分量子电路的“言谈举止”。
竟然不知物理上的任何量子力学知识,S4模型也能从QASM代码里学出有效模式来,且可准确率超过77%。

结语
研究者表示现在经典模型的结果和量子的差距还很大,而且对不同fidelities所达到的性能的差异也不是一致的。MNISQ的意义,不只在于“更大的数据集”。
它意味着一个转型:量子机器学习是从“玩具问题”向“标准化基准”进军;它也连接着量子和经典两个本来彼此隔阂的两个世界,搭建起一座数据桥梁。
以后,如果有人告诉你一个模型说:“它懂量子电路”,你不妨再问一句:你在MNISQ上跑过吗?
https://www.nature.com/articles/s41597-026-07493-9







