人工智慧處理器效能 MAC , TOPS

TOPS(Trillion Operations Per Second)常被用來描述人工智慧處理器的峰值運算能力,而 MAC(Multiply-Accumulate)則是描述神經網路計算量的常見單位。兩者都與乘加運算有關,但並不是同一個量:MAC 通常描述一次模型推理需要多少計算,TOPS 則描述硬體在特定數值精度與計算定義下,每秒最多可執行多少基本運算。因此,TOPS 可以作為硬體能力的指標,卻不能單獨等同於實際推理速度。
TOPS 與 FLOPS 的基本意義
TOPS 是每秒兆次運算(Tera Operations Per Second)的縮寫。這裡的 operation 是一種統計口徑,而不是跨所有處理器都完全一致的標準。產品規格通常會同時標示運算精度,例如 INT8 TOPS、FP16 TOPS 或 INT4 TOPS;若未註明精度,便難以公平比較不同處理器的數值。
FLOPS(Floating-Point Operations Per Second)則專門統計每秒可完成的浮點運算,常見標示包括 FP32、FP16 或 BF16。TOPS 可以涵蓋整數或浮點運算,但 FLOPS 的重點在於浮點運算。兩者都是吞吐量指標,並不直接表示記憶體頻寬、延遲、功耗或特定模型的實測效能。[1]
在人工智慧處理器的規格表中,INT8 TOPS 很常見,因為推理模型可以透過量化降低資料表示的位元數與計算成本。然而,「TOPS 越高,推理一定越快」這種說法並不充分;實際結果還取決於模型是否使用相同精度、硬體是否能有效利用矩陣運算單元,以及記憶體存取和軟體核心是否成為瓶頸。
乘積累加運算(MAC)
MAC 是一次乘法與一次累加的組合,常寫成:
在全連接層或卷積層中,輸入值與權重先相乘,再將多個乘積累加,最後通常再加入偏置。以矩陣乘法為例,神經網路中的一部分前向傳播可簡化為:
若輸出元素 是由長度為 的向量內積得到,便需要約 次乘法與 次累加;在常見的模型計算量估算中,這會被記為約 個 MAC。深度神經網路的卷積、全連接與矩陣乘法都大量使用這種模式,因此 MAC 適合用來估計模型的計算需求。[2]
需要注意的是,MAC 與 operation 的換算有不同慣例。若把一次乘法和一次加法分別計為一個 operation,則:
但有些硬體或產品規格會把 fused multiply-add 視為一次 MAC,並以 MAC/s 表示吞吐量。因此,將模型的 MAC 數直接除以 TOPS 前,必須先確認兩者是否採用相同的計數方式。這也是不同產品宣稱的 TOPS 不宜直接排列比較的原因之一。
從模型 MAC 到硬體 TOPS
設一個模型完成一次推理所需的計算量為 個 MAC,硬體峰值能力為 TOPS。若硬體規格把一個 MAC 計為兩個 operation,且模型完全使用該精度、硬體也能達到峰值,則理想化的最低時間可寫成:
其中 以秒為單位。這只是上限能力下的估算,不是實際延遲。更一般地,可以用利用率 表示實際硬體利用程度:
會受到記憶體頻寬、資料搬移、算子支援、批次大小、輸入形狀、核心頻率、溫度與軟體最佳化等因素影響。當模型受記憶體存取限制時,增加 TOPS 未必能等比例降低延遲。MLPerf Inference 因此以實際模型與部署情境測量吞吐量和延遲,而不是只比較硬體的峰值規格。[3]
精度、量化與效能
數值精度會同時影響模型表示、記憶體流量與可用的硬體計算單元。一般而言,較低位元數可以降低資料大小並提高特定硬體的計算吞吐量,但也可能增加量化誤差;實際準確率仍須透過模型與資料集驗證。
| 精度 | 位元 | 常見用途 | 主要考量 |
|---|---|---|---|
| FP32 | 32 | 訓練、基準與高精度計算 | 精度較高,但記憶體與計算成本較大 |
| FP16/BF16 | 16 | GPU 或加速器推理、混合精度訓練 | 在精度與吞吐量之間取得平衡 |
| INT8 | 8 | 量化推理、邊緣裝置 | 需要評估量化誤差與算子支援 |
| INT4 | 4 | 受限資源裝置與部分大型模型推理 | 資料量較小,但精度與硬體支援更敏感 |
因此,精度名稱不能只作為表格中的附註,而應被視為 TOPS 的必要條件。例如 INT8 TOPS 與 FP16 TOPS 代表不同的運算情境;即使兩者數值相同,也不表示它們對同一模型具有相同的推理能力。TensorRT 等部署工具也會依硬體與網路支援不同數值格式,實際執行時可能需要轉換或回退到其他計算路徑。[4]
如何解讀處理器規格
閱讀人工智慧處理器規格時,可以依序確認四件事:第一,TOPS 的精度與 operation 計數方式;第二,規格是峰值吞吐量還是實測結果;第三,目標模型的 MAC 數量、算子與張量形狀是否適合該硬體;第四,是否同時提供延遲、吞吐量、功耗與準確率等部署資訊。
這種解讀方式可以避免把三個不同概念混在一起:MAC 是模型需要完成的乘加工作量,TOPS 是硬體在特定條件下的理論處理能力,而實際推理效能則是模型、硬體、編譯器與工作負載共同作用的結果。
結語
MAC 提供了描述神經網路計算量的直觀方式,TOPS 則提供了描述處理器峰值吞吐量的簡潔指標。兩者可以透過 operation 的計數慣例連結起來,但不能在未確認精度與定義的情況下直接互換。較可靠的效能判讀,應先以 MAC 估計模型工作量,再對齊硬體的精度與計算口徑,最後以實際部署測試確認延遲、吞吐量、功耗與模型準確率。
參考文獻
[1] TOP500, “Frequently Asked Questions,” TOP500, accessed Aug. 11, 2026, https://www.top500.org/resources/frequently-asked-questions/.
[2] V. Sze, Y.-H. Chen, T.-J. Yang, and J. S. Emer, “Efficient processing of deep neural networks: A tutorial and survey,” Proceedings of the IEEE, vol. 105, no. 12, pp. 2295–2329, 2017, doi: https://doi.org/10.1109/JPROC.2017.2761740.
[3] MLCommons, “MLPerf Inference,” MLCommons, accessed Aug. 11, 2026, https://mlcommons.org/working-groups/benchmarks/inference/.
[4] NVIDIA, “TensorRT’s Capabilities,” NVIDIA TensorRT Documentation, accessed Aug. 11, 2026, https://docs.nvidia.com/deeplearning/tensorrt/latest/inference-library/capabilities.html.


