先看結論:比較顧問,不要先比較模型
香港中小企選擇 AI 顧問時,最值得比較的不是對方使用哪一個模型,而是能否把一個真實工作流程的責任人、現況基準、所需資料、風險、驗收條件和交接安排說清楚。示範可以證明某件事「可能做到」,但只有可量度、可覆核、可回復和有人負責的流程,才有機會進入日常營運。
以下七項標準,可以直接用於第一次供應商會議、方案比較或試行審批。
為甚麼「示範很好看」仍然可能無法落地?
生成式 AI 很容易在乾淨樣本上做出吸引的畫面,但企業日常工作通常包含權限、例外、舊系統、個人資料、人工判斷和責任邊界。真正的難度不是讓模型回答一次,而是讓整個流程在錯誤、資料不足或人員轉換時仍然可控。
香港數字政策辦公室的 AI 框架把原則、實務和評估放在一起,並提醒使用者處理資料外洩、模型偏差及錯誤等風險。私隱專員公署的 AI 個人資料保障模範框架則把企業需要處理的工作分成四個範圍:策略與治理、風險評估與人工監督、資料及系統的實施與持續監察,以及持份者溝通。這些要求共同指出一件事:企業採購的不是一次示範,而是一套要被管理的營運能力。
七項 AI 顧問評估標準
1. 先定義工作流程,而不是先推銷工具
合適的顧問應先問:誰在做這項工作、每月出現多少次、最花時間的是哪一步、有哪些例外、錯誤會造成甚麼影響,以及最後由誰負責。若方案一開始只有模型名稱、功能清單和授權費,卻沒有流程圖與責任人,後續很容易變成找場景配合工具。

你應該收到的第一批交付物,是現況流程、問題定義、使用者、資料來源、限制及優先次序,而不是一份塞滿產品截圖的簡報。
2. 能夠分清 AI、規則與一般自動化
不是每一個步驟都需要 AI。固定格式搬運、條件清楚的審批和確定性的計算,通常更適合規則或一般自動化;分類、摘要、抽取或需要處理自然語言的步驟,才可能需要 AI。好的設計往往是三者混合,而不是把整條流程交給一個 Agent。
請顧問逐步解釋為甚麼需要 AI、若不用 AI 有甚麼替代方案,以及模型失效時哪部分仍可繼續運作。
3. 在開發前寫下基準、驗收與停止條件
如果開始前沒有基準,完成後便很難判斷「快了很多」是否真的有商業價值。基準可以很簡單,例如每宗處理時間、返工次數、首次回應時間、完整 Lead 比例或人工抽查通過率。
每個試行至少要有三類條件:成功條件、不可接受的風險,以及何時暫停或回復原流程。NIST 的 AI 風險管理核心以 Govern、Map、Measure、Manage 組織工作,並強調測試、量度、監察和 go/no-go 決定應貫穿系統生命週期。這也是為甚麼驗收不能等到最後一星期才討論。
4. 把資料、權限和供應商責任列成清單
企業應知道甚麼資料會進入系統、資料來自哪裏、誰可以查看、會否送到第三方、保留多久,以及能否刪除或匯出。涉及個人資料、客戶機密或跨境處理時,更應在試行前確認合約、處理角色和保安安排。

私隱專員公署的框架特別把供應商治理、資料安排、輸出處理、模型測試、系統保安和持續監察列入建議範圍。這不代表填完一張表就等同合規,但能讓負責人及早看見需要進一步法律、私隱或保安審視的地方。
5. 說清楚人工覆核、錯誤處理與回復方式
「有人覆核」不能只是一句保證。方案應具體說明哪些輸出必須批核、覆核者會看到甚麼來源或理由、如何標記錯誤、錯誤如何回到改善流程,以及系統出事時如何切回原有做法。

風險愈高,人工控制通常要愈強。私隱專員公署亦建議按風險採用相稱的人工監督。對報價、法律文件、信貸、人事或涉及重要客戶決定的流程,不應用低風險內容生成的標準直接放行。
6. 交付可以運作的試行,而不是永遠停在概念驗證
概念驗證回答「技術上能否做到」;營運試行則要回答「真實使用者能否在受控範圍內使用」。兩者都可以有價值,但報價和里程碑必須講清楚目前是哪一層。
一個可評估的試行通常包含:限定場景、真實但受控的資料、實際使用者、接駁方式、測試集、驗收報告、風險紀錄及下一步決定。若所有測試都由供應商自己挑選,企業便沒有足夠證據決定是否擴展。
7. 在簽約前確認交接、監察與退出安排
AI 系統會受模型版本、資料分布、提示、第三方 API 和使用方式改變影響,因此上線不是項目終點。ISO/IEC 42001 的管理系統思路強調建立、實施、維持及持續改進;對中小企而言,不一定要立即追求認證,但應採用同一個務實原則:有人負責、留有紀錄、定期檢查,並知道何時停用。

簽約前應確認程式碼、提示、工作流、帳戶、日誌和文件由誰擁有;供應商離場後誰能維護;模型或費用改變時如何處理;以及資料與設定如何匯出或刪除。
第一次會議可以直接問的 12 條問題
- 你建議先改善哪一個具體流程?為甚麼不是其他流程?
- 這一步真的需要 AI,還是規則或一般自動化已經足夠?
- 開始前會記錄哪些現況基準?
- 試行的成功、停止和回復條件是甚麼?
- 會使用哪些企業資料、個人資料和第三方服務?
- 資料會在哪裏處理和保存?誰有權限?
- 哪些結果必須由人批核?覆核者會看到哪些依據?
- 如何測試錯誤、偏差、資料外洩和不當輸出?
- 真實使用者會在甚麼階段參與測試?
- 試行完成後,我們實際取得哪些文件、帳戶、程式和工作流?
- 上線後由誰監察成本、品質、故障與模型變更?
- 若項目無法達標,如何停止並取回或刪除資料?
四個常見警號
- 未了解流程和資料便承諾節省比例或收入增長。
- 把所有問題都歸因於模型不夠強,沒有討論權限、資料品質和使用者採用。
- 只展示供應商挑選的成功例子,沒有測試集、錯誤紀錄或失敗條件。
- 報價沒有交接文件、帳戶擁有權、監察安排和退出方案。
一個務實的 90 日試行框架
首 30 日用於定義流程、基準、資料、風險與驗收;第 31 至 60 日建立受控原型,讓少量真實使用者測試;第 61 至 90 日比較結果、修正流程並作出擴展、維持、重做或停止的決定。實際時間要按系統接駁和風險調整,但每個階段都應有可檢查的交付物,而不是到最後才一次過展示成果。
把一個真實流程帶來,會比一份 AI 願望清單更有用
如果你正比較香港 AI 顧問,可以先選一個高頻、耗時、容易出錯而且有明確負責人的流程。Team-E 的 AI 顧問服務 會先做流程與機會診斷,再按需要進入 AI 工作流整合 或 輕量 AI 應用 MVP。第一次討論不需要先決定模型;帶同現有步驟、樣本和你最想改善的指標,已經足夠開始。
主要參考資料
- 香港數字政策辦公室:Ethical Artificial Intelligence Framework
- 香港個人資料私隱專員公署:Artificial Intelligence: Model Personal Data Protection Framework
- NIST:AI Risk Management Framework Core
- NIST:Generative Artificial Intelligence Profile (NIST AI 600-1)
- ISO:ISO/IEC 42001 Artificial intelligence management systems
本文引用的香港及國際框架只作採購和項目管理參考,不構成法律意見,也不表示採用個別做法便已符合所有法規或取得任何認證。