MotoNerv「看」穿監控未來
Forte於2014年畢業於香港都會大學(都大)商學院,其後再修讀香港城市大學市場學碩士課程,之後便加入阿里巴巴杭州總部,參與「淘寶直播」營運。
半年後,他申請調職回港,於2017年加入成立不久的「阿里巴巴創業者基金」(AEF),負責籌備年度重頭戲Jumpstarter環球創業比賽,並支援團隊的創投工作。
自動駕駛項目 啟發創業之路
在AEF工作的四年間,Forte大開眼界。其中一個深圳的自動駕駛項目尤令他著迷,更使他萌生創業念頭:「我想坐上駕駛座試試。」
2020年,他毅然離開待遇優厚的職位,創辦MotoNerv,成為自己口中那位「苦修」的創業者。
Forte的合夥人是一位具豐富經驗與人脈的賽車手。創業初期,團隊專注於車隊管理及駕駛影像識別,希望提升駕駛安全。MotoNerv花了足足四年時間收集行車影片、訓練AI模型及開發系統,把影片內容轉化為文本再作分析。
惟當時市場對相應的需求仍有限。直到大型語言模型(LLM)技術橫空出世,與MotoNerv的技術完美契合,才為Forte打開一片新天地。
「我們產品(的應用領域)不再局限於汽車或駕駛場景。」LLM擅長理解文字,而MotoNerv的核心能力,正是把影片實時「翻譯」成可搜尋的文本,準確地將源源不絕的影片,轉化成描述影片中人物、物件、行為、互動、環境等完整細節的海量文本數據。
更重要的是,用戶可以直接就影片提問——例如「剛才誰進入房間?」、「今天下午有多少人跌倒?」系統會即時從文字資料中整理答案,猶如一名全天候觀看畫面的智能助理。
影像化成文字 即時預警
以MotoNerv參與的一個政府項目為例,系統持續分析CCTV畫面並轉化為文字,一旦偵測到異常狀況,便會通知人員即時處理,效率遠勝人手監控。「一般人能看到甚麼,我們都能看到。但我們不累、不分心、不看漏。」Forte說。
這套技術同樣適用於商場、醫院及酒店等公共空間。當系統辨識到有人跌倒或打翻液體等情況,便可即時提示相關人員處理。
此外,影片在轉化為文本後可被刪除,而文字所需的儲存空間遠低於影像,有助降低儲存成本。
雖然大眾亦可利用LLM把影像轉換成文字,但過程通常耗時且需要大量運算資源。Forte比喻MotoNerv的系統好比連鎖快餐店,處理「食材」既快且標準化;反觀一般工具就如偶爾才下廚的人,效率較低,成本也較高。
成立多年後,MotoNerv終於在2025年錄得收支平衡;同年,MotoNerv向都大申請天使基金(Angel Fund),並成功獲批,得以繼續拓展業務,預計2026年收入可達500萬至800萬港元,穩步發展。這一刻,Forte終於感到自己穩穩坐上了屬於自己的駕駛座。


