跳到主要內容

散戶的 AI 武器庫:六個開源框架正在重寫投資決策的底層邏輯

每一個投資人都面對同一個問題:資訊太多,時間太少,而市場不等人。

一份 20-F 年報有兩百頁。法說會逐字稿有幾萬字。宏觀數據每天更新,競品動態隨時變化。外資研究報告永遠比你看到的版本晚幾個小時,而且不一定是最新的。個人投資者根本沒有時間消化這些,更不用說系統性地管理「自己的判斷是否被確認偏誤污染」這種 meta 層面的問題。

這個資訊不對稱問題一直存在。但 GitHub 上正在發生一件事,會改變這個局面。

過去幾個月,六個 AI 交易框架悄悄累積了超過 26 萬顆 star。沒有人在財經新聞頭版報導它們,但如果你知道怎麼看,會發現這件事的意涵遠超過任何一個市場指數的里程碑。

這不只是「幫你選股」的故事。這六個框架合在一起說的,是一件更大的事:AI 在投資這件事裡,正在沿著一條清晰的演化路線移動——從工具,到同事,到公司,再到整個世界的模擬器。以前只有 hedge fund 才配得起的架構,現在是開源的、免費的、可以在你的工作站跑的。


為什麼現在是 AI 投資工具的關鍵時刻

在看工具本身之前,先說清楚「為什麼是現在」。這不是在說市場漲跌,而是說技術條件什麼時候成熟到讓這件事真正可行。

散戶面對的資訊不對稱從未消失

一份 20-F 年報有兩百頁。法說會逐字稿有幾萬字。聯準會利率決議後的連鎖反應要在幾十個資產類別同時追蹤。外資研究報告永遠比你看到的版本晚幾個小時,而且不一定是最新的。

個人投資者沒有時間消化這些,這個事實從來沒有改變過。大型基金可以雇十個分析師輪流做這件事,散戶只有自己一個人。這個差距不是努力可以彌補的,是結構性的。

但是三個條件最近同時成熟了,讓「AI 彌補這個差距」第一次變成現實而不是願景。

三個同時成熟的條件

成本崩落。 Claude Sonnet 4.6 的 API 定價是每百萬輸入 token 3 美元、輸出 15 美元;DeepSeek V3.2 更低,0.14 美元輸入 / 0.28 美元輸出。跑一次完整的多角色財報分析,實際成本可以壓在 0.5 到 2 美元之間。這個數字在兩年前至少高 10 倍。過去只有大型機構才負擔得起的 LLM 推論成本,現在個人投資者也用得起。

開源工具成熟了。 本文介紹的六個框架,最早的 TradingAgents 論文是 2024 年底提交,Vibe-Trading 在 2026 年 4 月才發布 PyPI 版本,Dexter 在 2026 年初才有正式外部評論。整個生態系非常新,但發展速度驚人——這不是已經穩定的技術,而是正在快速演化的前沿。

26 萬顆 star 代表什麼? 以 LINE Bot SDK 為參考,這個台灣最知名的開源工具累積星數約 8,000 到 15,000。這六個框架在幾個月內累積超過 26 萬顆,意味著全球幾十萬名開發者每天在追蹤這件事的進展。不是路人,是工程師級別的關注。當這個密度的開發者資源集中在一個領域,迭代速度會是其他軟體品類的數倍。

AI 供應鏈已經重塑了投資分析的底層

在技術成熟的同時,投資分析的對象本身也在改變。台積電、廣達、緯創這類 AI 供應鏈公司的財報,現在需要投資人同時理解晶片製程路線、資料中心建置節奏、雲端業者的資本支出計劃,才能做出有意義的判斷。這種跨域、高密度的資訊整合需求,恰好是 LLM 最擅長的事。

AI 工具的出現,和 AI 作為投資主題的崛起,在時間點上是重疊的。這不是巧合。


一、研究層:Dexter 讓一個問題變成一份報告

散戶最大的先天劣勢不是資金,是資訊處理能力。

傳統 AI 分析工具的核心問題

把同樣一個問題問 ChatGPT、問 Claude、問 Perplexity,你會得到三份長相相似但細節各有偏差的答案。這些工具的共同問題是:它們不知道自己哪裡錯了。

一個對自己的輸出沒有自我審查機制的 AI,在一般對話裡頂多是讓人尷尬,在金融分析裡卻是危險的。「TSMC Q1 2026 的 EPS 是 X.X 元」——如果這個數字是模型幻覺出來的,你根據它做出的決策損失是真實的。

更深的問題是 RAG 架構的本質缺陷:向量檢索本質上是在找「看起來相關」的文本,但財務分析需要的是「在邏輯上正確鏈接」的資訊鏈。相關性和正確性是兩回事。

Dexter 的設計哲學

Dexter 是 virattt 開發的 TypeScript / Bun 框架,目前超過 26,000 stars。他之前的作品 ai-hedge-fund 是 GitHub 上最多星數的 AI 金融 repo 之一,Dexter 是在那個基礎上的進化版本。

virattt/dexter on GitHub

核心設計理念是「think Claude Code, but built specifically for financial research」——一個任務規劃器加上自我反思迴圈的架構:

Task Planning(任務拆解):你丟一個複雜問題,Dexter 不直接搜尋,而是先建立一個研究計劃。以「台積電 Q2 法說會後值不值得加碼」這個問題為例,Dexter 可能把它拆解成:

  1. 取得 Q2 法說會的實際財務數字(EPS、毛利率、CoWoS 出貨量)
  2. 對比市場預期共識
  3. 查詢外資在法說會後三日的籌碼變化
  4. 分析技術面支撐位
  5. 彙整競品(Samsung、Intel Foundry)的動態

這五個子任務各自執行、互相交叉驗證,最後合成結論。

Self-Validation(自我驗證):每個子任務完成後,Dexter 會主動審查這個步驟的輸出。如果發現「前後矛盾」(例如 EPS 的數字和毛利率的計算不一致)、「數據缺口」(某個關鍵指標沒有取到數值)、或「推論跳躍」(結論和數據之間缺少邏輯橋樑),它會重新搜尋或重新計算,而不是直接往下走。Loop detection 機制防止它在某個問題上無限迴圈。

Scratchpad 追蹤:所有工具呼叫都會記錄到 .dexter/scratchpad/ 的 JSONL 檔案裡,完整保留每次分析的推理過程,可以事後 debug 和驗證。

這個架構有個很重要的含義:Dexter 的價值不只是「能查到資料」,而是在輸出結論之前建立了一個最低限度的信心閾值。這不保證結論正確,但它讓「AI 幻覺直接被當成事實輸出」這件事的機率大幅降低。

Dexter 的實際限制

誠實地說它做不到什麼:

台灣財務數據的取得是第一個障礙。Dexter 的工具整合主要面向美股——Financial Datasets API 對台股的覆蓋不完整,TWSE 的財報資料需要額外的 connector。如果要分析台股個股,目前需要一定程度的自訂工具開發。

即時性問題:SEC 報告可以即時取得,但台股公開資訊觀測站(MOPS)的資料格式不統一,爬取複雜度高。

WhatsApp 整合是它的可用性亮點——你可以從手機直接傳問題,收回一份研究報告,不需要開 terminal,不需要懂 API。這個設計讓它更接近實際投資者的使用習慣。


二、辯論層:TradingAgents 的多角色架構和 arXiv 論文

研究做完了,但研究本身可能有盲點。人類在投資時有一個系統性問題:確認偏誤(Confirmation Bias)。一旦決定看多,就傾向只找支持看多的證據。

真實交易公司的組織架構作為設計藍本

TradingAgents 是 Tauric Research 開發的框架,背後有一篇 arXiv 論文(2412.20138),作者是 Yijia Xiao、Edward Sun、Di Luo、Wei Wang。論文在 Multi-Agent AI in the Real World 研討會獲得 Oral 報告資格。

TauricResearch/TradingAgents on GitHub

截至 2026 年 5 月,這個 repo 已超過 65,000 stars(v7 版本),比本文原始版本記錄的 79,888 更動態——星數每週都在變化,這裡給出的是最近可查到的數字。

論文的核心實驗結果

論文在 AAPL、GOOGL、AMZN 三個標的上進行了回測(2024 年 6 月至 11 月交易環境,模型對未來資訊無知情假設),對比多個 baseline 策略,結果摘要:

標的累積報酬年化報酬Sharpe 比率最大回撤
AAPL26.62%30.50%8.210.91%
GOOGL24.36%27.58%6.391.69%
AMZN23.21%24.90%5.602.11%

這些數字在回測環境下看起來很漂亮。論文的結論是:多 Agent 辯論架構相較於單一 Agent 決策,在累積報酬、Sharpe 比率和最大回撤控制上都有顯著優勢。但這些是 2024 年回測的歷史數字,下文「風險與限制」章節會解釋為什麼不應該把回測數字直接當成未來期待。

架構解析:四個角色到一個決策

框架核心是模仿真實交易公司的組織結構

Loading diagram...

Bull vs Bear 機制的心理學基礎:這個設計有它的行為金融學根據。對沖基金領域有一個叫做 Devil's Advocate(魔鬼代言人)的機制——在做重大投資決策前,刻意指派一個人的職責是「找出這個決策最強的反對理由」。人類分析師做不到這件事,因為人腦在確認一個結論後,對反向訊號的接受程度會自動降低。讓兩個 AI Agent 各自持有對立立場,強迫系統在做決策前暴露在最好的反方論點下,是在架構層面解決確認偏誤。

Sentiment Analyst 的數據源:v0.2.5 整合了 StockTwits 和 Reddit 的散戶情緒數據。台股在這方面的狀況不一樣——PTT 股版和 Threads 台股討論有類似的功能,但目前 TradingAgents 還沒有直接整合台灣本土情緒數據源。如果要用在台股上,這一層需要自行接入 PTT API 或其他本土數據。

模型支援廣度:Claude 4.6、GPT-5.x、Gemini 3.x、DeepSeek、Qwen、GLM 全部支援,不鎖定單一 API 供應商。這個設計讓使用者可以根據成本和品質在不同模型之間切換。

每次分析的 API 成本估算

用 Claude Sonnet 4.6(3/3/15 per million tokens)跑一次完整的四角色辯論分析,假設:

  • 每個分析師的輸入 context 約 8,000 tokens
  • 每個角色輸出約 2,000 tokens
  • 辯論環節輸入 16,000 tokens、輸出 3,000 tokens
  • 投組經理決策輸入 12,000 tokens、輸出 1,500 tokens

粗略估算:每次完整分析約 0.5 到 1.5 美元(新台幣 16 到 48 元)。如果使用 DeepSeek V3.2,成本大約只有 Claude 的 5%。


三、執行層個人:Vibe-Trading 的假設管理系統

分析到位、辯論完成、決策出爐——然後呢?Vibe-Trading 的設計重點不只是執行,而是管理「你為什麼做這個決策」的整個生命週期。

香港大學數據科學實驗室出品

Vibe-Trading 由 HKUDS(HKU Data Science Lab)開發,是目前這六個框架裡開發最活躍的一個。從 2026 年 4 月發布 v0.1.4 到 5 月下旬的 v0.1.8,幾乎每週都有重大功能更新。

HKUDS/Vibe-Trading on GitHub
pip install vibe-trading-ai

一行安裝,支援 A 股、港股、美股、加密貨幣、期貨、外匯等多市場數據。

Hypothesis Registry:管理交易信念的生命週期

這是 Vibe-Trading 最有意思的設計。

傳統投資的問題不只是「做了錯誤的決定」,更嚴重的是「做了決定但不記得為什麼做」。你在 2024 年 10 月買了台積電,理由是什麼?是法說會利空出盡?還是 CoWoS 訂單超預期?還是純粹看了一篇推文衝動買的?六個月後你賣出時,你能不能說清楚這個假設是否被驗證了?

Hypothesis Registry 試圖解決這個問題。每個交易假設有一個完整的生命週期:

  1. 提出(Submit):「我認為台積電下週因為法說會利空出盡會反彈,目標幅度 5-8%,有效期 2 週」
  2. 追蹤(Track):Agent 持續監控相關指標,記錄假設成立或被否定的關鍵事件
  3. 驗證(Validate):假設期滿後,自動生成驗證報告——哪些預測對了、哪些錯了、為什麼
  4. 學習(Learn):建立你自己的「決策品質歷史」,讓 Agent 知道你在哪類假設上容易過度樂觀

5/20 更新的 Hypothesis Registry CLI 讓整個流程更完整:

vibe-trading hypothesis list --status pending
vibe-trading hypothesis show <id>
vibe-trading hypothesis invalidate <id> --note "法說會表現不如預期,基本面假設錯誤"

這不只是工具,這是在幫你建立一個可以被檢視的決策歷史——這是人類最難靠意志力做到的事。

Shadow Account:不動真錢的策略測試

Shadow Account 是一個虛擬帳戶系統。你從你真實的券商流水中提取策略規則,然後用虛擬帳戶在歷史數據上回測:「如果我完全按照我自己設定的規則操作,我的績效是什麼?」

它還會生成一份 8 節的 HTML/PDF 報告,明確展示你「錯過了多少機會」——包括:

  • 規則違背(你設了停損但沒執行)
  • 過早離場(你的假設是對的,但你太早賣)
  • 錯過信號(你的規則應該進場,但你沒有)
  • 反事實交易(你沒進場的那次,後來怎麼了)

這個設計很殘酷,但很有價值。

Alpha Zoo 和 MCP 整合

5/17 發布的 Alpha Zoo v1(v0.1.8)是這個版本的亮點功能:452 個預建的量化因子,涵蓋 Qlib 158 因子、Kakushadze 101 公式化 Alpha、Guotai Junan 191 因子,以及 Fama-French 5 因子模型。

vibe-trading alpha bench --zoo gtja191 --universe csi300 --period 2018-2025

一行指令就能跑 GTJA 191 因子在任意市場、任意時段的表現。

MCP 整合(v0.1.8 提供的 MCP client integration)讓 Vibe-Trading 可以透過 ~/.vibe-trading/agent.json 載入外部 MCP server 的工具。這意味著你可以讓 Vibe-Trading 直接讀取你在 Claude Code 裡的分析輸出,或者讓 Claude Code 呼叫 Vibe-Trading 的回測工具——兩個系統之間建立雙向通道。


四、執行層平台:AI-Trader 和 Agent-Native 的含義

如果 Vibe-Trading 是個人 Agent,AI-Trader 是想做整個 AI Agent 的交易生態系。

HKUDS/AI-Trader on GitHub

「Agent-Native」是什麼意思

現有的人用交易平台(eToro、Robinhood、永豐金融線上等)是為人的感知模式設計的:有圖形介面、有可視化圖表、有手動下單表單。AI Agent 需要的是不一樣的東西——機器可讀的 API 端點、結構化的信號格式、自動化的帳戶管理流程。

AI-Trader 的設計假設是:未來的市場裡,很多參與者不是人類,而是 AI Agent。這個平台是為那個世界預先建好基礎設施。

每個加入平台的 Agent 都有:

  • 獨立身份(Identity)
  • 虛擬資金($100K 紙上交易資本)
  • 聲譽評分(Reputation Score,根據信號品質累積)
  • 跟單機制(Copy Trading,其他 Agent 可以自動跟隨)

一行 prompt 加入

任何 AI Agent(Claude Code、OpenClaw、Codex、Cursor)都可以用一行指令加入平台:

Read https://ai4trade.ai/SKILL.md and register.

Agent 讀完 SKILL.md 後,自動呼叫 POST /api/claw/agents/selfRegister 完成註冊。整個流程不需要人工介入。

這個設計哲學很有趣:讓 AI Agent 之間形成一個有聲譽機制的市場,好的 Agent 會有更多跟隨者,差的 Agent 會被淘汰——這是在用市場機制來篩選 AI 決策品質。

集體智慧的潛在風險

這個架構有一個值得思考的反面:如果多個 AI Agent 在同一個平台上追蹤彼此的信號並互相跟單,在極端情況下會不會形成新型態的追漲殺跌?

傳統上,市場的穩定性來自於不同投資者的異質性判斷。如果一批 AI Agent 都在讀相似的資料源、用相似的分析框架,它們的決策可能比人類投資者更同質——在市場轉折點時,這種同質性可能放大而非平抑波動。這不是 AI-Trader 特有的問題,而是整個「AI Agent 參與市場」議題需要認真對待的系統性風險。

Polymarket 紙上交易

平台支援 Polymarket 預測市場的紙上交易。預測市場和股票市場的機制不同,但對 AI Agent 的測試價值很高:預測市場的結果是二元的(事件發生 / 不發生),比股票價格預測更容易驗證 AI 的判斷能力。這是一個相對乾淨的環境來校準你的 Agent 的準確率。


五、預測層:MiroFish 和「平行世界」的技術原理

MiroFish 的背景是一個不太尋常的故事。

666ghj/MiroFish on GitHub

創作者的背景和資金

MiroFish 的核心開發者是中國一名大四在學生郭航江(Guo Hangjiang)。他之前的作品 BettaFish(多 Agent 輿情分析工具)在 2024 年底一週內拿到 GitHub 全球排行第一、累積 2 萬顆 star。

盛大(Shanda Group)創辦人陳天橋看到 MiroFish 的 demo 後,在 24 小時內投入人民幣 3,000 萬元(約 410 萬美元)孵化這個專案。郭航江從實習生成為 CEO。2026 年 3 月 7 日,MiroFish 登上 GitHub 全球趨勢排行第一,單日累積 18,000 stars。

盛大的背景在這裡是有意義的。陳天橋以「超個體」理論著稱——在 AI 時代,一個人可以創造出整個公司的價值。MiroFish 的誕生(10 天用 vibe coding 完成)本身就是這個理論的實驗驗證。

架構:平行數位世界的五個階段

MiroFish 不是預測模型,它是世界模擬器。技術架構分五個階段:

  1. 文件攝入(Ingest):輸入種子資料——新聞、政策草案、財務信號、社會事件。格式支援 PDF、Markdown、文字。

  2. 世界構建(Build):系統從種子資料提取「世界觀」,建立一個有社會結構、有輿論場域、有行為規則的數位社會。

  3. Agent 生成(Spawn):根據世界觀,生成幾千個有獨立人格的 AI Agent。每個 Agent 有長期記憶(GraphRAG 儲存),有從種子資料繼承的偏見和觀點。

  4. 自由演化(Evolve):這些 Agent 在這個世界裡自由互動——在虛擬的 Twitter 上發文、形成輿論、相互說服或對立、對事件做出反應。

  5. 注入變數(Inject):你從外部注入一個假設事件——「如果美聯儲突然宣布升息 50 個基點」——然後觀察整個系統怎麼反應。

為什麼湧現比預測更有用

傳統預測模型(包括 LSTM、Transformer 時序模型)的邏輯是:找出歷史數據中的模式,假設未來會延續相似的模式。這在市場保持穩態時有一定效果,但在結構性轉折點完全失效——因為轉折點的定義就是舊模式失效的時刻。

MiroFish 的邏輯不同。它不是在問「根據過去,未來會發生什麼」,而是在問「如果這個情境發生了,有獨立判斷能力的多方參與者會怎麼互動、最終達到什麼均衡」。這更接近賽局論(Game Theory)的思維——湧現(emergence)不是預測出來的,是從互動中產生的。

複雜理論的支撐

這個思路在學術上有 Complexity Theory 的基礎。台股這樣的市場本質上是一個 Complex Adaptive System——每個投資者根據其他人的行為調整自己的策略,市場的整體行為從這些個體互動中湧現,不是從任何單一因果鏈決定的。傳統計量模型假設市場是「可預測的有序系統」,MiroFish 的假設是「市場是可以模擬的複雜系統」。

台股的應用想像

目前 MiroFish 的金融預測應用是「coming soon」狀態,社群也在積極討論如何延伸(GitHub Discussion #238, #280)。但作為思想實驗,最適合用 MiroFish 模擬的台股情境包括:

  • 台積電法說會後市場反應:輸入法說會逐字稿 + 各大外資預期報告,模擬散戶和外資在各種財報結果下的行為
  • Fed 利率決議衝擊:注入「升息 25bp / 不變 / 降息 25bp」三種情境,觀察台股 AI 概念股的壓力測試路徑
  • 中台地緣政治事件:這類事件對台股的影響高度依賴「市場參與者的情緒加總如何演化」,比任何計量模型都更適合用 Agent 模擬

一個警告:MiroFish 的 Agent 繼承自 LLM 的訓練偏見,研究指出 AI Agent 在群體模擬中往往比真實人類更極化、更容易出現羊群行為。這意味著 MiroFish 的模擬可能高估社會反應的強度。


六、治理層:Paperclip 和零人類公司的邏輯

Paperclip 在 2026 年 3 月 4 日發布,三週內突破 30,000 stars,截至 4 月已超過 42,000 stars。

paperclipai/paperclip on GitHub發布速度之快,被幾個 GitHub 追蹤平台列為 2026 年上半年成長最快的開源框架之一。

「如果 OpenClaw 是員工,Paperclip 是公司」

這句話是 Paperclip README 裡的自我定位,也是理解它的最好方式。

OpenClaw(或 Claude Code、Codex)是執行任務的 Agent。Paperclip 解決的問題是:當你有 10 個 Agent 同時在工作,誰負責什麼?他們之間怎麼分工?如果 A Agent 的輸出是 B Agent 的輸入,延誤了怎麼辦?決策需要人類審批嗎?費用超支了誰有權限授權?

它的功能架構:

  • Org Chart(組織架構):Agent 有職稱、有上下級、有職責範圍。CEO Agent 可以設定目標後指派給 CMO Agent、CTO Agent,後者再細分給各自的下級 Agent
  • Budget(預算控制):每個 Agent 有 API 費用預算上限,超出前會觸發審批流程
  • Governance(治理規則):你設定哪些決策需要你批准、哪些 Agent 可以自主執行、何種情況強制暫停
  • Immutable Audit Log(不可篡改的決策記錄):所有 Agent 的決策永久記錄,不能被修改或刪除

「零人類公司」的哲學困境

Paperclip 的自我描述是「open-source orchestration for zero-human companies」——讓一個人扮演董事會,由 AI 團隊自主運作整間公司。

這裡有一個值得認真想的困境:你是董事會,但如果 AI CEO 做了你不理解的決策,你還能有效行使治理權嗎?

傳統公司治理的前提是股東和董事能夠理解 CEO 的決策邏輯,否則治理就是空的。在一個 Agent 公司裡,如果你設定了目標,AI CEO 找出了一個你沒想到的路徑來達成目標,那個路徑可能是合理的,也可能是繞過了你認為重要的限制。

Immutable Audit Log 在技術層面解決了「記錄哪些決策被做了」,但沒有解決「你是否有能力理解和評估那些決策」。可解釋性(Explainability)在 Agent 治理裡是一個比技術更根本的挑戰。

Clipmart:公司即產品

Paperclip 即將推出的 Clipmart 是一個模板市場:下載一整間公司的 Agent 配置——包括組織架構、每個 Agent 的 system prompt、目標設定、預算規則——一鍵匯入到你的 Paperclip 實例。

「想要一套量化投資公司的 Agent 架構?下載模板,填入 API 密鑰,部署。」

這個設計暗示了一個新的商業模式:不只是賣軟體,而是賣「有效運作中的組織設計知識」。好的量化投資 Agent 架構,本身就是有智財價值的東西。

把六個工具組合起來

Paperclip 在這個框架裡的位置是:如果你有 Dexter 做財務研究、TradingAgents 做多空辯論、Vibe-Trading 管理策略假設、AI-Trader 執行信號、MiroFish 做宏觀情境模擬,Paperclip 就是協調這一切的上層治理系統。

一個理想化的流程可能是這樣的:Paperclip CEO Agent 設定本週目標(「評估台積電在 Fed 不同利率決策下的合理持倉比例」)→ 分派給研究部門 Agent(由 Dexter 驅動)做財報分析 → 研究結果進入 TradingAgents 辯論 → 辯論結論更新 Vibe-Trading 的 Hypothesis Registry → Hypothesis Registry 觸發 Shadow Account 回測 → 最終決策通過治理規則審核後,由 AI-Trader 發布信號。

整個鏈條,人在最開頭設定目標、在關鍵審批點介入,其他時間是觀察者。


六個框架的定位矩陣

在看完每一層之後,從全局看它們的相對位置——橫軸是「個人工具 vs 平台生態」,縱軸是「輔助決策 vs 自主執行」:

Loading diagram...
層次框架AI 在做什麼人在做什麼GitHub Stars
研究Dexter分解問題、查數據、自我驗證提問~26K
辯論TradingAgents多角色分析、Bull vs Bear 辯論設定研究標的~65K
執行(個人)Vibe-Trading管理交易假設、策略回測、量化因子審批策略~8.7K
執行(平台)AI-Trader自主加入交易平台、集體智慧下單資源提供者~18.8K
預測MiroFish模擬整個社會系統的演化注入變數、觀察~62K
治理Paperclip協調所有 Agent、執行決策鏈董事會~42K+

七、風險與限制:這些工具能做什麼,做不到什麼

任何人只要認真看過投資歷史,都知道「工具愈強大,用錯的代價愈高」。這一節不是在勸退你,是在確認你進場前知道邊界在哪裡。

AI 幻覺在金融場景的危險性

LLM 幻覺(Hallucination)不是 bug,是這類模型的架構特性。模型在訓練時學習的是「什麼樣的輸出在統計上看起來合理」,不是「什麼樣的輸出在事實上是正確的」。

在一般對話裡,一個幻覺出來的電影情節是無傷大雅的。在金融場景裡:

  • 一個幻覺出來的 EPS 數字可能差了 10%
  • 一個幻覺出來的「某分析師報告內容」根本不存在
  • 一個幻覺出來的歷史事件(「某年某月某公司因此事件股價大跌」)可能是假的

IOSCO(國際證券管理機構組織)的 2024 報告明確指出,LLM 在金融機構的應用面臨「信心失調」問題——模型以同等的語氣輸出正確資訊和錯誤資訊,讓使用者難以辨別哪個是哪個。

Dexter 的自我驗證機制在某種程度上緩解了這個問題,但沒有根除它。TradingAgents 的多角色辯論可以讓不同 Agent 互相 check,但如果四個 Agent 從同一個有誤的數據源取得資訊,它們辯論的基礎都是錯的,辯論本身沒有意義。

實踐原則:任何 AI 輸出的具體數字(財報數字、價格目標、市占率)在影響你真實決策前,要回到原始來源(MOPS、EDGAR、官方法說會)交叉驗證。

回測陷阱:過擬合的系統性風險

TradingAgents 論文的回測結果看起來很漂亮(AAPL 26.62% 累積報酬),但這些數字有幾個需要理解的前提限制:

看前不看後(Look-ahead Bias):良好的回測框架確保 Agent 在每個時間點只能使用該時間點已有的資訊,不能用未來資料,但這在工程實現上是很難保證的,細微的數據泄漏很常見。

存活者偏差(Survivorship Bias):如果回測只用現在仍在市場上的股票(AAPL、GOOGL 都是 2024 年的赢家),自然會有更好的結果。那些在測試期間下市或暴跌的公司不在數據集裡。

數據探勘偏差(Data-Snooping Bias):如果框架在相同歷史數據上反覆調整參數直到結果好看,那個好結果是過擬合(Overfitting),不代表對未來有預測能力。

2025 年的 arXiv 論文(2505.07078)系統性地分析了 LLM 金融策略的回測問題,結論是現有的大多數評估都有這三種偏差的組合,且「在窄股票範圍或短測試期間的結果看起來比實際可靠得多」。

黑天鵝免疫不了

AI 分析的本質是在歷史數據上訓練出來的模式識別。台股 2020 年 3 月的 COVID 急跌(一個月跌 30%),在任何訓練數據裡都沒有足夠的相似樣本讓 AI 學會怎麼準確預判。九二一地震、2008 年金融危機、2011 年三一一、2020 COVID——每一次的觸發因素都是不同的,每一次 AI 的歷史訓練知識都有不同程度的失效。

MiroFish 的架構理論上可以模擬某些黑天鵝情境,但前提是你需要知道要模擬什麼——真正的黑天鵝的定義就是你事前不知道它會發生。

台灣的法規現狀

台股的程式交易和自動下單目前在灰色地帶。TWSE 的電子式專屬線路下單(DMA)自 2006 年開放,但這是機構投資者等級的服務。

對一般散戶,券商的 API 下單在技術上是可行的,但各家券商的規則和服務水準不一,且金管會對「AI 自主決策下單」沒有明確的合規框架。台期所 2025 年已修正多項程式交易相關規章,整體方向是強化風控要求,而不是開放限制。

實踐建議:這些框架最安全的使用方式是「研究與分析輔助」,而非「全自動下單」。以 Vibe-Trading 的 Shadow Account 做策略驗證,以人工審批作為最終執行決策的防火牆,是目前法規環境下合理的路徑。

每日使用的成本現實

如果每天跑一次 TradingAgents 分析(1-1.5 美元),每週跑一次 Vibe-Trading 的 Alpha Zoo 批量回測(5-10 美元),每月 Dexter 查幾次財報(0.5-1 美元/次):

  • 輕度使用(每月 20-30 美元,約 600-900 台幣):合理的研究工具成本
  • 每日密集使用(每月 100-200 美元,約 3,000-6,000 台幣):這個成本等級需要確認你的交易規模能支撐這個研究開支

使用 DeepSeek V3.2 或類似的低成本模型可以把上述成本壓縮到 5-10%,但在需要深度推理的任務(法說會分析、複雜財務建模)上,低成本模型的輸出品質明顯下降。


八、實際上手路徑:從「讀完覺得有趣」到「真的開始用」

第一步:Dexter(最低門檻,不需要交易帳戶)

Dexter 的門檻最低:有 Node.js/Bun 環境、一個 OpenAI 或 Anthropic API key,以及 Financial Datasets 的 API key(有免費層)就能跑。

git clone https://github.com/virattt/dexter
cd dexter
bun install
# 設定 .env 裡的 API key
bun run start

建議的第一個問題:問它分析一個你熟悉的台灣 ADR(例如台積電 TSM 的美股數據,Financial Datasets 有覆蓋)。比較它給你的分析和你自己的判斷,觀察它的研究拆解方式和自我驗證過程。

時間投入:設定環境大約 30-60 分鐘,跑第一次分析大約 5-10 分鐘。成本:每次分析 0.3-1 美元。

第二步:TradingAgents(需要 API key,成本可控)

pip install tradingagents

建議先用 DeepSeek V3.2 或 Qwen 作為後端(成本極低),對一個你已經在追蹤的個股跑一次完整的四角色分析。重點不是看結論,而是看「看多 Agent 和看空 Agent 各自找到了哪些你沒注意到的論點」。

時間投入:設定 30 分鐘,每次分析 3-8 分鐘。成本(使用 DeepSeek):每次 0.05-0.2 美元。

第三步:Vibe-Trading Shadow Account(不動真錢,先理解你自己的策略)

pip install vibe-trading-ai
vibe-trading init

把你過去幾個月的交易記錄(支援同花顺、東財、富途 CSV 格式)上傳,讓 Trade Journal Analyzer 生成你的交易行為分析報告——勝率、盈虧比、持倉天數分佈、行為偏差診斷。

這一步不需要 AI 做任何預測,它只是在幫你理解「你現在的交易方式是什麼樣子的」。

時間投入:設定 30 分鐘,上傳數據和等待報告 10-20 分鐘。成本:基本功能免費。

工具選擇指引

你的投資風格建議工具組合優先順序
長期價值投資(持股 1 年以上)Dexter + TradingAgents研究深度優先,辯論機制幫助避免確認偏誤
中期波段(持股 1-3 個月)TradingAgents + Vibe-Trading多角色分析 + 假設追蹤,管理入場邏輯的生命週期
短線交易(持股 1-14 天)Vibe-Trading Alpha Zoo + AI-Trader量化因子 + 平台信號,速度比深度重要
宏觀事件驅動MiroFish + TradingAgents情境模擬 + 辯論分析,把宏觀衝擊的多種路徑都跑過
想要全自動但要治理Paperclip 整合全棧最高複雜度,適合有工程能力願意花時間架構的人

如果你需要在本地跑這些框架的推理模型——TradingAgents 支援多模型並行呼叫,Vibe-Trading 的 Alpha Zoo 批量因子計算有一定運算需求——24GB VRAM 的工作站卡是合理的起跑點。麗臺 RTX PRO 4000 Blackwell 的規格能支援 Llama 3 70B 量化版,應付大多數本地推理場景;需要更高 VRAM 跑全精度大模型的用戶,可以參考 麗臺 RTX PRO 4500 Blackwell(32GB)——32GB 能跑 Mixtral 和 Qwen2.5 32B 全精度,在 AI 研究工作站的配置上是 24GB 不夠、48GB 太貴的中間選項。


這六個框架合在一起說的一件事

把六個工具排在一起看,會看到一條清晰的演化路線:

Loading diagram...

這條路線從「AI 幫我查資料」開始,走到「AI 自己組成一個投資公司在市場裡運作」結束。每一步都是 AI 承擔更多的決策責任,人退出更多的執行角色。

這六個框架今天都可以下載、安裝、開始用。它們的成熟度從「需要一些工程能力」到「pip install 就能跑」不等,但方向是一致的。

技術工具縮小了執行差距,不是認知差距

TradingAgents 的 bull-bear 辯論機制幫你避免確認偏誤,但它辯論的品質上限是你提供的研究問題的品質。Dexter 的自我驗證再嚴格,也無法驗證你設定的研究框架本身是否合理。MiroFish 的世界模擬再精緻,輸入的種子假設仍然來自你對世界的理解。

這些工具是放大器。你的投資判斷框架越清晰,放大的效果越好。你的框架越模糊,放大的只是你的困惑。

你買的這支股票,你的投資論點是什麼?是基本面撐起來的合理估值、流動性推動的情緒泡沫、還是產業結構性重估的起點?這個問題的答案,決定了你拿到這六個工具之後要用它們問什麼問題。

對這個核心判斷,這六個工具都幫不了你。但一旦你有了判斷,它們能讓你把這個判斷執行得比以前任何時候都更嚴謹、更系統、更不容易被自己的情緒干擾。

這件事本身,值得花時間認真對待。


利益揭露:本文部分連結為聯盟連結,點擊購買我會獲得回饋,不影響你的價格。文中蝦皮商品連結為依規格客觀描述適用情境,非第一人稱使用體驗。