
最新解封的法庭文件揭開了微軟和OpenAI內部私人對話的神祕面紗,這些對話與其說是公司備忘錄,不如說是坦白。據本週公開的文件顯示,兩家公司的員工曾就抓取新聞內容來訓練人工智能模型是否構成盜竊展開內部辯論,這些文件已被《紐約時報》和TechCrunch報道。此次披露再次點燃了自《紐約時報》於2023年底首次起訴這兩家公司以來就一直持續發酵的人工智能訓練數據爭議,如今,它們已成爲業內最受關注的版權案件之一的核心。
要點總結
- 微軟應用科學總監布倫特·赫克特在 2023 年的一份內部文件中私下稱人工智能抓取是“人類歷史上最大的勞動力盜竊”。
- 微軟內部文件描述了一種“惡性循環”,其中像 Copilot 這樣的 AI 工具會減少出版商的流量,從而破壞用於訓練模型的內容。
- OpenAI 總裁 Greg Brockman 在得知一項繞過《紐約時報》付費牆的計劃後,回應道“啊,不錯”。
- 《泰晤士報》於 2023 年底提起的訴訟,此後又有 11 家其他出版商加入,OpenAI 不得不爲該案保留 2000 萬條 ChatGPT 對話日誌。
- 隨着更多密封材料的曝光,紐約南區法官西德尼·斯坦正在權衡簡易判決動議。
微軟和OpenAI內部對人工智能數據抓取的擔憂
早在訴訟公開之前,兩家公司的員工就對各自的人工智能訓練方法提出了質疑。已解封的文件顯示,員工並非只是服從命令,他們還以書面形式質疑自己所構建的系統是否符合倫理道德。
微軟員工就“勞動力盜竊”展開辯論
在2023年1月的一份內部備忘錄中,赫克特寫道,“全世界數百萬人很快就會認爲,大型模型竊取他們所有工作成果”是“前所未有的驚人盜竊”。根據已解封的簡報,這種表述與微軟內部關於人工智能數據抓取是否構成人類歷史上最大規模的勞動力盜竊的討論同時出現。對於一家後來在法庭上爲其訓練實踐辯護,稱其合法且具有變革意義的公司而言,這番表態令人震驚。
關於“厄運循環”的警告及付費牆繞過方法
赫克特的警告遠不止那一份備忘錄。在另一份日期爲2024年1月的內部報告中,他寫道:“大型人工智能模型是一種會摧毀其供應鏈的產品”,並描述了內部文件中所謂的“厄運循環”——在這個循環中,像Copilot這樣的AI答案引擎會減少爲其提供訓練數據的新聞網站的流量,從而降低未來模型的質量。據報道,微軟自身的數據顯示,與傳統的Bing搜索結果相比,《紐約時報》網站的點擊率下降了高達93% ,微軟自己也稱這種下降威脅到了“其關鍵供應商的經濟基礎”。
在OpenAI,付費牆問題顯然得到了更直接的處理。根據提交的文件,一名員工曾向OpenAI總裁格雷格·布羅克曼(Greg Brockman)透露,他們正在開發一種“破解”方法來繞過《紐約時報》的付費牆。布羅克曼的回覆被保存在法庭記錄中,內容很簡單:“啊,不錯。” 這段對話已成爲已公開材料中最常被引用的語句之一,主要是因爲它駁斥了付費牆破解是偶然或無關緊要的說法。
關於版權和人工智能訓練的法律之爭
自最初提起訴訟以來, OpenAI 起訴微軟的案件規模已大幅擴大,從最初的單一原告發展成爲一個由出版商組成的聯盟,他們要求對新聞報道如何最終被用於訓練世界上一些最有價值的人工智能模型負責。
《紐約時報》訴訟案及加入訴訟的出版商
《紐約時報》於2023年底對微軟和OpenAI提起訴訟,指控這兩家公司未經許可或支付費用,利用其新聞報道訓練生成式人工智能系統,侵犯了版權法。此後,又有11家出版商加入訴訟,使得最初僅由一家新聞機構發起的訴訟,演變成一場更廣泛的行業挑戰,矛頭直指人工智能公司獲取訓練素材的方式。
西德尼·斯坦法官和保存 ChatGPT 日誌的命令
目前,此案已提交紐約南區地方法院法官西德尼·斯坦審理,隨着更多文件的解封,他正在權衡簡易判決動議。作爲訴訟的一部分,OpenAI 已被責令保存 2000 萬條ChatGPT對話記錄——這一要求凸顯了這場人工智能模型版權糾紛中,取證程序已變得多麼廣泛。
公司立場和技術論證
兩家公司都堅稱他們的 AI 訓練做法在法律上是站得住腳的,儘管他們自己的內部溝通使這種說法變得複雜。
微軟的回應和納德拉關於許可問題的證詞
微軟已試圖與赫克特的備忘錄撇清關係,稱其反映的僅是一位員工的個人分析,而非公司官方政策。該公司表示,赫克特(同時也在西北大學任職)並非決策者,其受僱的目的是“提出不同且不對稱的觀點”。這種措辭在法律上至關重要,因爲它將公司的公開辯護與內部使用的直白措辭區分開來。
然而,微軟首席執行官薩蒂亞·納德拉的證詞更直擊爭議的核心。他在證詞中表示,任何付費內容在用於訓練或構建人工智能系統時,“任何想要使用的人都應該獲得授權”。他還補充說,如果他知道OpenAI使用付費內容進行訓練,他會援引微軟的權利,強制OpenAI重新訓練其模型。微軟發言人後來表示,納德拉的證詞“涉及人們如何查找和使用信息的廣泛原則”——儘管如此,該證詞仍然成爲此案的關鍵證據。這些言論直接指向關於付費內容在人工智能訓練中的應用的爭論,而這個問題如今已成爲出版商法律論證的核心。
OpenAI的合理使用抗辯和內部警告
OpenAI的法律立場基於合理使用原則:該公司辯稱,其訓練過程是將文章轉化爲新的內容,而非替代原文,這一區別在之前的法庭判決中通常對人工智能公司有利。然而,OpenAI員工的言論卻削弱了這一論點:ChatGPT團隊前負責人尼克·特利(Nick Turley)在2023年6月撰文稱,人工智能對出版商構成“生存威脅”,並隨後指出,人工智能產品“隨着技術的進步,其替代性將越來越強”。另一位OpenAI工程師在2023年2月也觀察到,“無論我們如何醒目地展示鏈接,用戶都不會點擊”——這一發現與聊天機器人能夠爲新聞網站帶來有效流量的說法相悖。
最尖銳的內部警告出現在2020年,當時的政策總監傑克·克拉克致信布羅克曼和薩姆·奧特曼,指出OpenAI正在“創建替代社會‘文化’構建者勞動的系統”,並有可能成爲“硅谷不加思考地涉足其他領域,最終卻一團糟的象徵”。克拉克後來離開OpenAI,聯合創立了Anthropic公司,該公司將對此事的置評請求轉回給了OpenAI。
代表《紐約每日新聞》和其他七家報紙的律師史蒂文·利伯曼表示,解封的材料表明“世人終於看清了OpenAI和微軟一直以來對自身行爲公平性的真實想法”。OpenAI和微軟均未對此說法做出公開回應,《紐約時報》也拒絕就相關文件向其記者發表評論。
綜合來看,這些披露表明,法庭之爭不再僅僅是關於人工智能訓練在抽象意義上是否屬於合理使用——而是關於這些公司在訴訟發展到這一階段之前幾年寫下的言論,最終是否會影響法官未來如何定義整個行業的合理使用。
常問問題
微軟員工對人工智能數據抓取表達了哪些與勞動相關的擔憂?
微軟員工討論了 OpenAI 使用新聞文章是否是“人類歷史上最大的勞動力盜竊”,並警告說這會對人工智能模型質量產生負面影響,描述了一種“惡性循環”,這種循環可能會降低基於抓取內容構建的模型的質量。
誰對微軟和OpenAI提起了訴訟?何時提起的?
《紐約時報》於 2023 年底提起訴訟,後來又有 11 家出版商加入。
微軟首席執行官薩蒂亞·納德拉對使用付費內容進行人工智能訓練持何種立場?
薩蒂亞·納德拉作證說,任何想要將付費內容用於訓練或構建人工智能系統的人都應該獲得許可。
OpenAI如何爲其在人工智能訓練中使用受版權保護的材料進行辯護?
OpenAI 認爲,其訓練行爲構成合理使用,因爲它將文章轉化爲新的作品,而不是替代原作。
本文由人工智能輔助生成,並經編輯團隊審覈。