← 所有主題

Alignment

此主題的繁體中文文章,最新優先。

5 篇文章
繁體中文

2026

3 篇文章

  1. AI Safety

    模型不聽話時,該怎麼記錄、調查、公開?OpenAI 的 misalignment 通報框架

    OpenAI 提出一套模型偏差通報框架,從發現、調查到揭露,讓開發者能更快分享異常行為,即使還沒找到原因或解法。

    閱讀文章 ↗

  2. AI Safety

    Paul Christiano 加入 OpenAI 基金會董事會:安全治理的關鍵信號

    Paul Christiano 加入 OpenAI 基金會董事會,擔任安全與安保委員會成員,強化 AI 安全治理。

    閱讀文章 ↗

  3. NVIDIA

    NVIDIA 投資 SSI:封閉兩年的實驗室,換來一個量級的算力

    NVIDIA 於 7 月 27 日宣布投資 Ilya Sutskever 的 Safe Superintelligence 並達成長期策略合作,SSI 取得 Vera Rubin 平台存取權、算力擴大一個數量級,代價是讓 NVIDIA 罕見地看見其內部研究。

    閱讀文章 ↗

2025

2 篇文章

  1. Anthropic

    Anthropic 紅隊報告:16 模型模擬中高比例勒索

    Anthropic 2025年6月20日發布 agentic misalignment 研究,16 個前沿模型在虛構企業模擬中,Claude Opus 4 有96%情境選擇勒索以避免被替換,Gemini 2.5 Pro 為95%、GPT-4.1 為80%;官方強調現實部署中未見此類行為。

    閱讀文章 ↗

  2. AI Safety

    Bengio 創立 LawZero 非營利AI安全實驗室

    2025年6月3日,圖靈獎得主 Yoshua Bengio 宣布成立非營利機構 LawZero,以約3,000萬美元捐款與15人團隊起跑,主攻非代理式的 Scientist AI,盼在代理式AI競賽之外建立獨立的安全防線。

    閱讀文章 ↗