DISPATCH №0904 / 2026-09-04 / MORNING EDITION / 08 ITEMS / BUILD 20260904.0806 / LIVE / CURATED BY 泉水亮介
VCB News & Post Headline
JST · 08:06 · THU
MORNING DISPATCH · THURSDAY · SEPTEMBER 4, 2026

2026.09.04

GPT-6 · Cursorの自社マシン実行 · Codex · Qwen3.8-Max 08 ITEMS · READ 4 min
フロンティアモデル / OPENAI公式 / OPENAI公式X / NEWS

GPT-6 Astra、長期作業の文脈を「圧縮」から「記録と検索」へ

GPT-6 Astra、長期作業の文脈を「圧縮」から「記録と検索」へ

OpenAIはGPT-6 Astraの段階提供を始めた。性能向上に加えて、Codexでは文脈窓が埋まった後も作業メモを残し、過去の会話やツール出力を検索して要件やテスト結果を取り戻す実験機能が入る。

キーポイント

  • 一部組織から始め、今後数日でChatGPT Plus、Pro、Business、Enterprise、API、Amazon Bedrockへ広げる
  • APIのモデルIDはgpt-6-astra。標準価格は100万トークン当たり入力10ドル、出力50ドル
  • Codexでは過去の文脈窓を検索でき、compactionで落ちやすかった失敗理由や要件を取り戻せる
  • OSWorld 2.0は72.6%。模擬所要時間はGPT-5.6 Solの約75分から約40分になったとOpenAIが報告
  • Enterpriseは初期状態で無効。高度なサイバー作業では監視により正当な作業も止まる場合がある
長時間エージェントは、作業の経緯と検証結果を失わずに終えられるかで評価する。価格に加えて、文脈の保持方式と安全監視による中断も実務テストに入れたい。
エージェント基盤 / CURSOR公式 / CURSOR公式X / NEWS

Cursorの自社マシン実行、コードは社内、推論はクラウド

Cursorの自社マシン実行、コードは社内、推論はクラウド

CursorはCloud Agentsのファイル編集やコマンド実行を、利用者が管理するマシンで動かせるようにした。コードとシークレットは自社環境に置けるが、推論、計画、エージェントループはCursorクラウドに残るため、名称だけで完全なオンプレミス運用とは判断できない。

キーポイント

  • 自社workerからCursorクラウドへ外向きのHTTPS接続を張り、Cursor側から社内ネットワークへの接続開始を避ける
  • 個人向けのMy Machinesと、需要に応じてworkerを増減するチーム向けPoolsを提供
  • workerの休止とスナップショット復帰に対応
  • AWS Lambda、Cloudflare、Coder、Daytona、E2B、Modal、Namespace、Vercelなどに対応
  • ツール出力は推論に使われ、会話はCursor側で処理・保存される場合がある
企業が確認すべき境界は、「セルフホスト」という呼称より、コード、シークレット、ツール出力、会話、推論がそれぞれどこを通るかだ。導入審査ではデータの移動経路を層ごとに図示したい。
開発者ツール / OPENAI公式 / GITHUB / NEWS

Codex CLI 0.153.0、切断後も二重実行せずに戻る

Codex CLI 0.153.0、切断後も二重実行せずに戻る

OpenAIはCodex CLI 0.153.0で、リモートマーケットプレイスからプラグインを管理するCLIと、アプリサーバー切断後のセッション再接続を追加した。送信状態が不明な要求を自動で再実行せず、人の確認へ回す設計が長時間運用の事故を減らす。

キーポイント

  • プラグインの一覧、導入、削除をCLIから行える
  • 再接続時に下書きと会話を保ち、結果が不明な要求は確認待ちに置く
  • Guardianのレビュー履歴をcompaction、再起動、フォークをまたいで維持する
  • 記憶済みのMCPツール承認を選択中のアプリアカウント単位へ限定
  • auto_recap設定、Vimモードのundoとredo、履歴表示の改善も含む
長時間エージェントでは、新機能よりも再接続と重複防止が運用品質を左右する。止まった後にどこから安全に再開できるかを、成功時と同じ重さで設計したい。
フロンティアモデル / ALIBABA CLOUD公式 / QWEN公式X / NEWS

Qwen3.8-Max、2.4兆パラメーターで10日超の開発を掲げる

Qwen3.8-Max、2.4兆パラメーターで10日超の開発を掲げる

Alibaba CloudはQwen3.8-Maxを2.4兆パラメーターのMoEモデルとして公開した。画像、動画、テキストを入力でき、100万トークンの文脈と最大262,144トークンの出力を備え、10日を超える自律コーディングをうたう。

キーポイント

  • 国際向けモデルIDはqwen3.8-maxで、東京、バージニア、フランクフルトなどから利用できる
  • Function Calling、Structured Outputs、Context Caching、Prefix Completionに対応
  • 中国リージョンと国際リージョンではWeb SearchやBatch Inferenceなどの対応範囲が異なる
  • Fine-tuningは非対応
  • 10日超とproduction-gradeはベンダーの表現で、タスクと完成判定の条件は非公開
長く動いたことと、仕事を正しく終えたことは別だ。長期モデルは完了条件、検証回数、中断復帰、消費トークンをそろえた代表タスクで比べたい。
コンテキスト工学 / MICROSOFT AZURE公式 / NEWS

Microsoftのコンテキスト設計、安いモデルより先に毎回送る情報を減らす

Microsoftのコンテキスト設計、安いモデルより先に毎回送る情報を減らす

Microsoftは、モデルが毎ターン見る指示、ツール、文書、履歴を選び直すことを、エージェントの費用と品質を改善する中心手段に挙げた。長期作業では不要な情報の再送が費用を増やし、必要な事実も埋もれさせるため、ツール選択の誤りややり直しまで招く。

キーポイント

  • モデル自体は記憶を持たず、毎ターンのコンテキスト再送が長期タスクの費用を膨らませる
  • 実行履歴、利用可能な情報、ツール一覧は作業が続くほど増える
  • 情報量を増やしても品質は保証されず、関連性と検索しやすさが重要になる
  • Microsoft Foundry上のAIを管理された投資として運用する4回シリーズの第3回
モデルの単価を比べる前に、毎ターン送る文書とツール定義を見直せる。トークン量と完了までのターン数を同時に測ると、費用と品質の両方を悪化させる文脈が見つかる。
ループ工学 / GITHUB公式 / GITHUB公式X / NEWS

ループエンジニアリング、GitHubが示す「合格と停止」の設計

ループエンジニアリング、GitHubが示す「合格と停止」の設計

GitHubはループエンジニアリングを、単発の指示から、エージェントを囲む反復可能な仕組みへ移す実践として整理した。毎朝のissue確認なら、取得、要約、修正案、検証、停滞時のエスカレーションまでを一つの運用として設計する。

キーポイント

  • Ralph loopをplan、act、checkの反復例とし、文脈や計算資源を消費する限界も示す
  • Skills、観測性、検証、ルーティング、チェックポイントを加えて単なる再試行と分ける
  • squadは役割を分けた複数エージェント、fleetは並列実行を指す
  • harnessはモデル周辺のツール、権限、メモリ、文脈、オーケストレーションの総体
  • hill climbingは評価結果を使い、エージェントとharnessを改善する反復を指す
ループの本体は、成功するまで同じ指示を回すことではない。何を見て合格とするか、どこで止めるか、誰へ渡すかを仕組みに落とすことが成果を分ける。
エンタープライズAI / DATABRICKS公式 / NEWS

Databricksの2万組織調査、本番化を分けるのは評価とガバナンス

Databricksの2万組織調査、本番化を分けるのは評価とガバナンス

Databricksは自社のData + AI Platformを使う2万超の組織を対象に、AIエージェントの利用状況をまとめた。複数エージェントシステムが4カ月未満で327%増え、評価ツールやAIガバナンスを使う組織ほどAIプロジェクトの本番化率が高いと報告している。

キーポイント

  • 対象は世界2万超の利用組織で、Fortune 500の60%超を含むとDatabricksが説明
  • 複数エージェントシステムは4カ月未満で327%増加
  • 評価ツールを使う企業はAIプロジェクトの本番化が約6倍と報告
  • AIガバナンスを使う企業は本番化が12倍超と報告
  • 6倍と12倍超は相関であり、評価やガバナンス単独の因果効果とは断定できない
デモやエージェント数を増やすだけでは本番化につながらない。評価の実行率、承認の証跡、監査可能性を、導入件数と並ぶ成果指標にしたい。
開発事例 / COJI 溝口浩二 / ARTIFACT SHARE / BOOKMARK

ひとりソフトウェアファクトリー、コードを読まなくてもゲートは二重にする

ひとりソフトウェアファクトリー、コードを読まなくてもゲートは二重にする

溝口浩二氏は、1人でCodexとClaude Codeを使い、Artifact Shareを開発する工程と実績を公開した。人はコードやレビュー本文を読まず、同一仕様・同一コミットに対する二重レビュー、CI、最初と最後の判断へ注意を絞る一方、本番不具合も9件出たと明示している。

キーポイント

  • 4カ月でTypeScript約25万行、Pull Request 1,144件、Issue 777件に達した
  • 公開後4週間で233件をマージし、revertは0件、本番不具合は9件だった
  • 仕様と実装をCodexとClaude Codeで並列レビューし、両方のblockerがゼロになるまで回す
  • 同じクラスの指摘は3巡で打ち切り、2巡目以降は直前からの差分だけを見る
  • 先送りした指摘はマージ後にissue化、規則化、修正、理由付き破棄のいずれかへ処分する
コードを読む作業を減らしても、品質確認は残る。人の注意を判断とゲート設計へ移し、売上や開発量と同時に、不具合、レビュー負荷、先送りの残高も測ると再現性を判断しやすい。
📄 PDFをダウンロード 🧵 X スレッドで読む