DISPATCH №0905 / 2026-09-05 / MORNING EDITION / 08 ITEMS / BUILD 20260905.0731 / LIVE / CURATED BY 泉水亮介
VCB News & Post Headline
JST · 07:31 · FRI
MORNING DISPATCH · FRIDAY · SEPTEMBER 5, 2026

2026.09.05

Muse · Claude · GPT-6 · Cursor 08 ITEMS · READ 4 min
フロンティアモデル / ARTIFICIAL ANALYSIS / VERCEL / NEWS

Muse Spark 1.3は指数61、同水準モデルで最安のタスク単価

Muse Spark 1.3は指数61、同水準モデルで最安のタスク単価

MetaのMuse Spark 1.3は、Artificial Analysis Intelligence Indexで一般提供のxhighが61、限定プレビューのmaxが62を記録した。xhighは前世代から4ポイント伸び、指数59以上では評価タスク当たりのコストが最も低い0.55ドルだった。

キーポイント

  • xhighのAPI価格は100万トークン当たり入力1.25ドル、出力4.25ドル、キャッシュ入力0.15ドルで据え置き
  • Tau3-Bench Bankingは前世代の35%から47%、Terminal-Bench 2.1は80%から85%へ上昇
  • 100万トークンのコンテキストと、テキスト・画像・動画入力に対応
  • maxはTau3-Bench Bankingで52%を記録したが、価格は未公表
  • AA-LCRは前世代から4ポイント下がり、すべての評価で改善したわけではない
モデルの単価だけでなく、完了までのターン数を含むタスク単価で比較できる材料が増えた。同じ課題を複数モデルで走らせ、品質、費用、所要時間を一緒に測りたい。
AI開発ツール / ANTHROPIC公式GITHUB / NEWS

Claude Code 2.1.260、差分確認と権限境界を同時に修正

Claude Code 2.1.260、差分確認と権限境界を同時に修正

Claude Code 2.1.260では、会話の横に未コミット差分を出すパネルが加わった。括弧を含むパスの権限ルールが無視され、読み取り専用フォルダへ書き込める不具合も修正されている。

キーポイント

  • フルスクリーンの/diffで、Claudeが編集中の差分を会話と並べて確認できる
  • Edit、Write、Readの括弧付きパスが権限判定から落ちる不具合を修正
  • 正規表現として解釈できない拒否ルールは、すべての編集を止めずリテラルパスを守る
  • /costとステータス行に、ツール定義の変更やTTL切れなどキャッシュミスの想定原因を表示
  • ヘッドレス実行へ/reload-pluginsとテキスト形式の/advisorを追加
長時間の開発ループでは、差分を追えることと権限が設定どおり効くことが品質の前提になる。便利な新機能だけでなく、読み取り専用領域へ実際に書けないかも回帰テストへ入れたい。
モデル提供基盤 / VERCEL / OPENAI公式GITHUB / NEWS

GPT-6 Astra、Vercel AI GatewayとAmazon Bedrockへ接続先を拡大

GPT-6 Astra、Vercel AI GatewayとAmazon Bedrockへ接続先を拡大

GPT-6 Astraを既存の開発エージェントから呼ぶ経路が広がった。Vercel AI Gatewayではopenai/gpt-6-astraをCodexやHermesから選べ、Codex CLI 0.153.3ではAmazon BedrockのMantleとRuntimeのモデル選択画面へ追加された。

キーポイント

  • Vercel AI GatewayはAI SDK、Chat Completions互換API、Codex、Hermesの設定例を公開
  • vercel ai-gateway coding-agents setupで既存エージェントへ同じゲートウェイキーを設定できる
  • Codex CLI 0.153.3はBedrockのglobalルートとUSルートのモデル選択に対応
  • 0.153.3は非同期の確認質問を、対応ツールとテキスト入力へ合わせる修正も含む
  • モデル本体の性能ではなく、企業向けの接続経路がそろった点が今回の更新
新モデルを試すとき、認証、課金、観測を作り直さずに切り替えられる経路があると比較が速い。導入先ではモデル名だけでなく、どのクラウドとゲートウェイを通るかを記録したい。
エージェント実行基盤 / VERCEL / CURSOR / NEWS

Cursor Cloud Agentsの実行先にVercel Sandbox

Cursor Cloud Agentsの実行先にVercel Sandbox

Cursor Cloud Agentsのコード実行環境をVercel Sandboxに置く構成が公開された。推論ループとエージェント制御はCursorが担い、リポジトリ操作、コマンド、テストはリクエストごとのFirecracker microVMで動く。

キーポイント

  • CursorのSelf-Hosted Machines APIを使うため、対象はEnterpriseプラン
  • Vercel FunctionsとWorkflowがキュー取得、環境作成、監視、後片付けを担う
  • エージェント要求ごとに独立したSandboxを割り当てる
  • 常駐VMを持たないscale-to-zeroと、失敗時の永続的な再試行に対応
  • Sandbox内の資格情報は短命で、利用者ごとのスコープに絞る
セルフホストという呼び名だけではデータ境界は分からない。コード実行、推論、会話、資格情報がどこに置かれるかを層ごとに確認すると、企業導入の審査が具体的になる。
AI×デザイン / FIGMA / COINBASE DESIGN SYSTEM / NEWS

CoinbaseのCode Connect検証、実装時間を22.3%短縮

CoinbaseのCode Connect検証、実装時間を22.3%短縮

Coinbase Design Systemチームは、FigmaのCode Connectをコーディングエージェントへ渡す比較実験を行った。同じデザイン、同じ曖昧な指示、同じモデルで比べ、平均でトークン11.5%、実装時間22.3%、費用22.5%を削減したと報告している。

キーポイント

  • Code ConnectはFigma上の部品を本番コードのコンポーネントへ対応づける
  • 導入後は既存部品の選択が安定し、アイコン名の作り話もほぼ消えた
  • 数百コンポーネントの対応表をClaude Codeで並列移行し、約4時間で全体をそろえた
  • エージェントSkillは実装方針、Code Connectはデザイン起点の文脈を担当する
  • 評価はSonnet 4.6、空のコードベース、3回の比較で実施した社内検証
デザインからコードへの変換は、生成モデルの見た目より既存部品への正しい対応づけが効く。Skillと設計データを役割分担させると、品質と費用を同時に改善できる可能性がある。
デスクトップエージェント / CLAUDE公式X / ANTHROPICサポート / BOOKMARK

Claudeがバックグラウンドでデスクトップを操作

Claudeがバックグラウンドでデスクトップを操作

Claude CoworkとClaude Codeで、アプリを開き、クリックし、文字を入力するcomputer useがベータ提供された。macOS 15以降では別ウィンドウで動き、人がマウスとキーボードを使っている間も作業を続けられる。

キーポイント

  • 対象はClaude DesktopのmacOS版とWindows版、Pro・Maxプラン
  • コネクタ、ブラウザ、画面操作の順に適した手段を選ぶ
  • アプリごとに初回許可が必要で、一部の機密性が高いアプリは初期状態で遮断される
  • 画面を理解するためスクリーンショットを取得し、表示中の個人情報も見える可能性がある
  • デスクトップにはClaudeとアプリの間を隔離するサンドボックスがなく、金融、医療、法務の操作は非推奨
デスクトップ操作の自動化は、専用APIがない業務にも届く。その分、許可するアプリ、画面に出す情報、人が確認する操作を先に決めてから使う必要がある。
AI×ビジネス活用 / CLAUDE DEVELOPERS公式X / ANTHROPIC / BOOKMARK

Claude Commerce Agents、4業種の参照実装を公開

Claude Commerce Agents、4業種の参照実装を公開

Anthropicは買い物客向けと店舗運営向けのエージェントを、オープンソースの参照実装として公開した。小売、旅行、通信、エンターテインメントのデモに加え、既存バックエンドへつなぐClaude Codeプラグインを含む。

キーポイント

  • 買い物エージェントは検索、比較、カート、注文・規約の案内、記憶を担当
  • 店舗運営エージェントは売上分析、在庫、価格、販促案を扱い、書き込みは人の承認まで保留する
  • Messages API、Claude Agent SDK、Managed Agentsで同じSkillとツール契約を使える
  • 参照実装は実在の注文や決済を行わず、認証と法令対応は導入側の責任
  • 導入企業ではカート金額が最大35%増え、購入完了率が60%高まった事例があるとAnthropicが説明
業務エージェントを作るとき、デモだけでなく承認、出典確認、変更上限、評価まで含む土台を参照できる。VBCでは、読み取りと書き込みの境界を教材にしやすい。
フロンティアモデル / GOOGLE公式X / VERCEL / BOOKMARK

Gemini 3.8 Flashは速度と価格帯を維持して推論を更新

Gemini 3.8 Flashは速度と価格帯を維持して推論を更新

GoogleはGemini 3.8 Flashと、サイバー防御向けのGemini 3.8 Flash Cyberを公開した。Flashは3.7の速度と低価格帯を保ちながら、コーディング、長時間のエージェント処理、多段推論を伸ばしたとしている。

キーポイント

  • 開発者はGoogle Antigravity、Google AI Studio、Android Studioから利用できる
  • 企業向けはGemini Enterprise、一般向けはGoogle AI Pro・Ultraや検索のAI Modeなどへ展開
  • Vercel AI Gatewayでもgoogle/gemini-3.8-flashとして利用可能
  • Vercelの設定ツールはClaude Code、Codex、Cursorなどへ同じゲートウェイキーを接続できる
  • Flash Cyberはサイバー防御に特化した別モデルとして案内された
高速モデルでも、単発回答だけでなく長く続く作業が比較対象になった。既存の軽量モデルと同じ課題を走らせ、途中の要件保持と完了までの費用を測りたい。
📄 PDFをダウンロード 🧵 X スレッドで読む