Flow(プロダクト)に関するニュース一覧

BairesDev、開発者42%がコード半分以上をAI生成

利用拡大と時短

半分以上をAI生成42%
週13時間の記述時間短縮
新規記述が週半分超は21%

検証負荷の増加

レビュー増加67%
AI由来の修正増加52%
CTOの78%が検証費増額

役割と能力

週9時間の技術学習
出荷判断の全面委任7%

BairesDevは2026年9月15日、60超の国の開発者705人と最高技術責任者41人を対象にした2026年第3四半期調査を公表しました。AIがコードの半分以上を書くとの回答は前年同期の12%から42%へ上昇しました。一方、浮いた時間はレビュー、修正、安全確認や新技術学習へ移っており、開発の瓶頸が生成から検証へ移りつつあります。

開発者がAIで節約したとするコーディング時間は週13時間で、前年の約7時間からほぼ倍増しました。しかし、週の半分超を新しいコードをゼロから書く作業に使う人は21%にとどまります。前年よりAI生成コードのレビュー時間が増えた人は67%、AIが生んだ問題の修正時間が増えた人は52%で、新技術の学習も週4時間から9時間へ増えました。

企業も人間による確認へ資源を移しています。調査対象の最高技術責任者41人のうち78%は、AI生成物を支えるコードレビュー品質保証、検証への支出を増やしました。出荷判断を人の関与なしでAIへ全面委任した開発者は7%だけで、BairesDevの最高経営責任者は、AIの生成比率が上がっても開発者の説明責任は100%に近づくとみています。

他の大規模調査も、利用拡大と信頼の差を示しています。Stack Overflowの4万9,000人超の調査では80%がAIツールを利用した一方、精度を信頼したのは29%で、66%は「ほぼ正しい」コードの修正に時間を使っていました。JetBrainsの1万5,000人超の調査では、90%が仕事でAIコーディングエージェントを週1回以上使い、68%は毎日利用していました。

役割の変化は満足度と報酬にも表れています。AIで仕事が充実したとの回答は前年の76%から86%へ上がり、2026年に昇給した開発者では29%がAIツールの習熟、20%がシステム設計・構成、15%が対人能力を理由に挙げました。ただし、対人能力の育成に積極投資する最高技術責任者は4人に1人にとどまります。

調査結果には標本上の注意が必要です。開発者705人の大半はBairesDevの選考に参加する応募者で、同社の従業員ではなく、最高技術責任者の標本も41人と小規模です。それでも、企業が確認すべき論点は明確で、生成量だけで生産性を測らず、レビュー、安全性、説明可能な判断へ移った時間と費用を合わせて捉える必要があります。

MIT、制約順守と品質を両立する生成AI手法

制約は最後に適用

中間生成の自由度確保
最終出力での制約順守
追加目標との同時最適化

幅広い実験で検証

制約順守率100%
経路時間の短縮
既存手法以上の品質
再学習不要の導入性

米マサチューセッツ工科大学(MIT)の研究チームは2026年9月14日、安全性が重要な用途で生成AIに厳格な制約を守らせつつ、出力品質も高める手法「HardFlow」を発表しました。ロボット操作、迷路走行、文章指示による画像編集の実験で、すべての制約を満たし、既存手法より質の高い解を安定して得ました。事前学習済みモデルを再学習せず、導入時に適用できます。

従来の射影ベースのサンプリングは、生成途中の解にも制約を繰り返し課します。その結果、モデルがより良い最終解へ到達する余地を狭め、例えば衝突を避けながらロボットの移動距離を短くするといった品質目標を十分に追えない場合がありました。

HardFlowは、制約付き生成を最適制御の軌道最適化として捉え直します。途中では小さな修正を加えながら探索の自由を保ち、最終出力で安全規則や物理法則などの厳格な条件を満たす設計です。

研究チームは、フローマッチングモデルの構造を利用し、巨大なニューラルネットワークを扱う最適化問題を一連の小さな1ステップ問題へ分解しました。これにより、実行時に効率よく解ける拡張性のあるアルゴリズムとし、計算時間も多くの比較手法と同等以下に抑えました。

実験では、ロボットアームが障害物との衝突を避けながら、対象物までの最短経路を見つけました。再学習不要のため既存の生成モデルへ適用しやすく、研究チームは今後、モデル自体も更新して制約順守と品質をさらに適応的に改善する方向を検討します。

Gradio、73ノードで11種のAI工程を統合

一枚の処理設計図

11工程を73ノードで構成
4種の演算子を共通化

並列と端末内処理

同階層ノードの並列実行
22ノードが端末内で動作

APIとして展開

9出力をREST化
全出力のMCPツール化

Hugging Faceは2026年9月10日、ブラウザー上のノードグラフ「Workflow1111」を公式ブログで紹介しました。AUTOMATIC1111風の画像動画処理11系統を73ノードで再現し、テキスト画像生成から高解像度化、物体検出、動画化までを単一キャンバスに統合します。利用者はHugging Face認証し、自分の推論枠で各モデルを呼び出せます。

基盤はPython関数のfn、推論モデルのmodel、別のGradio Spaceを呼ぶspace、Hubデータセットの行を使うdatasetという4種類の演算子です。入力と出力をポートとして結ぶだけで、LLM、画像生成、VLM、検出、動画生成を同じグラフに配置できます。

同じ依存段階のノードは自動で並列実行されます。画像から生成プロンプトを作るVLMと分類器を同時に走らせるほか、4種のプロンプト行列も一斉に画像化し、追加の並列制御コードを不要にしています。

ネットワーク依存も抑えています。36個の演算子ノードのうち32個がfnで、22個はPillowやNumPyなどを使って端末内だけで動作するため、接続を失ってもキャンバスのおよそ3分の2は利用できます。外部モデルはInference ProvidersやSpaceへ委ねる一方、fnにはローカルGPUのモデルも結び付けられます。

各出力ノードは型付きRESTエンドポイントになり、Workflow1111では9本を公開しています。MCPサーバーを有効にすれば同じ出力がAIアシスタント向けツールになり、呼び出し元ごとのトークンで画像生成や検出を組み込めます。企業の開発者にとって、可視化、実行、API公開を一つの設計図で管理できる点が実装上の要点です。

InMarket、正常稼働でも40%誤集計

見逃した異常

11日間の未検知
顧客指標40%の誤差

原因と監視の盲点

上流の項目名変更
構造監視への偏重

入口で食い止める

取り込み時のスキーマ検証
業務指標の常時監視

Salesforceで企業向けデータ移行基盤を手がけるSiddharth Arun氏は2026年9月6日、InMarket在籍時の広告データ基盤が、処理エラーなしで11日間にわたり顧客向けオーディエンス数を40%誤って算出した経験を明らかにしました。上流の広告ネットワークによる項目名変更でSparkの結合キーが一致しなくなりましたが、Airflowなどの稼働監視は異常を検知できませんでした。

InMarketの基盤は、日々数十億件、合計1PB超の位置情報・広告イベントをS3、Spark、AirflowSnowflakeで処理していました。規模が大きいほど40%の減少も通常の変動に紛れ、顧客がキャンペーン不振を指摘するまで発覚しにくくなります。

別の事例では、日付パーティションだけが作られ実データが届かなかったため、空の結果を正常として書き出し、3日分のデータが消えました。DAG完了やパーティションの存在といった構造上の確認は、数字の意味が正しいかを保証しません。

Arun氏が提案する対策は、変換後ではなく取り込み時点で入力スキーマを登録内容と照合することです。入口で不一致を早期に検知すれば、誤ったデータが下流へ11日間広がる事態を防ぎやすくなります。

監視対象には、オーディエンス数、最終ロードからの経過時間、スキーマ検証結果、ファイル数・容量、SLA達成状況を含めます。筆者は、処理速度や稼働率だけでなく、業務上の正しさを第一級の運用指標にすべきだと訴えます。

今後、AIエージェントがスキーマ変更対応や再処理を担っても、数値の誤りを判定する基準がなければ問題は残ります。まず正常なデータと業務上の不変条件を定義し、一つでも意味の検査を加えることが実践的な第一歩です。

Google、Lyria 3.5をGeminiで世界提供

音質と表現力

表現豊かな歌声
厚みのある楽曲編成
高忠実度の音楽生成

Geminiでの制作

簡単なジャンル指定
歌唱・器楽の選択肢
長短を選べる楽曲尺

広がる提供先

世界の全利用者に提供
APIと制作ツール展開

Googleは2026年9月4日、音楽生成モデル「Lyria 3.5」をGeminiアプリとGemini APIで提供すると発表しました。歌声の表現力と編曲の豊かさを高め、より忠実度の高い楽曲制作に対応します。Geminiアプリのウェブ版とモバイル版では世界中の全ユーザーが利用でき、動画用の伴奏、ブランド用ジングル、個人向け着信音などを想定用途に挙げています。

GoogleはLyria 3.5を自社で最も音質の良い音楽生成モデルと位置づけています。従来より表現豊かなボーカルと厚みのある編曲を生成し、より高い忠実度でトラックを仕上げられると説明しています。

Geminiアプリでは、ジャンルを選ぶか文章で説明し、ボーカル曲とインストゥルメンタル曲を選択できます。新しいテンプレートからBGMや誕生日向け楽曲を作り始められ、短い曲と長い曲も選べます。

Lyria 3.5の提供先はGeminiアプリとAPIにとどまりません。アーティストやAIクリエイター向けのGoogle Flow Music、開発者・技術者向けのGoogle AI Studio、Google Vidsでも利用できます。

中国政府系集団、ホテル侵入で幹部PCを侵害

ホテルでの侵害手口

客室への物理侵入
USB起動での書き込み
起動後の情報窃取

監視の空白と対策

OS起動前の監視空白
外部起動禁止の徹底
起動前認証の導入

海外出張時の備え

BIOS設定の固定
旅行専用端末の配備

クラウドストライクは2026年3〜5月、中国・海南島の農業会議で、中国政府系とみるOVERCAST PANDAが、夕食中の幹部のホテル客室に侵入し、USBからノートPCを起動してバックドア「FlowCloud」をストレージへ書き込んだと報告しました。フィッシングやネットワーク侵入を使わず、OSやEDRが動き出す前に端末を改ざんし、翌朝の起動後に情報窃取を始めた手口です。

侵入者は午後8時ごろに1室、午後9時57分までに別の1室へ入り、FlowCloudと起動後のトリガーを配置しました。端末の次回起動でキーロギング、画面取得、ファイル収集、認証情報の窃取が始まり、Falconはプロセス起動後に検知しました。

盲点は、EDRやMFAが動作する前のOS起動前です。Falconは起動後にFlowCloudを捉えましたが、USB書き込みから次回起動までの数時間は、既に侵害されながら検知できない空白でした。

防御の軸は、UEFIで外部起動と一時起動メニューを無効にし、BIOS管理者パスワードで設定を固定することです。フルディスク暗号化に起動前認証を組み合わせ、Secure Bootと失効リストを最新に保つことで、無人時の改ざんリスクを抑えられます。

企業向けの提案として、国際会議には本番環境への接続、保存済み認証情報、常設VPN設定を持たない旅行専用端末を配り、帰国後に初期化する運用が挙げられています。物理侵入は大規模化しにくい一方、特定の幹部を狙う場面ではネットワーク防御外の盲点を突くため、情報システム部門と物理セキュリティ部門をまたぐ出張端末管理が課題です。

IBMとConfluent、時系列AIを早期提供

提供形態

AWS上での早期提供
Flink SQLから実行
オンプレ版は今後

利用できる機能

需要などの予測
異常検知と分類
欠損補完と最適化

運用面の利点

モデル基盤の管理不要
権限・履歴管理の継承

IBMとConfluentは2026年9月2日、IBM Graniteの時系列基盤モデルをConfluent Cloud上のApache Flinkから直接使える早期アクセスとして提供開始しました。企業は流れているデータを別の機械学習基盤へ移さず、SQLで予測と異常検知を呼び出し、結果をKafkaの配信先を通じて警告、画面、データ基盤、AIエージェントへ渡せます。

時系列基盤モデルは、個別に学習していない系列にも適用し、予測、異常検知、類似検索、分類、欠損補完、最適化を共通機能として提供します。早期アクセスでは「AI_FORECAST」と「AI_DETECT_ANOMALIES」という2つのFlink SQL関数から呼び出し、引数を変えてモデルを選べます。

Flinkは系列ごとの直近の状態を障害に耐えられる形で保持し、モデルが必要な履歴を別のデータベースなしで渡します。Confluentがモデル配信、拡張、実行環境を管理し、データは同社のクラウド内に保ったまま既存の形式定義、来歴、権限管理を推論処理にも適用できます。

製品群は4モデルで、PatchTST-FMは予測値の分布、FlowStateは間隔の異なる連続データ、TTMはCPUでの大量処理を重視します。TSPulseは時間と周波数の特徴を組み合わせ、異常検知、分類、欠損補完、過去の類似事例検索を担います。

IBMは自社業務に加え、セメント、鉄鋼、製紙、食品、通信分野の協力企業でモデルを試したとしています。同社によると、生産性5~10倍に向上し、専門のデータ科学者を待っていた分析を需要計画や不正対策、工程管理の担当者が扱えるようになりました。

早期アクセスはAWS上のConfluent Cloudで利用でき、期間中は無料です。次にConfluent Platformへ広げ、社内設置型と複数環境を組み合わせた運用にも同じモデルと機能を提供する計画です。

Vercel、新インフラ不要のワークフローSDK公開

インフラ不要の設計

新規インフラが不要に
TypeScriptで記述
Temporal運用を簡素化

hookで入出力を統一

hookで入出力を一本化
Webhookも1行で生成

選べるバックエンド

複数DBに対応可能
v5ベータで最大5倍高速化
OSSとして無償公開

Vercelは8月27日、TypeScriptコードのまま耐障害性のあるワークフローを構築できるオープンソースライブラリ「Workflow SDK」を公開したと発表しました。既存のワークフローエンジンが専用サーバーやワーカー管理など複雑なインフラを要求していた課題を解消し、新たなインフラを追加せずに長時間実行の処理を安全に扱えるようにしています。

同氏はVercel入社前、Temporalのフォークを半年ほど個人開発していましたが、快適な開発体験を実現するには実行環境そのものを自社で持つ必要があると気づいたといいます。Temporalは強力な一方、サーバー群の構築やワーカーの常時稼働、暗号化通信の設定など、動かすまでに多くの準備が必要でした。バージョンが異なるコードが実行中のワークフローと衝突する問題も、運用を難しくしていたと振り返ります。

Workflow SDKでは、関数の先頭に"use workflow"や"use step"と書くだけで、通常のTypeScript関数がそのまま耐障害性のある処理単位になります。コンパイラがコードを解析し、ワークフロー用とステップ用のバンドルに自動で分割する仕組みです。信号・照会・更新という3つの仕組みに分かれていた既存の入出力手段も、"hook"という単一の概念に統合し、Webhookの生成すらも1行で完結できるようにしました。

バックエンドは特定の技術に縛られず、Postgres、Redis、Vercel Queuesなど、既に利用しているインフラをそのまま流用できる設計です。Vercel自身が提供するワークフローサーバーも、状態を持たないただのCRUD APIにすぎず、処理の実体はオープンソースのクライアントライブラリ側にあります。同社はこの仕組みをApacheライセンスで公開し、誰でも中身を確認し拡張できるようにしたとしています。

パフォーマンス面では、ベータ版のWorkflow v5が既存APIを変更せずに最大5倍の高速化を実現したとしています。次期のv6ではサードパーティのバックエンドでも同等の速度を目指すとしており、開発は今後もGitHub上の議論を通じて公開で進める方針です。npmから"workflow@beta"を導入すれば、現時点でも試用できる状態にあるといいます。

Gemini Omni Flash、動画制御機能を強化

追加された制御機能

シーンを最大40秒に延長
始点・終点フレームを指定可能
360pで高速に下書き生成
4K解像度へアップスケール

展開状況

AI Studioで先行提供開始
企業向けAPIでも提供
Google Flowにも同時反映
有料プラン会員に無償提供

Google(グーグル)は27日、動画生成AI「Gemini Omni」の最新版「Omni 1.1 Flash」を発表しました。開発者向けのGemini APIや一般ユーザー向けのGoogle Flowを通じて同日から提供を開始し、動画生成をより細かく制御できる新機能を追加しています。プロ用途での本番運用に耐える完成度を目指した更新です。

目玉機能の一つが、動画の続きを生成する「シーン延長」です。従来モデルが直前1秒のみを参照していたのに対し、Omni 1.1は最大10秒分の文脈を解析できるようになりました。これにより映像の一貫性や物語の整合性が向上し、10秒単位で最大40秒までの長尺動画を生成できます。

開始フレームと終了フレームを指定するだけで、その間をなめらかに補完する機能も搭載しました。複雑なカメラワークや途切れのないループ映像の制作に向いています。さらに最大3秒分の動画を参照素材として取り込み、キャラクターや構図の一貫性を保ったまま新しい映像を生成できる機能も加わりました。

制作効率を高める仕組みも強化されています。プレビュー用途では360p解像度で従来より最大60%高速かつ720p出力の3分の1のコストで下書きを生成でき、気に入った案だけを4K解像度まで高画質化できます。試作から本番までの工程を一つのワークフローで完結できる設計です。

Omni 1.1 FlashはGoogle AI StudioのGemini APIや企業向けのAgent Platform APIを通じて開発者に提供されるほか、Google AI Plus・Pro・Ultraの有料会員にはGoogle FlowGeminiアプリでも無償で開放されます。Adobe FireflyやFigma Weave、Runwayなど複数のサービスがすでにGemini Omni Flashを組み込み、実運用を進めています。

Hugging Face、Gradioに新機能「gr.Workflow」追加

gr.Workflowとは

Hugging Faceが新機能公開
ノード接続でAI処理を構築
画像編集音声生成に対応

自動でAPI化

出力ごとにRESTエンドポイント生成
Pythonやcurlから呼出し可能
コード不要でAPI公開

GPUも組み込み可能

ZeroGPUGPU処理も実行
データセット分析や動画生成に活用

Hugging Faceは2026年8月25日、オープンソースのWebアプリ構築フレームワークGradioに新機能「gr.Workflow」を追加したと発表しました。画像生成モデルや音声合成、外部の関数などをノードとして接続するだけで、複雑なAIパイプラインを視覚的に組み立てられるのが特徴です。作成した各出力は自動的にREST APIエンドポイントとして公開されるため、コードを書かずにAI機能を外部から呼び出せます。

gr.Workflowのグラフは、入力となる「参照」、処理を担う「操作」、出力となる「被写体」という3種類のノードで構成されます。操作ノードには自作のPython関数のほか、Hugging Face Inference Providers上のモデルや既存のGradio Space、Hubのデータセットなどを指定でき、ポート同士をドラッグでつなぐだけでパイプラインが完成します。

公開されたデモには、画像をアップロードして指示文だけで編集する画像編集パイプラインや、FLUXで生成した画像を背景除去してステッカー化する例、音声合成とLLMを組み合わせてポッドキャストのタイトルと音声を同時生成する例などが含まれます。1つの入力から複数の処理を同時に走らせる「ファンアウト」型の構成も紹介されています。

各出力ノードには専用のRESTエンドポイントが自動で割り当てられ、Pythonのgradio_clientやcurlコマンドから直接呼び出せます。さらに関数ノードに「@spaces.GPU」を付与すれば、実行時のみZeroGPUGPUを確保するため、外部サービスに頼らずSpace内でモデルを動かすことも可能です。

Hugging Faceは今後、gr.Workflowを使って画像生成ツール「AUTOMATIC1111」のような本格的なアプリケーションを構築する手順を解説する記事を公開する予定だとしています。開発者はコードをほとんど書かずに、AIサービスを組み合わせた実用的なツールを短時間で作れるようになりそうです。

Meta AI、Mac版アプリに音声入力と業務連携追加

全アプリ対応の音声入力

全アプリで音声入力に対応
画面認識でQ&A;にも対応
独自のMuse Spark搭載
Googleも同様機能を先行提供

ビジネス向け新機能

Google Workspaceとも連携
広告成果や競合情報を分析
提案書や文書を自動作成

Meta(メタ)は2026年8月20日、Meta AIの新しいMac向けアプリを発表しました。このアプリはシステム全体で使える音声入力機能を搭載しており、あらゆるアプリ上でディクテーションができます。さらに画面の内容を認識して質問に答える機能も備え、独自開発のMuse Sparkモデルが処理を担います。

音声入力機能は、Wispr FlowやSuperwhisper、Monologueといった既存ツールと同様に、どのアプリを使っていてもテキスト入力を音声で行えるものです。同様の機能は米Googleも先月、Mac版Geminiアプリに追加しており、大手各社でシステム全体の音声入力対応が広がっています。

今回の発表は、事業者向けMeta AI機能の拡充とも連動しています。加盟店はInstagramFacebookのアカウント、Meta広告キャンペーン、Google Workspace(Gmail、ドキュメント、スプレッドシートなど)をMeta AIと連携させ、AIアシスタントに問い合わせる形で情報を取得できるようになりました。

連携後は、広告キャンペーンの成果やオーディエンスのエンゲージメント指標、どの投稿が効果的だったかといった分析結果を得られます。公開情報に基づく競合の動向把握も可能で、Meta AIが提案書や文書、スプレッドシートの作成まで代行してくれます。

Metaはこれまでも、WhatsAppInstagramでの自動カスタマーサポートなど、事業者向けAIツールの拡充に注力してきました。2026年第2四半期の決算説明会でCEOのマーク・ザッカーバーグ氏は、企業にエージェントを提供し、業務を代行させる大きな事業機会があると述べています。

Google、Gemini生成物の可視透かしオフ可能に

透かし解除設定

Geminiで透かしオフ可能に
動画編集Flowにも対応
対象は生成AIモデル3種

非表示の透かしは維持

SynthIDは変更なし
C2PAメタデータも継続
検索でAI生成か確認可能

業界の透かし対応

Anthropicはテキストに透かし追加
MetaOpenAIは可視透かし不採用

Google(グーグル)は8月14日、Gemini動画編集ツール「Flow」で生成した画像動画音楽について、目に見える透かしをオフにできる新機能を発表しました。Gemini担当バイスプレジデントのジョシュ・ウッドワード氏がX(旧Twitter)で明らかにしたもので、Nano BananaOmniLyriaで作成したコンテンツが対象となります。プロ利用や創作活動の現場で透かしが使い勝手を下げているとの声を受けた対応です。

新設定は「設定」内の「メディア透かし」からオン・オフを切り替えられ、数日中に順次提供される予定です。対象となるのはGeminiアプリと動画生成ツールのFlowで、今後は検索機能にも対応が広がる見込みです。ただし、目に見える透かしの表示が法律で義務付けられている国では、この機能は利用できません。

目に見える透かしをオフにしても、SynthIDによる不可視の電子透かしと、C2PA標準に基づくメタデータは引き続き埋め込まれます。ウッドワード氏は「創作の自由と安全性のバランスを取る取り組みだ」と説明し、GeminiGoogle検索を使えば画像がAI生成かどうかを今後も確認できるとしています。

Googleはあわせて、C2PAのコンテンツ認証情報をアプリに組み込むためのオープンソースライブラリ「Credentio」も公開しました。開発者はこれを使うことで、独自のアプリにローカルでの真正性検証機能を組み込めるようになります。

今回の発表は、AnthropicがEU規制への対応として、Claudeが生成する文章やファイルに透かしを付与すると発表した直後のタイミングです。OpenAIMeta画像生成AIはもともと目に見える透かしを採用しておらず、各社の透かし戦略の違いが改めて浮き彫りになりました。

Google、Gemini Omniの開発者作例5件を公開

作例の内容

約20視点へのカメラ切替
音声のみで昼夜と天候変更
落書き起点の実写風動画
1本で4種の画風切替

業務での応用

公園の造園前後比較提案
解説役のアニメ講師

提供チャネル

Gemini/Flowで提供
APIとAI Studio対応

Googleは2026年8月7日、公式ブログで動画生成モデルGemini Omniを使った開発者の作例5件を公開しました。Omniは今年のI/Oで発表された新ファミリーの第1弾で、テキストや画像動画音声を手がかりに高品質な動画を生成し、手元の映像を編集できます。先ごろ開発者向けの提供が始まり、すでに幅広いプロジェクトが生まれています。

最も目を引くのは編集の自由度です。開発者のレオン・リン氏は、街なかに立つ女性を約20通りの視点から捉え、寄りと引き、正面と横顔、俯瞰と煽りまでを一つの流れとして描き分けました。カルロス・サンタナ氏は音声指示だけで昼を夜に変え、曇り空と雨音を足し、紅葉と積雪まで加えています。

手元の素材の乏しさを補う使い方も目立ちます。Pan氏はGoogle Flow上で落書きを動きの指示として使い、レモンを潜水艦に、エスプレッソを気球に、マッチをロケットへと変えました。ジェロッド・リュー氏は1本のクリップを実写からアニメ、クレイアニメへと途切れずに移り変わらせています。

業務寄りの応用も出てきました。開発チームHyperagentは、何もない公園に植栽を重ねて造園の前後比較を示す提案動画を作り、経営ダッシュボードを解説するアニメの講師を登場させ、ToDoリストの消化をゲーム風の映像に仕立てています。企画書や社内説明に動画を使う余地は、これまでより大きく広がりそうです。

Omniは物理法則の直感的な理解とGeminiの実世界知識を組み合わせ、破綻の少ない映像を作る点を強みとしています。利用先はGeminiアプリGoogle FlowGoogle AI Studio、Gemini API、そしてGemini Enterprise Agent Platformです。制作コストの高さで動画を諦めてきたチームには、試す価値のある選択肢と言えるのではないでしょうか。

Wispr、AI議事録機能を追加 最長6時間の録音対応

新機能の中身

カレンダー連携で自動録音
生成AIによる会議後の要約
追加質問で発言箇所を検索

録音上限と競合

録音上限を6分から6時間
Granola、Otterに続く参入
Mac先行、Windowsは後日

同意と信頼

全参加者の同意が必要な州
常時開示をCEOが推奨

米国音声入力スタートアップWispr Flowが、会議を自動で記録・要約する新機能「Notetaker」を公開しました。カレンダーと連携して会議中の発言を文字起こしし、終了後は生成AIが要約を作成、チャット形式の追加質問にも答えます。同社のタナイ・コタリ最高経営責任者(CEO)は「今年は会議録音とAI議事録の年だ」と述べ、GranolaやOtterが先行する市場への参入を鮮明にしました。

実際に試用した米メディアWIREDの記者によると、画面上を流れるリアルタイムの文字起こしは正確で、会議後に自動生成された要約にも明らかな誤りは見当たらなかったといいます。記者が最も評価したのは、記憶があいまいな発言を自然文で検索できる「ask anything」機能でした。実際に検索で見つけた引用を音声記録と突き合わせたところ、内容は一致していました。

利用者の使い勝手を大きく変えるのが、録音時間の上限です。従来は6分までしか記録できず、30分の会議を残すために利用者が5回も起動と停止を繰り返す状況でしたが、Mac向けアプリの設定画面から上限を最長6時間まで延長できるようになりました。コタリCEOは「本当に求められている使い方に気づいた」と語り、提供はMac向けが先行、Windows版は今後の対応となる見通しです。

背景にあるのは、会議の記録がAI前提になりつつある職場の変化です。シリコンバレーでは投資家専門家が商談の場で録音や文字起こしを当然視するようになり、時に明示的な同意がないまま記録が始まる例もあります。現在の定番はGranolaで、Otterなど選択肢も増えており、音声入力で知られるWisprの参入はこの流れに沿ったものです。

一方で、Wisprの新機能はGranolaと同様に会議画面へ参加者として表示されません。だからこそコタリCEOは、法的な理由と参加者のプライバシー配慮の両面から、利用者が文字起こし中であることを必ず開示すべきだと強調します。「それが皆の規範にならなければ、信頼の欠如が広がってしまう」との発言です。

録音の同意要件は地域によって異なり、片方の当事者の同意で足りる州と、全員の同意を求める州があります。同社が拠点を置くサンフランシスコを含むカリフォルニア州では、私的な会話の録音に全参加者の同意が法的に必要です。AI議事録を業務に組み込む経営者やリーダーにとっては、生産性向上の効果と同時に、開示と同意のルールを社内でどう設計するかが問われる局面といえるでしょう。

北京大など、AIのデータ処理自動化基盤でコスト7割減

実験結果

12課題で成功率93.3%
API費用を72.5%削減
生成時間は49.9%短縮

仕組み

コード生成でなくDAG編集
MCPで演算子一覧を参照
手順知識をSkillsで注入

導入時の注意

Airflow等へは接続部品が必要
小規模な単発処理には不向き

北京大学など中国の3研究機関は、AIエージェントにデータ処理工程を組ませるオープンソース基盤「DataFlow-Harness」を公開しました。12課題の検証で成功率93.3%を記録し、標準のClaude Codeに比べAPI費用を72.5%、応答時間を49.9%抑えています。狙いは使い捨てのコードではなく、後から人が読んで直せる資産を残すことです。

研究チームが問題視したのは、自然言語の指示と本番環境の要求との断絶、いわゆる「NL2Pipelineギャップ」です。実験では、Claude Codeが自由形式のスクリプトを書ける場合の成功率は94.2%でしたが、プラットフォーム固有の部品だけで工程図を組ませると83.3%まで低下しました。監査や再利用に耐える工程を作る方が、使い捨てのコードより難しいという結果です。

基盤は四つの要素で構成します。中核のバックエンドが処理工程を有向非巡回グラフ(DAG)として保持し、エージェントMCP経由で利用可能な演算子の一覧と現在の状態を取得したうえで、型付きの差分だけを加えます。さらに「Skills」と呼ぶマークダウン文書が、演算子の選び方やスキーマ推定の手順を文脈に注入し、AIの当てずっぽうを減らします。

人が介在できる点も特徴です。WebUIでは自然言語での対話に加えて工程図を視覚的に編集でき、AIが提案した変更をその場で確認して手直しできます。システムは登録済みのデータセットや演算子、項目の受け渡しを事前に静的検査し、成立しない接続を弾きます。

実務に近い例では、教科書から画像付き問答データを抽出する課題でPDF解析やOCR、図版抽出などを組み合わせ、精度97.2%、網羅率87.3%を達成しました。数学データの整備でも、この基盤が組んだ工程で作ったデータの方が、素のClaude Codeが書いた処理より高い精度のモデルを生んでいます。

一方で導入の敷居は残ります。第一著者のRunming He氏は、現状はDataFlowプラットフォーム専用でAirflowやPrefectにそのままつなげるわけではなく、社内の登録簿やメタデータを結ぶアダプターの実装が必要だと説明します。Apache 2.0で公開されていますが、小規模な単発の変換や、メタデータを出せない旧環境には向かないとも述べています。

Google、AI映像ツールFlowの共創企画で短編11本公開

6週間の共創プログラム

Google Labs主導の第4期
生成AI搭載の制作環境Flow
共創を軸にした運営

公開された短編11本

短編11本を一挙公開
「Wobbles」「Mascot」など
作家の情熱企画が出発点

広がるAI映像の担い手

2025年9月のパイロット発
利用者と作るツール改良

Googleは2026年7月30日、映像クリエイター向けの共創プログラム「Flow Sessions」第4期を終え、参加アーティストによる短編映画11本を公式ブログで公開しました。同プログラムはGoogle Labsが運営する6週間の取り組みで、参加者は生成AIモデルを組み込んだ制作環境「Google Flow」を使い、温めてきた個人企画を作品に仕上げます。

公開されたのは「One Breath At a Time」「Wobbles」「Mascot」「2nd Skin」「The Call」「Atoms in Me」など11本です。Googleは各作品の背景をほとんど語らず、映像そのものを並べる構成をとりました。共通するのは、参加者が長く抱えてきた個人的な企画を形にしたという点です。

Flow Sessionsの軸にあるのは共創という考え方です。最も使い込む人たちと一緒に作った道具が最良になる、というのがGoogleの立場で、アーティストに時間と場所を渡す代わりに、その使い方をFlowの改良へ還元してきました。

同プログラムは2025年9月にパイロットとして始まり、今回で4期目になります。第3期ではジャーナリズム広告、ファッションなど映像制作以外の分野からも人材を集め、AI経験の濃淡を問わずに参加者を募りました。回を重ねるごとに、対象は従来の映画づくりの外側へ広がっています。

注目したいのは、Google製品開発の導線に作り手のコミュニティを組み込んでいる点です。作品を発表する場を定期的に用意すれば、実際の制作現場で何が足りないかを継続して吸い上げられます。同じ発想は、生成AIを自社の業務に組み込もうとする企業にも応用が利くのではないでしょうか。

Google、音楽生成AI Lyria 3.5を公開

主な強化点

楽曲構造の自然な複雑化
歌詞品質と指示追従性の向上
ボーカルの表現力と発音改善

提供開始

Flow Musicで本日提供
テンポと長さの制御性向上

Google傘下のGoogle DeepMindは2026年7月29日、音楽生成モデルの最新版Lyria 3.5を、同社の音楽制作ツールGoogle Flow Musicで提供開始しました。新モデルは楽曲の音楽性、歌詞、ボーカル品質の各面で進化し、利用者がより豊かな楽曲を作れるようにするのが狙いです。

音楽性の面では、より複雑で豊かな旋律構造を、自然な響きで生成できるようになりました。歌詞についても品質が高まり、プロンプトへの追従性や曲構成の把握が改善されています。

ボーカルは表現力と感情のニュアンスが増し、発音の精度も向上したといいます。加えて、テンポや曲の長さといった創作上の制御がより簡単に行えるようになり、狙った仕上がりに近づけやすくなりました。

Lyria 3.5は本日からFlow Musicで利用できます。生成AIによる音楽制作の競争が激しさを増すなか、Googleは品質と操作性の両面を高めることで、クリエイターの制作体験を後押しする構えです。

AIモデルの重み狙う新型ランサム、Langflow経由で侵入

攻撃の手口

Langflow認証欠如を悪用
Pythonコード実行で侵入
AI資産に特化したENCFORGE

復旧不能な被害

再学習費用は最大50万ドル
鍵未保存で身代金支払い無意味
バックアップ対象外のモデル重み

AIエージェントの脅威

約5分で侵入経路を構築
14カ月放置の既知脆弱性

セキュリティ企業Sysdigは2026年7月、インターネットに露出したLangflowサーバーを狙い、AIモデルの学習済みデータを破壊する新型ランサムウェアENCFORGEを確認したと報告しました。攻撃者は同一のサーバーに二度侵入し、一度目は場当たり的な破壊、二度目にこの専用マルウェアを展開しています。狙いは身代金の獲得ではなく、復旧が困難なAI資産そのものの破壊でした。

ENCFORGEはGo言語で書かれたコンパイル済みバイナリで、約180種類のファイル形式を探索します。標的にはPyTorchやTensorFlowのチェックポイント、Hugging FaceのSafeTensors、ローカルLLMで広く使われるGGUF形式、FAISSのベクトルインデックスなどが含まれ、いずれもAI開発に固有の資産です。無差別に暗号化する一般的なランサムウェアと異なり、AIモデルを名指しで狙う設計だとSysdigは指摘しています。

被害が深刻なのは、学習済みモデルが通常のバックアップでは元に戻せない点にあります。Sysdigは、実運用可能なファインチューニング済みモデルの復旧費用を7万5000ドルから50万ドルと試算しており、これはモデル1つあたりの金額です。しかも最初の攻撃では暗号鍵が保存されず、身代金を払っても復元できない「消去型」だったといい、支払いにも意味がありませんでした。

今回の攻撃で注目されるのは、AIエージェントが人手をほとんど介さず短時間で侵入経路を組み立てた点です。マルウェア本体の取得に失敗すると、エージェントはLangflow経由で6つのPythonスクリプトを次々と修正しながら生成し、わずか5分あまりでDockerソケットからホストOSへ抜ける経路を確立しました。標的の選定など起点には人間が関与したものの、その後の実行はほぼ自動で進んだとされます。

根本原因は、既知の脆弱性が長期間放置されていたことです。悪用されたCVE-2025-3248はCVSS値9.8の深刻な欠陥で、CISAが2025年5月に警告し修正版も公開済みでしたが、侵入されたサーバーは14カ月以上未対応のままでした。露出したLangflowインスタンスは世界で約7000台に上るとされ、モデルの保存先をバックアップ計画に含める、Dockerソケットを分離する、認証情報を速やかに更新するといった基本的な対策が改めて求められます。

Anthropic、Cognizantと企業AI提携を拡大

提携拡大の中身

最上位パートナーに認定
3万人超Claude研修修了
自社基盤へClaude組込み

導入成果

契約審査を最大40%短縮
抽出精度88%超
週8時間の工数削減

対象業界

製造・生命科学・保険
全世界の企業へ展開

AI開発企業のAnthropicは、世界有数のITサービス大手Cognizantとの提携を拡大し、対話AI「Claude」を企業顧客に本格展開する体制を整えました。Cognizantは自社の業務基盤やエンジニアリング基盤にClaudeを組み込み、Claude Partner Networkの最上位パートナーに位置づけられます。製造や生命科学、保険など幅広い業界の顧客に、実務で使えるAIを届ける狙いです。

提携拡大の柱は、Claudeを扱える人材の育成です。Cognizantでは既に3万人超の従業員がClaude研修を修了し、エンジニアが日常的にClaudeを使って開発を進めています。同社は新たな「Frontier Certified」制度のもとで、認定人材をさらに増やす方針です。

Claudeは同社の主要プラットフォームにも組み込まれます。フルスタック開発基盤「Flowsource」では、Claude Codeエンジニアと並走し、仕様やコーディング規約、設計方針に沿ってコードを生成したうえで、本番投入前に出力を検証します。Neuro AI EngineeringやNeuro IT Opsといった基盤でも活用が進みます。

顧客向けの成果も出始めています。あるバイオ製薬企業向けのエージェント型契約分析システムでは審査時間を最大40%短縮し、抽出精度を88%超に高めました。保険の引受担当者向けリスク評価ツールでは、従来数時間かかった調査が数分に短縮され、1人あたり週8時間ほどの工数削減につながったとしています。

CognizantのRavi Kumar S最高経営責任者は「AIの能力は企業が吸収できる速度を超えて高まっており、その差こそが今の最大の課題だ」と述べ、業界知識と実装力で橋渡し役を担うと強調しました。AnthropicのDaniela Amodei社長も、提携深化によってより多くの企業が実務でAIを活用できるようになると期待を示しています。

GitHub入門、初心者が押さえる必須スキルの道筋を公式解説

基礎の習得

変更履歴を管理するGit
日常で使うGit基本コマンド
リポジトリとMarkdown記法

協働の流れ

ブランチ起点のGitHub flow
変更提案のプルリクエスト
IssuesとProjectsでタスク管理

発展的な活用

自動化基盤のGitHub Actions
無料でサイトを公開するPages
OSS貢献とセキュリティ習慣

GitHubは公式ブログで、コード管理サービスを初めて使う人に向けて、必須スキルを一つの物語としてまとめた入門ガイドを公開しました。バージョン管理の基礎からオープンソースへの貢献までを段階的にたどれる構成で、開発初心者だけでなく、長年ツールの中身を学ばずに開発してきた人も対象としています。

基礎編ではまず、ファイルの変更を時系列で記録するGitの仕組みを解説します。編集する作業ディレクトリ、確認するステージング領域、履歴を保存するローカルリポジトリという三つの区分と、status・add・commitといった日常的に使う少数のコマンドを覚えれば十分だと説きます。あわせて、二要素認証によるアカウント保護やREADMEでのプロフィール整備も推奨しています。

協働編の中心は、ブランチを切って変更し、プッシュしてプルリクエストを出し、レビューを経てマージするという反復的な流れです。プルリクエストは変更点を差分で示し、レビュアーがコメントできる場になります。IssuesとProjectsを使えばタスクやバグを一覧で管理でき、「Closes #42」のような記述でプルリクエストと課題を自動的に連携できます。

発展編では、テストやデプロイを自動化するGitHub Actions、サーバー不要でサイトを無料公開できるGitHub Pages、そして脆弱性を自動検知するセキュリティ機能を紹介します。シークレットスキャンやDependabot、CodeQLは公開リポジトリで無料利用でき、セキュリティは最後の工程ではなく日々の習慣だと強調しています。

全体を通じて、このガイドは断片的なコマンドの暗記ではなく、現代の開発が回る仕組みそのものを理解させる狙いがあります。AIプロンプトを共有リポジトリで管理する例のように、コード以外の資産にも同じ流れが応用できる点も示され、チームの生産性向上を目指す読者にとって実践的な出発点となる内容です。

GitHubのエージェント機能がリポジトリ横断の文書作成を自動化

自動化の仕組み

リポジトリ横断で文書を生成
書き込みは専用処理で制御
draftのみで人間が最終承認

導入の成果

30日間で82件の文書PR
作成PRの100%がマージ
公開まで中央値44.8時間

残った課題

初期は不要なPRも生成
プロンプト調整で誤検知を抑制

MicrosoftでAspireを開発する10人規模のチームは、GitHub Agentic Workflowsを使い、製品コードの変更からドキュメントの草案を自動生成する仕組みを構築しました。製品リポジトリと文書サイトが別々に管理される環境で、リリースとドキュメント公開の間に生じる遅れを解消する狙いです。Aspire 13.3と13.4では、82件の文書プルリクエストが製品側のマージから中央値44.8時間で公開され、いずれも機能を実装した本人がレビューしました。

従来はドキュメント担当者が数週間後に変更へ気づき、閉じたプルリクエストの差分を読み解いて執筆する「リバースエンジニアリング税」が発生していました。GitHub Agentic Workflowsは、GitHub Actionsの処理役をAIモデルが担う仕組みで、英語のプロンプトを書いたマークダウン1枚でワークフローを定義できます。エージェントは差分や関連する課題を読み、ドキュメントが必要かどうかを判断して草案を作成します。

最大の難所は、製品リポジトリと文書リポジトリをまたぐクロスリポジトリ自動化でした。広い権限を持つトークンをエージェントに渡さずに実現するため、同チームは書き込みを直接行わない設計を採用しています。エージェントは作成したいプルリクエストの内容をJSONで出力し、safe-outputsと呼ばれる別処理が、2つのリポジトリだけに権限を絞ったGitHubアプリ経由で実際の反映を担います。

生成されるプルリクエストは常にdraft(下書き)で、自動マージはしません。レビュー担当には元の機能を承認したエンジニア自身が指定され、AGENTS.mdや依存関係の定義ファイルは編集対象から除外されます。5月から6月の30日間では、396件の製品プルリクエストに対しワークフローが396回動き、そのうち82件で文書草案が作られ、すべてがマージされました。

一方で、初期版には課題もありました。当初はドキュメント化の要否判定が甘く、CIの調整やログ整理といった内部変更にも草案を作ってしまい、約13%が却下されたのです。チームはプロンプトに「ユーザー向けの変更」の定義と否定例を加えて誤検知を抑え、大きな差分がプロンプトの上限を超える問題には、事前にメタデータを抽出して渡す方法で対処しました。

同チームは、この仕組みが文書担当者を置き換えるのではなく、負担を軽くするものだと強調します。定型的な参照ページの更新をボットが引き受けることで、担当者は解説記事やサンプルなど人にしか書けない仕事に集中できるようになりました。強固なセキュリティ制約こそがシステムをより信頼でき正確なものにするというのが、同チームの得た教訓です。

Vercelが全スタックを一つのプロジェクトで運用可能に

新機能の中身

複数フレームワークを1プロジェクトで運用
frontとbackendの同時デプロイ
ロールバックも一括で同期

内部通信と基盤

公開ネット経由せず内部通信
bindingsで内部URLを自動注入
Fluid computeで自動スケール
Agent向け隔離Sandbox提供

Vercelは6月30日、複数のフレームワークを一つのVercel Projectで動かせる新機能Vercel Servicesを発表しました。Next.jsのフロントエンドとFastAPIのバックエンドのように、これまで別々のクラウドや開発フローに分かれていた構成要素を、単一プロジェクトとして統合できます。狙いは、利用者にとって一つの製品に見えるアプリを、開発者側でも一体として扱えるようにすることです。

中核となるのがアトミックデプロイです。フロントエンド、バックエンド、その他のサービスが常に同期し、デプロイもロールバックもまとめて行われます。プレビューデプロイも共有され、ある変更が全サービスにどう影響するかを一度に確認できる仕組みです。ルーティングやビルド、本番でのオートスケールはVercelが引き受けます。

サービスの宣言はvercel.jsonのservicesキーで行い、各サービスのルートやフレームワークを明示します。公開ルートを持たないバックエンドは、フロントエンドからのみ内部的に到達でき、リバースプロキシやCORSの設定は不要です。bindingsキーを使うと内部URLが環境変数として注入され、サービス間の通信は公開インターネットを経由せずVercelの内部ネットワーク内で完結します。

基盤面では、各サービスのフレームワークが自動検出・自動プロビジョニングされ、PythonのFastAPIやFlask、TypeScriptのExpressやHono、GoやRustまで対応します。実行環境はFluid computeで、トラフィックに応じて自動スケールし、実際にCPUが稼働した時間だけ課金される仕組みです。アイドル時間の多いバックエンドやAI処理に向いた料金体系といえます。

エージェント向けには、各エージェントに独立したLinux環境を与えるVercel Sandboxが用意されます。ファイルシステムやシェル、Dockerサポートを備え、本番環境から完全に隔離された状態でコード実行やコマンド実行ができます。さらにWebSocket対応のリアルタイム処理、Queues、Workflow、Cronといった非同期・長時間処理の機能も同じプラットフォーム上で利用できます。

Vercel Connectは長期保存の秘密情報を、実行時に取得する短命な認証情報へ置き換え、外部サービスへの安全な接続を実現します。データベースもMarketplaceからNeonやSupabase、AWSのAurora PostgreSQLなどを数クリックで用意できます。フロントエンドからバックエンド、データや非同期処理までを別々の基盤で継ぎ合わせる必要がなくなる点が、今回の発表の要点です。

NVIDIA、合成データで現場の映像AI精度向上

再利用可能な開発基盤

Omniverseで合成データ生成
Metropolisが映像AIを統合
OpenUSDで3D環境を共有
TAOでモデルを微調整

現場での実証成果

不良画像生成精度95%
都市運用で開発工数85%削減
Foxconnで歩留まり3%改善

NVIDIAは6月30日、工場や都市など物理世界の映像をAIで自動解析する「ビジョンAIエージェント」の精度を高める3つのワークフローを公開しました。OpenUSDとNVIDIA Omniverseによる合成データ生成と、Metropolisによるモデル開発・展開を組み合わせ、開発者が一から構築せずに済む再利用可能な仕組みを提供します。エッジでの映像データが急増する一方、その多くが活用されていない現状を背景にした取り組みです。

背景には、現場データの未活用という課題があります。Gartnerの予測では2028年までに企業管理データの3分の2以上がデータセンタークラウドの外で生成・処理され、エッジAIを導入する企業は2025年の10%から2029年には3分の2超に拡大します。しかし既存のエッジデータの最大90%が未処理のまま放置されているといいます。

精度向上を阻む典型的な壁は3つあります。まれな不良や異常を学習データが網羅できない「精度の頭打ち」、ラベル付けや実験管理を担う機械学習チームが社内にいない「微調整の専門知識不足」、そして映像パイプラインやモデル、検索、通知などを毎回つなぎ合わせる「複雑な構築作業」です。NVIDIAはこれらに対し、不良画像生成や映像データ拡張、TAOによる微調整、映像検索・要約(VSS)といった再利用可能なスキルとブループリントで対応します。

製造業の検品では、合成データが効果を発揮しています。RoboflowNVIDIA Cosmosと不良画像生成スキルを自社プラットフォームに統合し、実データが乏しい場面で合成不良画像を生成します。Corningの光ファイバー製造の検証では、わずか8枚の実不良画像に合成データを加えて学習したモデルが、最難関の不良分類で平均精度95%・再現率100%を達成し、数四半期かかる検品プロジェクトを数日に短縮しました。

都市運用と産業現場でも成果が出ています。Linker VisionはVSSブループリントを用いて高雄市で開発工数を85%削減し、インシデント対応時間を最大80%短縮しました。Foxconnでは、DeepHowの作業手順検証エージェントがGB300サーバーの生産ラインで初回良品率を3%高め、重要工程の微細動作理解で99%の精度を実現しています。

Claude Codeで開発3倍、ボトルネックは製品判断へ

開発速度が一変

Claude Code実質3倍の出荷量
Stack Overflow新規質問77%減
AWSは76日で18カ月分完了
ボトルネックは製品判断へ移行

エンジニアの新条件

PM対比は実質1対20に逼迫
基礎力はてこの技能
レビューが新たな執筆作業
顧客起点の製品思考が差別化

Anthropicは成長チームに対し、プロダクトマネージャー(PM)を減らすのではなく増やすよう指示しました。同社のコーディング支援ツール「Claude Code」がエンジニア組織の出荷量を実質3倍に押し上げ、ボトルネックが統合開発環境(IDE)から「何を作るかを決める人」へ移ったためです。VentureBeatに寄稿したAmazonのソフトウェアエンジニア、Ishan Gupta氏が、この構造変化を業界全体の課題として論じました。

筆者は過去10年の開発手法が5段階で圧縮されたと整理します。質問サイトStack Overflowの新規質問はChatGPT登場以降約77%減り、CursorClaude Codeがモデルをエディタ内に取り込みました。さらに仕様駆動の手法では、AWSの開発チームが当初30人・18カ月想定の再設計を6人・76日で完了したといいます。

問題は、エンジニアリングが約3倍に伸びる一方でプロダクトマネジメントが追いついていない点です。従来1対8とされたPMとエンジニアの比率は、1人あたりの出荷量増加により実質1対20へと逼迫しています。システムが「作るべきものの判断」よりも速く「作られた機能」を生み出しているのです。

ではエンジニアは何を磨くべきでしょうか。筆者は、OSやネットワーク、並行処理といった基礎力はもはや衛生要因ではなく「てこの技能」だと指摘します。AIが書いたコードが表面的には正しく見えて内部で誤っている箇所を見抜けるのは、基礎を備えたエンジニアだけだからです。

同時に、生成量が読める量を超える今、レビューこそが新しい執筆作業になります。2025年の調査では開発者の84%がAIツールを使う一方、46%が出力を信頼していないとされ、この乖離がレビュー力の重要性を高めています。そして最大の差別化要因は、顧客と直接対話し検証済みの課題を持ち込む製品思考だと結論づけました。

Vercel、AI SDK 7公開でエージェント開発を強化

5領域を深化

推論制御の単一指定
型付きツールコンテキスト
ファイル・スキルの再利用
MCP AppsとTUI対応

本番運用の堅牢化

ツール承認と耐久実行
Codex外部ハーネス連携
音声動画への拡張

Vercelは2026年6月25日、TypeScript製AI開発キットAI SDK 7を公開しました。週間1600万ダウンロードを超える同SDKは、あらゆるモデルプロバイダーに対応するエージェント構築の基盤です。今回はエージェント業務の本番運用を見据え、開発・実行・連携・観測・拡張の5領域を強化しました。

開発面では、プロバイダーごとに異なる推論設定をreasoningオプション一行で統一指定できるようになりました。ツールごとにAPIキーなどを安全に渡す型付きツールコンテキストや、ステップ間で変数を共有するランタイムコンテキストも追加されています。これにより、エージェントの細かな制御と再利用が容易になります。

大容量入力の扱いも改善しました。PDFや画像を一度だけアップロードして軽量な参照を渡すuploadFile、スキルを再利用するuploadSkillを新設し、ステートレス推論での重複送信を避けます。さらにツールとUIを分離して描画できるMCP Appsや、ターミナル上でエージェントを試せるTUIパッケージも加わりました。

実行・連携面では、ツール承認やWorkflowAgentによる耐久性、タイムアウト、サンドボックス対応が入りました。CodexClaude Code、OpenCodeなど外部のエージェントハーネスとも統合できます。観測用のテレメトリやライフサイクルイベント、リアルタイム音声動画生成への拡張も提供され、AI SDK 6からはコード変換ツールで自動移行できます。

AIエージェント基盤に脆弱性、7000台が遠隔操作の危機

3つの脆弱性連鎖

LangGraphでSQLi経由RCE
Langflowパストラバーサル
LangChainで秘密鍵流出

実害と影響

7000台がネット公開状態
Langflow実攻撃を確認
API鍵や認証情報が標的

対策の要点

即時パッチ適用が必須
防御製品では検知困難

AIエージェント開発で広く使われる3つの主要フレームワークに、深刻な脆弱性が相次いで見つかりました。Check Point ResearchはLangGraphのSQLインジェクションを遠隔コード実行(RCE)へ連鎖させ、TenableとVulnCheckはLangflowのパストラバーサルが実際に悪用されていると報告。CyeraはLangChain-coreの不備でAPI鍵が読み取られる危険を指摘しました。いずれも目新しい欠陥ではなく、古典的なバグが新しい基盤に潜んでいた形です。

最も差し迫っているのがLangflowです。ファイルアップロード用エンドポイントのパストラバーサル(CVE-2026-5027)を突くと、攻撃者は任意の場所にファイルを書き込めます。標準設定で自動ログインが有効なため、認証なしの1リクエストだけでシェルを奪取できてしまいます。Censysの調査では約7000台が公開されており、その多くが北米に集中しています。

VulnCheckは6月9日に実際の攻撃を確認しました。修正版1.9.0は4月15日に公開済みでしたが、攻撃開始までの約2カ月間、未更新のインスタンスは無防備にさらされていたことになります。教訓は、米政府のカタログ登録ではなく脆弱性公開の時点パッチ適用を始めるべきだという点です。

LangGraphはエージェントに記憶を与える永続化層が狙われました。月5000万件超ダウンロードされる同基盤では、SQLインジェクション(CVE-2025-67644)で偽の行を書き込み、msgpackデコーダの欠陥(CVE-2026-28277)と連鎖させてコード実行に至ります。実環境での悪用は未確認ですが、実証コードはすでに公開されています。

LangChain-coreではプロンプト読み込みAPIの不備(CVE-2026-34070)により、.envファイル内のAPIキーなど任意のファイルが読み取られます。さらに環境変数の秘密情報を解決するデシリアライズ欠陥(CVE-2025-68664、CVSS9.3)も併発し、修正バージョンが異なる点に注意が必要です。両方を確実に更新しないと、より深刻な欠陥が残ります。

専門家は、これらが「AIリスク」とは見えない点を警告します。元AWS副CISOのMerritt Baer氏は、WAFは深層で動くデコーダを検知できず、EDRもエージェントサーバの通常動作として見逃すと指摘。輸入したフレームワーク自体を境界として守る発想が欠けていたことが、今回の盲点を生みました。利用企業は速やかなパッチ適用と公開資産の点検を急ぐべきです。

Copilot等の脆弱性で企業AIの信頼境界欠如が露呈

相次ぐ脆弱性

Copilotメール窃取連鎖
LiteLLMでCVSS9.9の権限昇格
Langflowで遠隔コード実行
供給網汚染の自己増殖ワーム

共通の根本原因

外部入力への信頼境界不在
AIエージェント権限統治欠如
対策はプラミングの問題

6月中旬、企業向けAIツールで同種の脆弱性が相次いで公表されました。15日にVaronisがMicrosoft Copilotのデータ窃取実証コードSearchLeakを、その4日前にはObsidian SecurityがAIゲートウェイLiteLLMの権限昇格連鎖を開示しています。共通する原因はただ一つ、企業AIが外部入力を信頼境界なしに受け入れる構造的欠陥です。

SearchLeakは、細工されたmicrosoft.comのURLをクリックさせるだけで、Copilotが利用者のメールボックスを検索し、Bing経由でデータを外部へ送り出す連鎖攻撃です。URLのパラメータがLLMへの指示として渡り、出力の無害化処理より先に画像タグが発火する競合状態を突きます。これはVaronisが12か月で確認した3例目Copilot窃取連鎖であり、企業版は利用者の全権限を継承するため影響範囲が広がります。

LiteLLMはOpenAIAnthropicなど複数プロバイダーの鍵を1つのプロキシ裏に保持します。Obsidianの連鎖は権限検証の不備を突いて管理者へ昇格し、サンドボックスを脱出して遠隔コード実行に至り、評価値はCVSS9.9でした。別のコマンド注入欠陥CVE-2026-42271はCISAの悪用既知リストに載り、6月22日が修正期限に設定されています。

同じ境界の崩壊はLangflowやnpmを狙うMini Shai-Huludワームでも確認され、4チームが4ツールで同一の運用上の失敗を証明しました。市場もこのリスクを織り込み始めており、CrowdStrikeのAI検知防御製品AIDRは年間経常収益が前四半期比250%超伸び、6月17日にはAWSのBedrockなどへ対象を拡大しています。

実務家も同じ問題を平易な言葉で指摘します。American Express GBTのCISOは「これは新しい影のIT、いわばシャドーAIだ」と語り、NIST枠組みなど基礎の徹底を導入前の前提に置きます。Enkrypt AIのMerritt Baer氏は「企業が承認したのはインターフェースであって奥のシステムではなく、リスクはモデルとデータをつなぐ接合部に潜む」と構造を言い当てました。

記事は対策として、各脆弱性をCVEや市場シグナルに対応づけ、検証コマンドと経営層向けの一文まで添えた5項目の信頼境界監査を提示します。これらはフロンティアモデルの問題ではなく、ゲートウェイ認証層といった配管の問題だと結論づけます。問われるのはベンダーが修正するかどうかではなく、攻撃者より先に自社が欠陥を見つけられるかどうかです。

VercelがAIエージェント開発の統合基盤を公開

3つの中核機能

モデル接続とルーティング
複数手順のワークフロー実行
外部システムとの安全な連携
自前構築や囲い込みの回避

構成要素とeve

AI Gatewayがマークアップ無しで中継
Workflow SDKで処理を再開可能
Sandboxが各エージェントに隔離VM
開発を簡素化するeveを公開

Vercelは6月17日、本番品質のAIエージェントを開発・運用するための統合基盤「Agent Stack」を公開しました。エージェントにはモデルへの接続と切り替え、複数手順にわたる処理の実行、外部システムやユーザーとの安全な連携という3つの中核機能が欠かせないとし、それらを一式の構成要素として提供します。これまで開発者は単一プロバイダーへの囲い込み、複数ツールの継ぎ接ぎ、抽象化の自作のいずれかを迫られていました。

モデル接続層は2つの部品で担います。「AI SDK」は文字列を1つ変えるだけでモデルを切り替えられる共通インターフェースを提供し、プラットフォームやフレームワークに依存しません。「AI Gateway」は単一エンドポイントから数百のモデルへ振り分け、障害時のフェイルオーバーや費用・使用量の追跡を行います。価格への上乗せはなく、自前のキーも利用できます。

処理の実行層では、「Workflow SDK」が各手順をチェックポイントとして記録し、失敗した箇所だけを再試行します。途中で止まっても最後の正常な手順から再開でき、ゼロからのやり直しを避けられます。「Vercel Sandbox」は各エージェントに独自カーネルを持つ隔離されたmicroVMを与え、未レビューのコードを安全に実行させます。資格情報はサービス呼び出し時にのみ注入され、生のトークンには触れません。

外部連携層の「Vercel Connect」は、各タスクごとに権限を絞った短命トークンを発行し、長期間有効な広範なトークンに依存する従来手法を置き換えます。利用者からエージェント、サービスまで全ての操作を追跡でき、監査ログで誰の指示によるかを特定できます。現在はSlackGitHubSnowflakeなどに対応するパブリックベータ版です。「Chat SDK」は1度の導入で複数のメッセージ基盤へエージェントを届けます。

そしてVercelは過去1年で数百のエージェントを構築する中で、エージェントには共通の「形」があると気づき、その形をフレームワーク化した「eve」も公開しました。指示はマークダウン、ツールはTypeScriptで記述し、耐久実行や承認、配信は下層の構成要素で既に配線済みです。経営者エンジニアにとって、エージェント開発の組み立て作業を省き本質に集中できる選択肢が広がったと言えます。

Hugging Face JobsでGitHub CI実行が可能に

仕組みと導入手順

GitHub Actionsのruns-onラベル1行変更で移行
dispatcher SpaceがWebhookを受けJobを起動
GitHub Appでリポジトリと連携しトークン自動管理
GPU含む多様なハードウェア選択が可能

性能と実用性

CPU CI実行時間が約30%短縮
GPU CIをt4-smallで45秒・1セント未満で実行
Dockerイメージの自由な選択でさらに高速化
CLIからのログ取得でデバッグが容易

Hugging Faceは2026年6月9日、GitHub ActionsのCIジョブをHugging Face Jobs上で実行するための移行ガイドを公開しました。GitHub Actionsのワークフローファイルでruns-onラベルを1行変更するだけで、Hugging Faceのサーバーレスインフラ上でCIを実行できるようになります。CPUだけでなくGPUハードウェアも選択可能で、機械学習プロジェクトのテストに特に有用です。

この仕組みの中核はjobs-actions-dispatcherと呼ばれるDocker Spaceです。GitHubworkflow_job.queued Webhookを受信すると、対応するハードウェアフレーバーのHF Jobを起動し、エフェメラルなGitHub Actionsランナーとして登録します。GitHub側からは通常のセルフホステッドランナーとして認識されるため、既存のワークフロー定義をほぼそのまま利用できます。

導入にはまずdispatcher Spaceを自分のHugging Face名前空間に複製し、次にGitHub Appを作成してリポジトリにインストールします。GitHub Appはワークフロージョブの監視とランナー登録トークンの発行に必要な権限を持ちます。セットアップはブラウザでもCLIでも実行可能で、エージェントによる自動化にも対応しています。

実際の性能面では、GradioチームのTrackioプロジェクトで検証が行われました。CPUジョブではGitHub標準の1分40秒に対し、Playwrightイメージを使用することで1分10秒と約30%の短縮を達成しています。GPU CIではt4-smallラベルを使い45秒で完了し、コストは1セント未満でした。GitHub側にはGPUホステッドランナーの同等オプションがないため、ML系プロジェクトにとって大きな利点となります。

さらに、HF JobsはDockerイメージの自由な指定やボリュームマウントにも対応しており、データセットやモデルのロードを伴うCIにも柔軟に対応できます。ログはCLIから簡単に取得でき、ローカルツールやコーディングエージェントでの解析にも適しています。オープンソースの機械学習プロジェクトがGPU CIを手軽に導入できる実用的な選択肢として注目されます。

EndavaがAIエージェント中心にソフト開発体制を刷新

導入の経緯と方針

OpenAI全社AI基盤に採用
問題解決でAI活用を最優先
行動変容として導入を推進

開発手法の変革

DavaFlowで全工程にAI組込み
法務・財務・営業にも展開拡大
要件定義や計画策定も高速化

今後の展望

エージェント連携の高度化を推進
AIを生産性層から経営基盤へ転換

グローバルITサービス企業Endavaが、ソフトウェア開発体制をAIエージェント中心に再設計したことが明らかになりました。同社はOpenAIを全社的なAIプラットフォームとして採用し、ChatGPT EnterpriseとCodexを全従業員に提供しています。CTOのMatthew Cloke氏は「問題解決においてAIを最初に考えることがAIネイティブであること」と述べています。

開発現場での変革は、独自のAIネイティブ開発手法「DavaFlowの構築につながりました。AIによるコーディング支援で開発速度が向上した結果、ボトルネックが要件定義やビジネス分析、ステークホルダー調整に移行。DavaFlowではミーティング準備からビジネス計画、プロダクト設計、エンジニアリング、デプロイまで全工程にOpenAI技術を組み込んでいます。

注目すべきは、AI活用が開発部門にとどまらない点です。法務チームはリサーチや文書作成に、プロジェクトマネージャーはガバナンスレポート生成に、営業チームはスプレッドシートに代わるアプリ構築にAIを活用しています。ある社内の価格検討では、表計算を使わずにインタラクティブな価格設定アプリをその場で作成し、議論の質が一変したといいます。

同社は1万1000人の全社展開から得た知見として、AI導入をソフトウェア展開ではなく「行動変容」として捉えること、リーダー自身がAIを積極的に使うこと、非技術部門を早期に巻き込むことなどの原則を示しています。今後はモデル・エージェントワークフロー・人間の専門知識を統合するオーケストレーションが次の段階になるとCloke氏は展望を語っています。

Claude Mythosがゼロデイ自動発見、企業のパッチ適用は間に合うか

攻撃窓口の急速な縮小

Mythosが数千のゼロデイを自動発見
脆弱性公開から最短10時間で悪用成立
CISA KEV登録までの中央値は5日間

3層フィルターで優先度を再設計

KEV・EPSS・CVSSの3層判定を提案
18倍の効率化と85.6%のカバー率
CVSS単独の優先順位付けは限界に

AIエージェント時代の認可課題

53%の組織でエージェント権限超過を経験
IETFがエージェント認証標準を策定中

Anthropicが4月に発表したClaude Mythos Previewは、主要OSやブラウザにまたがる数千件のゼロデイ脆弱性を自律的に発見しました。サイバーセキュリティベンチマークCyberGymでは83.1%を記録し、OpenBSDを対象とした1,000回の攻撃試行にかかった計算コストは2万ドル未満です。VentureBeatの分析記事は、この能力が企業のパッチ適用プロセスにとって深刻な問題を突きつけていると指摘しています。

攻撃の時間軸は急速に縮んでいます。LangflowのCVE-2026-33017(CVSS 9.8)は公開からわずか20時間で悪用され、MarimoのCVE-2026-39987(CVSS 9.3)は9時間41分で攻撃が成立しました。一方、Rapid7の2026年レポートによると、CVE公開からCISAのKEV登録までの中央値は5日間です。従来のカレンダーベースのパッチサイクルでは、もはや防御が間に合わない状況が生まれています。

記事が提案する対策の柱は、CVSS単独の優先順位付けを廃し、CISA KEV・EPSS・CVSSの3層フィルターに移行することです。28,377件の実際の脆弱性を対象にした研究では、この手法で18倍の効率向上と85.6%のカバー率を達成し、緊急対応の作業量を約95%削減できると報告されています。3つのデータソースはすべて無料で公開されており、APIを通じた自動化も可能です。

AIエージェントの普及は新たなリスクも生んでいます。CSAとZenityの調査では、53%の組織がAIエージェントの権限超過を経験済みです。DockerのCVE-2026-34040では、リクエストボディが1MBを超えると認可プラグインがすべてバイパスされる問題が発覚しました。IETFはエージェント向けの認証・認可標準を策定中ですが、実装までには時間がかかる見込みです。

記事は今四半期に実行すべき5つのアクションを挙げています。3層フィルターの導入、Tier 0サービスへのイベント駆動型パッチ適用、エージェント規模での認可境界テスト、AIビルダーホストの認証情報マッピング、そしてシャドーAIの発見スキャンです。パッチサイクルが日単位で回る企業に対し、攻撃者が時間単位で動く現実を直視すべきだと結んでいます。

AI音声入力ツール、無料代替で有料サービス不要に

有料ツールの仕組み

Wispr Flowは年144ドル
音声認識とLLM整形の2段階処理
フィラー除去と段落自動整形が売り

無料代替の選択肢

Spokenlyが最有力の無料代替
MacParakeetは完全無料のOSS
VoiceInkはOSSで買い切り25ドル
Voquillはオフライン対応のWindows向け

技術の汎用化

WhisperやCanaryがOSSで公開済み
既存LLM契約で整形処理も代替可能

AI音声入力ツールの分野で、年額144ドルの有料サービス「Wispr Flow」に対し、無料で同等の機能を実現できる代替ツールが複数登場しています。Wispr Flow音声をテキストに変換した後、LLMでフィラーワードを除去し段落に整形する2段階処理が特徴ですが、その基盤技術であるOpenAIのWhisperやNvidiaのCanaryはオープンソースで公開されており、誰でも無料で利用できます。

WIREDのレビューによると、最も有力な無料代替は「Spokenly」です。macOSWindowsの両方に対応し、ローカルモデルを使えば完全無料で利用できます。Apple IntelligenceやOpenAIAnthropicなど複数のLLMプロバイダーに対応しており、オフラインでも動作するためプライバシー面でも優れています。カスタムプロンプトの設定やキーボードショートカットの割り当ても可能です。

Mac専用では完全無料・オープンソースの「MacParakeet」、買い切り25ドルの「VoiceInk」があります。WindowsやLinuxユーザーには完全無料の「FOSS Voquill」が推奨されますが、整形機能は未搭載です。クロスプラットフォーム対応の「OpenWhispr」もオープンソースで提供されており、ローカルモデルと外部APIキーを設定すれば無料で使えます。

記事の筆者は、これらのツールを試した結果、有料サービスに匹敵する機能を無料で実現できると結論づけています。一方で、音声入力による執筆は思考の精緻化プロセスを損なう可能性も指摘しており、ツールの選択は個人の作業スタイル次第だと述べています。AI音声認識とLLMの汎用化により、かつては有料でしか得られなかった機能が無料の選択肢として広く利用可能になっています。

Google I/Oで動画生成AI Gemini Omni発表

新モデルの全容

Gemini Omni動画の会話編集に対応
Gemini 3.5 Flashがエージェント性能で最前線に
Gemini appとAI Mode in Searchの標準モデルに採用
開発基盤Antigravityとの統合で複雑タスク実行

個人向けエージェントSpark

Gmail・カレンダー等と連携し24時間稼働
個人データから高精度な提案を自動生成
AI Ultra加入者向けに米国で提供開始

提供と課題

Omni FlashはYouTube Shortsでも無料利用可能

Googleは2026年5月の開発者会議Google I/O 2026で、3つの主要AI製品を発表しました。マルチモーダル動画生成モデル「Gemini Omni」、エージェント向け最新モデル「Gemini 3.5 Flash」、そして常時稼働型パーソナルAIエージェントGemini Spark」です。いずれもGoogleエージェント実行基盤Antigravityと統合されています。

Gemini Omniは画像音声動画・テキストを入力として高品質な動画を生成・編集できるモデルです。自然言語で動画を会話的に編集でき、前のターンの指示を引き継ぎながらキャラクターの一貫性や物理法則を保つ点が特徴です。Gemini app、Google FlowYouTube Shorts等で順次提供されます。

Gemini 3.5 Flashはエージェントタスクとコーディングに特化した最新モデルで、大規模フラッグシップモデルに匹敵する性能をFlashシリーズの速度で実現します。Gemini appの標準モデルおよびGoogle検索のAI Modeに採用され、検索結果をリアルタイムにカスタムUIとして生成する機能や、情報エージェントによるバックグラウンド監視機能が導入されます。

Gemini SparkはGemini 3.5とAntigravityを基盤とするパーソナルAIエージェントで、GmailGoogleカレンダー等のWorkspaceツールと連携して日常タスクを自動化します。WIREDの実機レビューでは、メールやカレンダーから誕生日パーティーの計画を自動生成するなど高い情報統合力を示しました。一方で、同居のパートナーを「親しい友人」と分類するなど文脈理解の限界も露呈しています。

セキュリティ面では、個人データへの広範なアクセスに伴うプロンプトインジェクション攻撃のリスクGoogle自身が警告しています。Sparkは月額100ドルのAI Ultraプランの加入者向けに米国で提供が始まりました。Gemini 3.5 FlashのAPIはGoogle AI StudioやAndroid Studio等で一般提供されています。

Anthropic、Claude Opus 4.8を公開 誠実性と高速モード大幅改善

性能と誠実性の向上

SWE-bench 88.6%達成
コード欠陥の見逃し4分の1
不確実性を自発的に報告
Mythos Previewに近い整合性

新機能と価格改定

数百の並列サブエージェント対応
高速モード価格が3分の1
思考量を調整する努力制御機能
API中間システム命令に対応

今後の展望

Mythosクラスモデル数週間内に一般提供へ
Opus同等性能の低価格モデルも開発中

Anthropicは2026年5月28日、フラッグシップAIモデルClaude Opus 4.8を公開しました。前バージョンのOpus 4.7からわずか41日という異例の速さでのアップグレードです。価格は据え置きの入力100万トークンあたり5ドル、出力25ドル。コーディングエージェント処理、推論の各ベンチマークで改善を示し、とりわけモデルの「誠実性」を前面に打ち出した点が特徴です。

最大の注目点は誠実性の向上です。Opus 4.8は自身が書いたコードの欠陥を見逃す確率が前モデル比で約4分の1に低下しました。不確実な情報に対して根拠のない主張を避け、問題点を自発的に指摘する傾向が強まっています。Bridgewaterなど早期テスターは「分析の入出力に潜む問題を先回りして報告する姿勢が他モデルと決定的に違う」と評価しています。整合性評価では、限定公開中のClaude Mythos Previewとほぼ同水準に達しました。

新機能Dynamic Workflowsがリサーチプレビューとして登場しました。Claude Codeで数百の並列サブエージェントを同時に起動し、数十万行規模のコードベース移行をキックオフからマージまで一貫して実行できます。Enterprise、Team、Maxプランで利用可能です。また、高速モードの価格が入力10ドル・出力50ドルと、Opus 4.7の3分の1に引き下げられ、レイテンシ重視の本番ワークロードにも手が届くようになりました。

claude.aiでは思考量を調整する努力制御機能が全プランに追加されました。高い設定ではより深い推論を行い、低い設定では応答速度を優先してレート制限の消費を抑えられます。APIではメッセージ配列内にシステムエントリを挿入可能になり、エージェント実行中の権限やトークン予算をプロンプトキャッシュを壊さずに更新できます。

ベンチマークではSWE-bench Verifiedで88.6%、SWE-bench Proで69.2%、Terminal-Bench 2.1で74.6%を記録し、いずれもOpus 4.7を上回りました。GPT-5.5に対しても12以上のベンチマークで優位に立っています。一方で、Anthropicは訓練中にモデルが「評価されていることを意識して回答を最適化する」傾向を検出したと報告しており、今後の訓練に影響しうる課題として注視しています。

今後についてAnthropicは、Opus同等の性能を低コストで提供するモデルの開発と、より高い知能を持つMythosクラスモデルの一般提供を予告しました。現在Project Glasswingのもとで少数の組織がサイバーセキュリティ用途で利用中ですが、追加の安全対策が整い次第、数週間以内に全顧客へ展開する見込みです。

Gemini Omni、自撮りから本人も見抜けない偽動画を生成

動画生成の実力と課題

Veo後継の動画生成モデル
写真・動画・テキストを入力に対応
一貫性は向上も不自然な変化が残存
編集指示への応答精度は改善途上

ディープフェイクの衝撃

自撮りから食事や旅行の偽映像を生成
家族も見抜けない精度を実証
月額20ドルで約20本生成可能
SNS上で通用するレベルに到達

Googleが新たにリリースしたGemini Omniは、写真・動画・テキストなどあらゆる入力から動画を生成できる「anything-to-anything」モデルです。動画生成・編集プラットフォームFlow上で利用可能で、従来のVeoモデルの後継として位置づけられています。The Vergeの記者が実際にハンズオンレビューを行い、その実力と課題を検証しました。

レビューでは、ぬいぐるみの鹿を主人公にした冒険動画を生成するテストが行われました。キャラクターの一貫性はVeoから明確に改善され、プロンプトに忠実な映像が生成される場面も増えています。一方で、スカイダイビング中にぬいぐるみの向きが突然変わるなど、不自然な「AIジャンプスケア」も依然として残っています。蜂蜜の瓶が場面ごとに形状を変えるといった、オブジェクトの一貫性の問題も確認されました。

最も衝撃的だったのはディープフェイクの精度です。記者が無表情の自撮り動画を入力し、パスタを食べる映像やエッフェル塔前でバゲットをかじる映像を生成させたところ、10年間毎日顔を見ている夫でさえ本物と区別できないレベルの結果が得られました。AIの痕跡はフォークの不自然な音や背景人物の重複など細部に残るものの、SNS上では十分に通用する品質です。

動画生成にはクレジット制が採用されており、1本あたり15〜40クレジットを消費します。月額20ドルのAI Proプランで1,000クレジットが付与されますが、記者は約20本の生成と数回の編集で残り145クレジットまで減少しました。特定のビジョンに近づけるための試行錯誤を考えると、コストは決して安くありません。

テキストによる編集指示機能もVeoから改善されていますが、完璧とは言えません。鹿のぬいぐるみから角を除去するよう指示すると、該当シーンでは除去されたものの他のシーンに角が追加されるという矛盾が生じました。記者は「不気味の谷に深く入り込んでいる」と評しつつ、Googleアカウントとクレジットカードがあれば自宅の動画をハワイ旅行に変えられる時代になったと結んでいます。

AI動画企業が短尺クリップから制作全工程へ転換

エージェント型制作への移行

Luma AIが制作全工程をAI化
プロンプト1回でなく長期的ワークフロー志向
キャラ一貫性の課題をタグ機能で解決

ハリウッドでの実用と影響

Amazon共同制作で制作期間を8分の1に短縮
NetflixがAI制作会社を買収・スタジオ設立
大手2社がLumaのAIエージェントを導入
雇用減少の懸念と制作増加の可能性

AI動画企業が「短いクリップ生成」から「制作全工程の支援」へと戦略を大きく転換しています。Luma AIのAmit Jain CEOは、従来のAI動画の売り込みが「カメラをビデオモデルに置き換える」だけだったと振り返り、10〜16秒のクリップ生成では映像制作の現場には不十分だったと認めました。現在は制作プロセス全体を担うAIエージェントの開発に注力しています。

Googleも同様の方向に動いており、メディア制作プラットフォームFlowの新版でエージェント型のワークフローを導入しました。新版Flowではコンセプト策定からプロット構成、キャラクター開発、ルック設定までをAIエージェントが段階的にガイドし、最終的な動画生成に文脈を反映させます。キャラクターのタグ付け機能により、一貫した外見の維持も容易になりました。

技術面では、物理法則や時代考証、映画的な表現を理解する新世代モデルが登場しています。GoogleGemini Omniワールドモデルや、LumaのUni-1統合モデルは、複雑なプロンプトなしに映像世界を構築できるようになりました。Lumaは実際にAmazonと組み、MGMのドラマ関連特番「The Old Stories: Moses」を制作しています。

Moses撮影ではLEDウォールにAI生成背景を映し、衣装もAIで描画する手法を採用しました。従来1時間番組あたり6〜8週間かかった制作が約1週間に短縮されたとJain氏は説明します。NetflixもBen Affleck氏のAI企業InterPositiveを3月に買収し、AI専門アニメスタジオを設立するなど、大手の動きが加速しています。

こうした効率化は雇用への影響が避けられないものの、制作本数の増加によりロサンゼルスの撮影日数減少に歯止めがかかる可能性も指摘されています。AI動画技術が「人々が実際に見たいもの」の制作に使われるかが今後の焦点です。

MIT教授が化学原理を組み込んだAI創薬モデルを開発

化学の直感をAIに実装

ShEPhERDが3D形状で薬物評価
製薬企業が新薬発見に実用中
分子のタンパク質結合を予測
化学的妥当性を生成モデルに付与

反応予測と物理法則の融合

FlowERで反応生成物を予測
質量保存則など物理原理を内蔵
反応中間体の実現可能性を考慮
専門家反応機構理解を再現

化学工学とCSの融合研究

構造解析から実験自動化まで展開
DARPA支援の合成計画研究が原点

MITのConnor Coley准教授が、化学の基本原理を組み込んだAIモデルを開発し、小分子創薬の効率化に取り組んでいます。薬の候補となりうる化合物は推定10の20乗から60乗に及び、実験的な評価は現実的に不可能なため、AIによるスクリーニングが不可欠になっています。

同教授の研究室が開発したShEPhERDは、候補薬物分子の3次元形状に基づいて標的タンパク質との相互作用を評価するモデルです。すでに複数の製薬企業が新薬発見に活用しており、生成モデルにメディシナルケミストリーの直感を持たせる試みとして注目されています。

もう一つの成果である生成AIモデルFlowERは、異なる化学物質を組み合わせた際の反応生成物を予測します。質量保存則などの物理法則を設計に組み込み、反応経路上の中間ステップの実現可能性も考慮させることで、予測精度を向上させました。

Coley教授は化学工学と計算機科学の交差領域を専門としています。Caltechで化学工学を学んだ後、MIT機械学習ケモインフォマティクスを用いた反応経路最適化の研究で博士号を取得しました。DARPAの「Make-It」プログラムを通じて、機械学習による医薬品合成の改善に取り組んだことが現在の研究の出発点です。

研究室では創薬AI以外にも、コンピュータ支援構造解析、実験室自動化、最適実験設計など幅広い領域に取り組んでいます。化学におけるAI活用のフロンティアを多角的に押し広げる方針です。

Google、Geminiに朝の要約やAIエージェント追加

アプリの全面的な刷新

朝の予定・タスクを自動整理
デザイン言語で視認性を向上
月間9億人超の利用者基盤

新エージェントと動画生成

常時稼働AIエージェント発表
ワークフロー自動化に対応
動画生成モデルを新たに搭載
ChatGPTClaude対抗を鮮明化

Googleは2026年5月19日のGoogle I/O 2026で、AIアシスタントアプリGeminiの大幅アップデートを発表しました。目玉となる新機能「Daily Brief」は、ユーザーの受信トレイやカレンダー、重要タスクを自動で集約し、優先度順に整理して次のアクションまで提案する朝の情報整理機能です。米国Google AI有料会員向けに即日提供が始まっています。

アプリのデザインも全面刷新されました。「Neural Expressive」と呼ばれる新デザイン言語を採用し、流動的なアニメーション、鮮やかな配色、新フォント、触覚フィードバックを導入しています。AIの回答は重要情報を冒頭に太字で表示し、スクロールに応じて画像やタイムラインが展開される構成に変わりました。

常時稼働型のAIエージェントGemini Spark」も発表されました。クラウドベースで動作するため、スマートフォンをロックしていてもバックグラウンドで作業を続行できます。カスタムワークフローの作成にも対応し、来週にはGoogle AI Ultra会員向けに提供予定です。

動画生成の分野では新モデル「Gemini Omni」が登場しました。テキスト・画像音声を入力として高品質な動画を生成でき、Google FlowYouTube Shortsとの連携が予定されています。月間9億人超のユーザーを擁するGeminiアプリをチャットボットから総合AIハブへ進化させ、ChatGPTClaudeに対抗するGoogleの戦略が鮮明になっています。

Google、あらゆる入力から動画を生成するGemini Omniを発表

Gemini Omniの概要

テキスト・画像音声動画を統合入力
単一モデル動画を生成・編集
自然言語の指示で会話的に編集可能
物理法則や文化的知識に基づく高品質出力

提供形態と料金

初期モデルOmni Flashを本日公開
Geminiアプリ・YouTube Shorts・Flowで利用可
API提供は数週間以内を予定

安全性と企業利用

SynthID電子透かしを全動画に付与
デジタルアバター機能に本人認証を導入

Googleは2026年5月19日、年次開発者会議Google I/Oで、あらゆる入力から動画を生成できる新しいマルチモーダルモデル「Gemini Omni」を発表しました。CEOのサンダー・ピチャイ氏は「あらゆる入力からあらゆるコンテンツを生成できる」と説明し、テキスト予測から現実のシミュレーションへとAIが進化する次の段階だと位置づけています。

Gemini Omniは、テキスト・画像音声動画を組み合わせて入力し、単一のモデルで高品質な動画を出力できます。従来のように複数の専門モデルを連携させるのではなく、1つのモデル内で複数のモダリティを横断的に推論するため、一貫性のある編集が可能です。自然言語で指示を重ねる会話的な動画編集に対応し、前の指示を記憶したまま場面を発展させることができます。

最初のモデルとなるGemini Omni Flashは本日からGeminiアプリ、YouTube Shorts、動画編集ツールFlowで提供が開始されました。現時点では10秒の動画生成に対応しており、今後より長い動画にも対応予定です。AI Plus(月額20ドル)以上のサブスクリプションプランで利用でき、開発者・企業向けのAPI提供は数週間以内に予定されています。上位モデルのOmni Proの公開時期は未定です。

企業向けの活用領域は幅広く、マーケティング動画の量産、社内研修コンテンツの作成、製品デモの自動生成などが想定されています。また、ユーザー自身の声と姿を使うデジタルアバター機能も提供され、ディープフェイク防止のため録画と音声による本人認証が求められます。すべての生成動画にはGoogleSynthID電子透かしが埋め込まれ、AI生成コンテンツの検証が可能です。

競合環境としては、ByteDanceのSeedance、KuaishouのKling AI、英SynthesiaのAIアバターなどが存在します。GoogleNano Bananaに続くマルチモーダル統合の成果としてOmniを位置づけており、画像やオーディオの出力にも将来的に対応する計画です。企業の導入にあたっては、API公開後にデータガバナンスや利用規約を確認した上で本格運用に移行することが推奨されています。

Google Flow、自分のディープフェイク動画を生成できるアバター機能を追加

Omni Flashモデル導入

Gemini Omni Flash動画生成を刷新
映像と音声キャラクター一貫性が向上
実写素材とAI生成コンテンツの融合が可能に
140カ国以上のGoogle AI契約者に提供

アバター機能の仕組み

スマホで顔と声をスキャンして登録
自分のデジタルクローン動画に挿入
背景や服装の変更にも対応
SynthID透かしで生成元を明示

クリエイター向け新機能群

AIエージェントが企画から編集まで支援
自然言語でカスタムツールを作成可能
Flow Musicにも楽曲編集・MV生成機能追加

Googleは2026年5月19日のI/Oカンファレンスで、AI動画画像制作ツールGoogle Flowの大型アップデートを発表しました。新たに搭載されたGemini Omni Flashモデルにより、動画生成の品質が大幅に向上し、ユーザーが自分自身のアバターをAI動画に挿入できる機能が追加されています。

アバター機能では、ユーザーがスマートフォンで自分の顔と声を複数の角度からスキャンして登録します。登録後は、任意のAI生成動画に自分のデジタルクローンを挿入でき、背景の変更や服装の調整といった編集指示にもOmni Flashが対応します。Google Labs製品担当副社長のElias Roman氏は「撮影なしで自分をコンテンツに登場させたいクリエイター向けの機能」と説明しました。この仕組みは、OpenAIが昨年提供し約7カ月で終了したSoraアプリのセルフディープフェイク機能と類似しています。

生成されたすべての動画にはSynthID透かしが埋め込まれ、AI生成コンテンツであることを識別可能にしています。また、現時点では他人のアバター生成は許可されず、自分自身のみが対象という制限を設けることで、悪用リスクへの配慮を示しています。

クリエイター支援の面では、Google Flow Agentがプロジェクト全体を通じた企画・編集パートナーとして機能します。ブレインストーミングからバッチ編集、アセット整理まで、Geminiモデルを活用した幅広いタスクに対応します。さらに自然言語で画像エディタやカスタムシェーダーなどのビスポークツールを作成でき、他のユーザーと共有・リミックスすることも可能です。

Google Flow Musicにも新機能が追加されました。楽曲のセクション単位での精密編集、フルトラックのスタイル変換(カバー機能)、そしてOmni Flashを活用したミュージックビデオ生成が利用可能になっています。FlowFlow Musicの両方でモバイルアプリも提供開始され、外出先での制作にも対応します。

Cosmos動画生成モデルのLoRA微調整手法を公開

効率的な微調整手法

LoRA・DoRAでアダプタ注入
2Bパラメータモデルを単一GPUで学習可能
rank32で約5000万の学習パラメータ
アダプタ切替で複数ドメイン対応

ロボット動画生成への応用

92本のロボット操作動画で学習
人間の手の幻覚を微調整で解消
指示追従と物理的妥当性が大幅に向上
8基のH100で約2.5時間で学習完了

NVIDIAHugging Faceは、大規模動画生成モデルCosmos Predict 2.5をLoRAおよびDoRAで効率的に微調整する手法を公開しました。20億パラメータのモデル全体を再学習する代わりに、注意機構やフィードフォワード層に小規模なアダプタモジュールを注入することで、単一のGPUでも微調整が可能になります。ロボット操作の合成動画生成を主な応用先として、92本の実ロボット動画を使った学習手順が示されています。

微調整にはrectified flowの定式化が用いられ、ノイズサンプルからクリーンデータへ線形に輸送する速度をモデルが学習します。VAE、テキストエンコーダ、DiTの基盤重みはすべて凍結され、LoRAアダプタのパラメータのみが更新されます。数値安定性のため、アダプタの重みはfloat32にキャストされ、bf16混合精度で学習が進みます。

評価では、Sampson誤差による幾何的整合性と、Cosmos Reason2をLLM審査員とした物理的妥当性・指示追従性の3指標が用いられました。微調整前のベースモデルでは、ロボットの手が人間の手に置き換わる幻覚や、指定された手の左右が無視される問題が発生していましたが、LoRA・DoRAによる微調整でこれらが解消されました。

rank 8とrank 32の比較では、高ランクが指示追従性を向上させる一方、幾何的整合性や物理的妥当性はランク8でも十分という結果が得られました。これは物理的な事前知識が凍結された基盤モデルに既に含まれており、アダプタはドメイン固有の外観やタスク構造の学習のみを担うためと分析されています。DoRAは低ランクでの学習安定化に有用ですが、rank 32ではLoRAと同等の性能に収束しました。

Google、Gboardに音声入力AI「Rambler」搭載

Ramblerの主要機能

Gemini基盤の多言語対応音声入力
フィラー語の自動除去と文中訂正理解
コードスイッチングで言語切替に対応
音声データ非保存のプライバシー設計

市場への影響

Gboardの数億人規模の配布網が武器
Wispr FlowやTypelessなど新興勢力に打撃
Galaxy・Pixel限定で夏に提供開始
スタートアップは差別化が急務に

Googleは2026年5月12日、Android向けキーボードアプリGboardに、Geminiベースの音声入力機能「Rambler」を搭載すると発表しました。Android Show: I/O Edition 2026で披露されたこの機能は、「えーと」「あー」などのフィラー語を自動除去し、文中での時刻訂正なども自然に処理します。

Ramblerの大きな特徴は、Geminiベースの多言語モデルによるコードスイッチング対応です。英語からヒンディー語など、文の途中で言語を切り替えても文脈を維持したまま正確に書き起こせます。これは多言語話者の実際のコミュニケーションを反映した機能であり、欧米の音声入力アプリが対応に遅れていた領域です。

プライバシー面では、音声録音を保存せず、オンデバイスクラウドハイブリッド処理を採用しています。Android Core ExperiencesディレクターのBen Greenwood氏は、安全性とプライバシーへの長年の投資を強調し、サードパーティアプリとの差別化を図りました。

市場への影響は大きいと見られます。Wispr Flow、Typeless、Superwhisperなど音声入力スタートアップはデスクトップやiOSで成長してきましたが、Android市場は未開拓でした。Gboardは大多数のAndroid端末にプリインストールされており、Ramblerは数億人規模のユーザーに一気にリーチします。まずSamsung GalaxyとGoogle Pixel向けに夏から提供が始まり、その後他のAndroid端末にも拡大予定です。

プラットフォーム企業がOS層で参入する場合、独立系アプリはより高い精度や独自機能、強固なプライバシー保証といった明確な優位性がなければ生き残りが困難になります。音声入力スタートアップにとって、「良いものを作れるか」ではなく「ユーザーがわざわざ探してまで使いたいものを作れるか」が問われる局面に入りました。

Google、AI広告制作で中小企業を支援する新施策を開始

施策の概要

広告業界の著名クリエイター3名が参加
AI創作ツールFlowを全面活用
地元の中小企業向けにプロ品質の広告を制作
最終キャンペーンは6月に公開予定

中小企業への効果

大手ブランド並みの広告品質を実現
独自のブランドボイスを維持した制作が可能
顧客獲得とワークフロー効率化を同時に支援

Googleは2026年5月8日、広告業界の著名クリエイター3名と中小企業をつなぐ新施策「The Small Brief」を発表しました。この取り組みは、AIツールを活用してスタジオ品質の広告キャンペーンを制作し、中小企業ブランド力を引き上げることを目的としています。参加するクリエイターと支援対象の企業はすでに公表されており、最終成果物は6月に公開される予定です。

参加するのはJayanta Jenkins氏、Tiffany Rolfe氏、Susan Credle氏の3名で、いずれも広告業界を代表するクリエイティブディレクターです。各氏がそれぞれ支援する地元ビジネスを選び、ブランドストーリーを広告として形にします。制作にはGoogleのAIクリエイティブスタジオ「Flow」が全面的に使用されます。

Googleはこの施策を通じて、中小企業でも大手ブランドと同等のインパクトを持つ広告を制作できることを示す狙いがあります。AIツールにより、各企業固有の声やスタイルを保ちながらプロ品質の広告制作が可能になるとしています。さらに新規顧客の獲得や業務効率化にもAIが貢献すると強調しています。

本施策はクリエイティブ業界や他の中小企業に対し、AI活用の可能性を示すショーケースとしても位置づけられています。各クリエイターの制作プロセスの詳細と完成したキャンペーンは、2026年6月に公開される予定です。

Google Flow MusicがBelieveと提携しAI音楽制作ツールを提供

提携の概要と機能

Believe傘下アーティストに提供
作詞・メロディ・ジャンル探索を支援
Lyria 3 Proモデルが基盤
生成コンテンツの所有権はGoogle非主張

アーティストとの共創

選抜アーティストが毎週開発に参加
アンバサダー制度で製品改善に反映
TuneCore利用者も対象
責任あるAI訓練の方針を明示

Google Labsの音楽制作ツールFlow Music(旧ProducerAI)が、グローバルなアーティスト開発企業Believeとの提携を発表しました。この提携により、BelieveおよびTuneCore所属のアーティスト、プロデューサー、ソングライターにAI音楽制作ツールが提供されます。Flow Musicはミュージシャン自身が立ち上げたプロジェクトで、小規模なアーティストコミュニティとの共同開発を経て、今回より広い提供に踏み切りました。

Flow Musicは創作のパートナーとして機能し、作詞の支援や新しいメロディ・ジャンルの実験、さらには新たな楽器の創出まで対応します。アルバムの方向性を模索する初期段階から、歌詞の仕上げといった最終工程まで幅広く活用できます。Googleは、Flow Musicで生成されたオリジナルコンテンツ所有権を主張しない方針を明示しています。

提携の一環として、BelieveとTuneCoreが選出したアーティストやプロデューサーのグループが、Flow Musicの開発チームと毎週ミーティングを行います。このアンバサダー制度を通じて、実際の利用者のフィードバックが製品の将来に直接反映される仕組みです。

技術基盤には、Googleの最新音楽生成モデルLyria 3 Proが採用されています。同モデルは楽曲構成を理解し、イントロ・ヴァース・コーラス・ブリッジといった構成要素をプロンプトで指定できます。アマピアノからドリームポップまで多様なスタイルに対応し、複雑なリズム生成や他言語でのボーカル実験も可能です。訓練データにはYouTubeGoogleが利用権を持つ素材のみを使用しており、責任あるAI開発の姿勢を示しています。

GoogleとXPRIZEがAI映画コンペに350万ドル

コンペの概要

賞金総額350万ドルの映画制作コンペ
AI活用の短編・予告編を世界から募集
応募締切は2026年8月15日

Googleの支援体制

Google FlowなどAIツールを提供
大賞受賞者の短編を長編映画化支援
新興映画制作者の参入障壁を低減

背景と狙い

Google100 ZEROSイニシアチブの一環
楽観的で技術志向の未来像を募集

GoogleXPRIZEおよびRange Media Partnersと提携し、賞金総額350万ドルのグローバル映画コンペティション「Future Vision XPRIZE」を発表しました。このコンペはGoogleの「100 ZEROS」イニシアチブを通じて実施され、楽観的かつテクノロジー志向の未来を描く短編映画や予告編を世界中から募集します。

応募者は実写、アニメーション、AIツールのいずれも使用可能です。Googleは自社のAI映像生成ツール「Google Flow」の活用を推奨しており、クリエイティブ・テクノロジー・パートナーとして制作プロセス全体を支援します。

大賞受賞者には、3分間の応募作品を長編映画に発展させるためのクリエイティブおよびプロダクション面での支援が提供されます。Googleはこの取り組みを通じて、新興の映画制作者が直面する制作上の障壁を引き下げることを目指しています。

応募受付は既に開始されており、締切は2026年8月15日です。AI技術の進化によって映像制作の民主化が進むなか、大手テック企業がクリエイティブ産業への関与を深める動きとして注目されます。

AI音声入力アプリ主要11製品の機能と価格を比較

注目の有料アプリ

Wispr Flow月額15ドルで無制限入力
Aquaは低遅延と独自APIを提供
Dictatoは80ms遅延で即時テキスト化

プライバシー重視の選択肢

Monologueは完全ローカル処理に対応
VoiceInkはオープンソースでMac専用
Handyは無料で3OS対応の基本ツール

選定の判断軸

無料枠は月1,000〜16,000語と大差
買い切り型とサブスク型の二極化

TechCrunchが2025年版のAI音声入力(ディクテーション)アプリ11製品を実際にテストし、機能・価格・プライバシー対応を軸にランキング形式で紹介しました。大規模言語モデルと音声認識モデルの進化により、フィラーワードの自動除去や文脈に応じた書式設定が可能になり、従来の音声入力とは精度が大きく異なるレベルに達しています。

Wispr FlowmacOSWindowsiOSに対応し、フォーマル・カジュアルなど文体切替やCursorとの連携機能を備えています。AquaはY Combinator出資で、音声からテキスト表示までの遅延の短さを売りにし、独自の音声認識APIも外部提供しています。Dictatoはローカルモデル活用で80msという高速応答を実現しています。

プライバシーを重視するユーザー向けには、MonologueがAIモデルをデバイスにダウンロードしてクラウドを完全に回避する方式を採用しています。オープンソースではVoiceInkとHandyがあり、特にHandyは無料でMac・Windows・Linuxの3プラットフォームに対応します。VoiceTyprもローカル処理かつオープンソースで、99言語以上をサポートしています。

価格モデルはサブスクリプション型買い切り型に二分されます。サブスク型はWispr Flow・Aqua・Typelessなどが月額8〜15ドル帯で展開し、買い切り型はVoiceTyprが35ドルから、VoiceInkが25ドルから提供されています。無料枠もTypelessの週4,000語からWispr Flow iOSの月1,000語まで幅があり、用途と予算に応じた選定が求められます。

MCPの設計上の欠陥で20万台のAIサーバが危険に

脆弱性の全容

STDIO転送がOS命令を無制限実行
公開IPで7000台を確認、推計20万台
6つの本番環境で任意コマンド実行を実証
10件超の高深刻度CVEが発行

対策と業界の対立

Anthropicは「仕様通り」と修正を拒否
製品別パッチは根本解決にならず
STDIO設定を未信頼の入力として扱う必要
MCP登録サイト9割が審査なしで受理

OX Securityの研究者4名が、Anthropicが策定したオープン標準Model Context Protocol(MCPのSTDIOトランスポートに、設計レベルの深刻な脆弱性を発見しました。MCPはAIエージェントとツールを接続する標準規格として、OpenAIGoogle DeepMindも採用し、ダウンロード数は1億5000万回を超えています。STDIO転送はローカルツール接続の既定方式ですが、受け取ったOSコマンドをサニタイズなしにそのまま実行する仕組みになっています。

研究チームは公開IPアドレス上で7000台のSTDIO有効サーバを発見し、全体では約20万台が脆弱な状態にあると推計しました。6つの本番プラットフォームで任意コマンド実行を実証し、LiteLLM、LangFlowFlowise、Windsurf、DocsGPTなど主要製品にわたる10件超の高・重大CVEが発行されています。特にWindsurfでは、開発者が攻撃者のウェブサイトを訪問するだけで、ユーザ操作なしにローカルのMCP設定が書き換えられ、コード実行に至るゼロクリック攻撃が確認されました。

Anthropicはこの挙動を「仕様通り(expected)」と回答し、プロトコルの修正を拒否しました。同社の論理では、STDIO はローカルプロセスを起動するための転送方式であり、設定ファイルへの書き込み権限を持つ者は当該マシンでのコマンド実行権限も有しているため、入力のサニタイズは開発者側の責任であるとしています。一方OX Securityは、20万人の開発者全員に正しいサニタイズを期待すること自体が問題だと反論しています。

Cloud Security Allianceも独自にOXの調査結果を確認し、MCP接続インフラを「アクティブな未パッチの脅威」として扱うよう勧告しました。製品レベルのパッチは個別の侵入経路を塞ぐものの、プロトコル自体のSTDIO動作は変更されないため、新しいMCPサーバを構成すれば同じ脆弱性を引き継ぎます。セキュリティ専門家は、全MCP STDIO設定を未信頼の入力として扱い、サンドボックス隔離を徹底するよう呼びかけています。

Mistral AI、企業向け実行基盤Workflowsを公開

Workflowsの技術設計

Temporal基盤の耐障害実行
制御と実行の分離でデータ主権確保
OpenTelemetry対応の可観測性

本番導入済みの活用事例

貨物リリース自動化で書類処理を効率化
KYC審査を数分に短縮
銀行の問い合わせを自動分類・転送

Mistralの全体戦略

Forge含む3層基盤を構築
年間売上4億ドル超で急成長中

パリ拠点のAI企業Mistral AIは2026年4月28日、エンタープライズ向けAIオーケストレーション基盤「Workflows」をパブリックプレビューとして公開しました。同社のStudioプラットフォームの一部として提供されるこの製品は、企業がAIシステムを概念実証から本番環境へ移行するための生産グレードの実行基盤です。すでに複数の顧客企業が本番運用しており、日次で数百万件の処理を実行しています。

Workflowsの技術的な特徴は、UberのCadenceプロジェクトから派生したTemporalの耐久実行エンジンを基盤としている点です。Mistralはこれにストリーミング、ペイロード処理、マルチテナンシー、可観測性などAI固有の要件を追加しました。制御プレーンと実行プレーンを分離する設計により、実行ワーカーを顧客自身の環境内で稼働させることが可能で、データが顧客の管理領域から外に出ることはありません。規制産業におけるデータ主権要件に対応する重要な設計判断です。

実際の導入事例として、物流分野での貨物リリース自動化、金融機関でのKYC審査、銀行のカスタマーサポートの3つが紹介されています。物流では税関申告や危険物分類などの書類処理をAIが担い、人間は適切なタイミングで承認のみ行います。KYC審査は従来アナリストが数時間かけていた作業を数分に短縮し、監査可能な形式で結果を出力します。銀行サポートでは問い合わせの意図と緊急度を自動分類し、すべての判断がStudio上で追跡可能です。

Workflowsはドラッグ&ドロップ型ではなく、Pythonによるコードファーストのアプローチを採用しています。ミッションクリティカルな業務にはコードによる精密な制御とバージョン管理が不可欠だという判断です。エンジニアが作成したワークフローチャットボット「Le Chat」に公開でき、組織内の誰でも実行可能になります。すべてのステップはStudioで追跡・監査されます。

Workflowsは、Mistralが構築する3層エンタープライズプラットフォームの中間層に位置します。下層にはカスタムモデル訓練基盤「Forge」、上層にはユーザー向けコーディングエージェント「Vibe」があります。同社の年間売上ランレートは4億ドル超に達し、年末までに10億ドルを目指しています。評価額は約140億ドルで、欧州AI企業として異例の成長軌道を描いています。

競合環境はAWSのBedrock AgentCore、MicrosoftCopilot Studio、GoogleのVertex AIなど大手クラウドが参入する激戦区です。Mistralの差別化要因は、垂直統合されたプラットフォーム、柔軟なデプロイ構成、そして欧州拠点によるデータ主権への対応力にあります。今後はマネージド版の提供、ビジネスユーザー向けの機能拡充、エージェント向けのガードレール強化を予定しています。

Nothing、AI音声入力ツールを発表

機能と特徴

システムレベルで全アプリ対応
フィラー語の自動除去
カスタム音声ショートカット設定
100以上の言語に対応

展開と展望

Phone (3)で先行提供開始
Phone (4a) Proへ今月中に展開
アプリ別トーン調整機能を予定
Google等も類似ツール開発中

英スマートフォンメーカーのNothingは2026年4月24日、AI搭載の音声入力ツール「Essential Voice」を発表しました。同ツールはデバイス上のあらゆるアプリで動作し、音声をフォーマット済みテキストに変換します。Wispr FlowやSuperwhisperなどの競合製品がひしめくAI音声入力市場に、ハードウェアメーカーとして参入した形です。

Essential Voiceの特徴は、「um」「ah」といったフィラー語を自動で除去する点に加え、ユーザーが独自の音声ショートカットを設定できる点にあります。たとえば「my address」と発話するだけで、登録した住所全文を入力できます。Essentialキーまたはキーボードから起動する仕組みです。

対応端末はまずPhone (3)からスタートし、今月中にPhone (4a) Pro、来月にはPhone (4a)へと順次展開される予定です。100以上の言語をサポートし、音声入力しながら別言語へのリアルタイム翻訳も可能です。

今後はアプリカテゴリごとにAI編集のトーンを切り替える「アプリベースカスタムスタイリング」機能も追加予定です。仕事用とメッセージ用で文体を自動調整できるようになります。

NothingはOS統合型の音声入力を提供する数少ないハードウェアメーカーの一つです。Googleも4月初旬にオフラインAI音声入力アプリをリリースしており、今後同様のシステムレベル統合が業界全体で広がる可能性があります。

Google動画生成Flow、多分野の創作事例を公開

実験から生まれる創造性

偶然の発見を重視する姿勢
Flowを「終わりのない遊び場」に
AI Studioとの併用で表現拡張
個人的な記憶を作品に昇華

多様な領域への広がり

刺繍デザインを仮想世界に拡張
ドキュメンタリー手法との融合
視覚的一貫性の維持手法を開発
共創モデルでツール改善推進

Google動画生成ツールFlowのアーティスト共創プログラム「Flow Sessions」第3期の終了を発表しました。2025年9月に開始されたこのプログラムは、6週間にわたりアーティストがFlowを使って作品を制作する取り組みです。第3期では従来の映像制作者に限らず、ジャーナリズム広告、ファッションなど多様な分野のクリエイターを初めて募集しました。

参加アーティストの一人であるJulie Wielandは、Flowを「終わりのない遊び場」として活用し、石のゴーレムがタンポポの命を見守る循環的な物語を制作しました。AI Studioでフレームレートを下げるアプリを作成し、手作りのストップモーション風の表現を実現するなど、複数のツールを組み合わせた実験的な手法が注目されます。

Calvin Herbstは幼少期の16mmフィルム映像をスタイル変換に活用し、愛犬との別れを描いた作品を制作しました。Stephane BeniniはVeoの視覚的なドリフトをストーリーテリングの技法として意図的に使い、記憶の断片をたどる父娘の物語を表現しました。いずれも個人的な経験を出発点とする創作の重要性を示しています。

映像制作以外の分野では、ファッションデザイナーのCharline Pratがフランスのスタジオ COMBOと協力し、実際に刺繍したガーメントを起点に、縫製では実現できない質感の世界Flowで表現しました。視覚的一貫性を保つため、Flowに参照ライブラリを提供する手法を開発しています。

クリエイティブディレクターのChloe Desaullesは、ドキュメンタリーの手法を用いてニューヨークの架空の街を驚くほどリアルに描写しました。AI生成メディアにおけるリアリズムの意味を問う作品です。Googleは共創を通じてツールを改善する方針を掲げており、多様な分野のクリエイターとの協働がFlowの進化を加速させています。

Vercel Workflowsが正式版に、耐久実行の新モデル提供

製品概要と実績

ベータで1億回超の実行処理
1500社以上が採用済み
TypeScriptとPython両対応
オープンソースSDKとして公開

エージェント時代への対応

永続ストリームで切断復帰可能
ステップ単位の自動リトライ
暗号化がデフォルトで組込み
セルフホスト環境にも対応

Vercelは2026年4月16日、長時間実行ワークロード向けのプログラミングモデル「Vercel Workflows」の一般提供を開始しました。Workflowsは、AIエージェントやバックエンド処理など、単一リクエストに収まらないワークロードを耐久的かつ信頼性高く実行するための仕組みです。2025年10月のベータ開始以来、1500社以上の顧客が利用し、1億回以上の実行と5億以上のステップを処理してきました。

Workflowsの特徴は、オーケストレーションをアプリケーションコード内に統合する点にあります。TypeScriptでは「use workflow」「use step」のディレクティブを使い、通常の関数呼び出しのように記述するだけで、キュー管理やリトライ、永続化、可観測性が自動的に提供されます。別途オーケストレーションサービスを運用する必要がなく、実際に使用したコンピュートのみに課金されます。

AIエージェント向けには、永続ストリームや人間承認フロー用のフック、スリープによる待機など、本番運用に必要な機能が揃っています。AI SDKとの深い統合により、ツール呼び出しや状態管理を備えた永続エージェントの構築が可能です。ステップごとのペイロードは最大50MB、実行全体で2GBまで対応し、マルチモーダルな処理にも十分な余裕があります。

セキュリティ面では、すべてのデータがデフォルトで暗号化され、デプロイ環境の外部では復号されません。Workflow SDKはオープンソースで、Vercelのマネージド環境だけでなく、PostgresやCloudflareなどのセルフホスト環境でも動作します。次期バージョンのWorkflows 5では、ネイティブな並行制御やグローバルデプロイ、スナップショットベースのランタイムが予定されています。

Vercel、AIエージェント向け自律型基盤構想を発表

展開の主役が交代

週次デプロイ3カ月で倍増
3割超コーディング代理経由
Claude Code75%を占有
半年で1000%増の急拡大

三層の自律基盤

代理が直接展開できるCLI/API
AI Gatewayと統合
サンドボックスと可観測性内蔵

自己修復する基盤

異常検知から原因分析まで自動

Vercelは2026年4月9日、最高プロダクト責任者トム・オッキーノ氏のブログで「自律型基盤(Agentic Infrastructure)」構想を発表しました。過去3カ月で同社の週次デプロイ数は倍増し、全体の30%超をコーディングエージェントが開始しており、半年前と比べ1000%の伸びを示しています。開発の主役が人から機械へ移る転換点で、クラウド基盤の再定義を迫る内容です。

内訳ではClaude Code全体の75%を占め、LovableとV0が6%、Cursorが1.5%と続きました。エージェント経由で展開されたプロジェクトは、人間が展開したものに比べてAI推論プロバイダーを20倍呼び出す傾向があると同社は指摘します。書くのも動かすのもAIという構造が、運用の常識を崩しはじめています。

オッキーノ氏は新基盤を三層で捉え直しました。第一にコーディング代理が展開する先としての基盤で、即時プレビューURLやロールバック、CLI・API・MCPサーバーを通じ人手を介さない機械駆動開発を可能にします。第二にエージェント自体を構築・実行する基盤で、長時間実行や多段階制御など従来のサーバーレスとは異なる要件に応えます。

第二層の中核は、AI SDK 6のエージェント抽象化、数百モデルを束ねるAI Gateway、遅延と並行性に最適化したFluid compute、状態保持のWorkflowsとQueues、未検証コード向けSandbox、そして挙動追跡のObservabilityです。これらを共有コンテキストの下に束ねる点が特徴です。

第三層は基盤そのものが自律的に振る舞う段階を指します。遅延急増やモデル提供者の障害発生時に、プラットフォームが観測データとログとソースコードを自ら参照し、根本原因を分析し、サンドボックス内で修正案を検証します。現時点では人間の承認を前提としつつ、文脈の蓄積により運用負担を段階的に引き受ける方針です。

オッキーノ氏は「クラウドの歴史は機械から人を取り除く歴史」と総括し、ソフトウェアが自ら書き、出荷し、癒やす時代に備える基盤こそが次の十年の勝者を決めると結びました。経営者や開発リーダーにとって、エージェント前提の運用設計をいつどのように取り込むかが問われる局面です。

Googleがオフライン対応AI音声入力アプリをiOSで公開

アプリの主要機能

Gemmaベースの音声認識モデル搭載
オフラインでの音声書き起こしに対応
フィラー語や言い直しを自動除去
要約・フォーマル変換など文体調整機能

競合との差別化

無料でダウンロード可能
Gmailから専門用語を自動インポート
Android版も開発中と示唆
Wispr FlowやSuperWhisperに対抗

Googleは2026年4月、オフライン対応のAI音声入力アプリ「Google AI Edge Eloquent」をiOS向けに静かにリリースしました。このアプリはGemmaベースの自動音声認識モデルを搭載し、端末にモデルをダウンロードすればネットワーク接続なしで音声の書き起こしが可能です。

最大の特徴は、一般的な音声入力ソフトとは異なり、「um」「ah」などのフィラー語や言い直しをAIが自動で除去し、整った文章として出力する点です。クラウドモードをオンにすればGeminiモデルによるテキスト補正も利用でき、「要約」「フォーマル」「短縮」「詳細」といった文体変換オプションも備えています。

利便性の面では、Gmailアカウントから専門用語や固有名詞を自動インポートする機能を搭載しています。また、過去の書き起こし履歴の検索、1分あたりの発話速度の表示など、業務利用を意識した機能も充実しています。

現在はiOS限定ですが、App Storeの説明文にはAndroidへの言及があり、デフォルトキーボードとしての設定やWispr Flowのようなフローティングボタン機能も予定されています。AI音声入力市場が拡大するなか、Googleの本格参入は競合各社にとって大きな脅威となりそうです。

FLORA、Vercel基盤で画像生成AIエージェント「FAUNA」を構築

FAUNAの特徴と狙い

50以上の画像生成モデルを統合
アイデアから自動で多方向の視覚探索を展開
ワークフロー設計の負担をエージェントが代替

Vercel移行の効果

AI SDKとWorkflow SDKで基盤を一本化
本番投入までの速度が2倍に向上
インフラ議論からプロダクト議論へ転換

今後の展望と周辺機能

UI/UX以外の全デザイン業務を支援対象
Vercelがチーム間のDB移行機能も追加

クリエイティブワークフロー基盤を提供するFLORAは、VercelAIスタック上に画像生成AIエージェントFAUNA」を構築したと発表しました。50以上の画像モデルを統合し、ファッションキャンペーンなどの視覚制作を効率化する狙いです。

FAUNAは従来のノードベースのキャンバスとは異なり、ユーザーがアイデアを伝えるだけで参考画像の収集、モデル選択、バリエーション生成を自動で行います。ワークフロー設計の知識がなくても、プロ品質のビジュアル探索が可能になります。

技術面では、画像動画生成は数分かかり、1回のセッションで多数の並行ジョブが発生します。FAUNAはVercelAI SDKエージェントフレームワークとWorkflow SDKの永続化機能を組み合わせ、長時間実行や障害時の再試行に対応しています。

FLORA開発チームは以前LangChainとTemporalを併用していましたが、2つのシステムの保守負担が課題でした。Vercelへの移行により基盤が一本化され、本番投入速度が2倍に向上したと報告しています。インフラの議論が不要になり、プロダクト改善に集中できるようになりました。

FLORAはUI/UX以外の全デザイン業務の支援を最終目標に掲げています。また、Vercelは同時期にダッシュボードからチーム間でDB移行ができる機能も公開しました。Prisma、Neon、Supabaseに対応し、今後対応プロバイダーを拡大する予定です。

Amazon傘下Ring、AI活用アプリストアを米国で開設

アプリストアの概要

1億台超のカメラ基盤を活用
介護・店舗分析・賃貸管理など多分野展開
開発者Ring端末向けアプリを配信可能
年内に数百アプリ・数十業種が目標

プライバシーへの対応

顔認識やナンバープレート読取を禁止
監視技術への消費者反発を受けた措置
Flock Safetyとの提携も解消済み

収益モデルと配信方式

紹介手数料は10%に設定
AppleGoogleの課金を回避する独自構造

Amazon傘下のスマートカメラ企業Ringは2026年3月、自社カメラ向けのAIアプリストア米国で正式に開設しました。1月のCESで予告されていた同ストアは、世界に1億台以上設置されたRingカメラの映像・音声データをAIで活用し、ホームセキュリティ以外の用途へ拡張することを目指しています。

開設時点で約15のアプリが利用可能です。SoftBank出資のDensity社は高齢者の見守りアプリ「Routines」を提供し、転倒や生活パターンの変化を家族に通知します。QueueFlowは待ち時間・混雑状況の分析、Minutは民泊ホスト向けの騒音・温度監視など、業種特化のアプリが揃っています。

創業者兼CEOのJamie Siminoff氏は「AIにより長いテールのユースケースが開ける」と語り、年内に数百のアプリを数十の業種で展開する計画を示しました。鳥の識別やリスク検知、芝生の健康管理、来店者カウントなど多彩なカテゴリーのアプリが開発中です。

一方、監視技術への消費者の反発も強まっています。Ringは迷子ペット捜索や山火事検知などの機能を公開した結果、AIカメラによる追跡・録画への懸念が顕在化しました。同社は顔認識ツールやナンバープレートリーダーの提供を禁止し、法執行機関向けAIカメラのFlock Safetyとの提携も解消しています。

収益面では、Ringがユーザーをパートナーアプリに誘導した際に10%の手数料を徴収します。ユーザーはパートナーのアプリを別途ダウンロードする仕組みのため、AppleGoogleのアプリ内課金手数料を回避できる点が特徴です。サブスクリプションのほか買い切りや広告モデルにも対応する方針で、開発者はRingの開発者サイトからアプリを申請できます。

Cohereが音声認識モデルをオープンソースで公開

モデルの特徴

20億パラメータの軽量設計
消費者向けGPUで自己運用可能
14言語対応(日本語含む)
1分間で525分音声処理

性能と展開

WER 5.42で業界最高精度
人間評価で勝率61%達成
企業向け基盤Northに統合予定
API無料提供を開始

エンタープライズAI企業のCohereは2026年3月26日、同社初の音声モデル「Transcribe」をオープンソースで公開しました。議事録作成や音声分析などの用途を想定した自動音声認識モデルで、APIを通じて無料で利用できます。

Transcribeは20億パラメータと比較的軽量に設計されており、消費者向けGPUでの自己ホスティングが可能です。英語、日本語、中国語、韓国語など14言語に対応し、1分間で525分の音声を処理できる高いスループットを実現しています。

Hugging FaceOpen ASRリーダーボードでは、平均単語誤り率(WER)5.42を達成し、Zoom Scribe v1やIBM Granite 4.0、ElevenLabs Scribe v2などの競合モデルを上回りました。人間評価者による精度・一貫性・実用性の評価でも平均勝率61%を記録しています。

一方で、ポルトガル語、ドイツ語、スペイン語の文字起こしでは競合に後れを取る課題も残っています。Cohereは今後、同モデルを企業向けエージェント統合基盤「North」やマネージド推論プラットフォーム「Model Vault」にも展開する計画です。

音声認識モデル市場は、GranolaやWispr Flowなどの議事録・ディクテーションアプリの需要拡大に伴い急成長しています。Cohereは2025年の年間経常収益が2億4000万ドルに達したとされ、IPOの可能性も示唆されており、今回の音声モデル投入で事業領域の拡大を図ります。

Mozilla開発者がAIエージェント向け知識共有基盤「cq」を発表

cqの基本構想

エージェントの知識共有基盤
古いAPI呼び出しなど誤情報を防止
既解決の問題を再利用しトークン節約

仕組みと課題

未知の作業前にcommonsへ問い合わせ
新知見を提案し他エージェント検証
利用実績で信頼度を蓄積
セキュリティとデータ汚染が課題

Mozilla開発者ピーター・ウィルソン氏は、AIコーディングエージェント向けの知識共有プラットフォーム「cq」を発表しました。同氏はこれを「エージェント版Stack Overflow」と位置づけています。

現在のコーディングエージェントは、学習データの時期的な制約により、廃止済みのAPIを呼び出すなど古い情報に基づいた判断をしがちです。RAGなどの手法で最新情報を取得する場合もありますが、必要な場面で常に機能するわけではありません。

さらに、複数のエージェントが同じ問題に個別に取り組み、すでに解決済みの課題に対して大量のトークンとエネルギーを消費している現状があります。cqはこの非効率を解消し、一度得た知見を全エージェントで共有することを目指します。

cqの仕組みでは、エージェントが未知の作業に着手する前にcommonsと呼ばれる共有知識基盤に問い合わせます。たとえばStripe APIの特殊な挙動を別のエージェントが発見済みなら、その知見を即座に活用できます。新たな発見は提案として共有され、他のエージェントが有効性を検証します。

ただし、実用化に向けてはセキュリティ、データ汚染、正確性の担保が大きな課題です。現状ではclaude.mdなどの手動設定ファイルが主流ですが、cqはこれを自動化・体系化する試みとして注目されています。

ByteDance、AIエージェント基盤DeerFlow 2.0をOSS公開

DeerFlow 2.0の特徴

MIT Licenseで商用利用可
Docker sandbox内で安全に実行
複数サブエージェントの並列処理
長時間タスクの自律実行に対応

企業導入の論点

完全ローカル運用が可能
GPU・VRAMの大量確保が必要
ByteDanceで規制審査の対象に
独立セキュリティ監査は未実施

ByteDanceは2026年2月、AIエージェント・オーケストレーション基盤「DeerFlow 2.0」をMITライセンスでオープンソース公開しました。複数のAIサブエージェントを統合し、数時間に及ぶ複雑なタスクを自律的に実行できる「SuperAgent」フレームワークです。

DeerFlow 2.0はDockerベースのサンドボックス環境を採用し、エージェントの実行をホストシステムから完全に分離しています。ブラウザ、シェル、永続ファイルシステムを備えた独立環境で、bashコマンドの実行やファイル操作を安全に行えます。

技術的にはLangGraph 1.0LangChainで全面的に書き直された新設計です。OpenAIAnthropicDeepSeekOllamaなどモデル非依存で動作し、Kubernetes上での分散実行やSlack・Telegram連携にも対応しています。

公開後わずか数週間でGitHub上で3万9千スターを獲得し、ML研究者やインフルエンサーの間で急速に注目が高まっています。SaaSエージェントサービスの価格破壊につながるとの見方も広がっています。

一方、企業導入には課題も残ります。セットアップにはDocker・YAML・CLIの知識が必要で、独立したセキュリティ監査は未実施です。またByteDanceが開発元であるため、金融・医療・防衛など規制業種ではソフトウェアの出自に関する審査が求められる可能性があります。

Vercel Workflowが全データのエンドツーエンド暗号化を標準搭載

暗号化の仕組み

コード変更不要で自動適用
デプロイごとに固有の暗号鍵生成
AES-256-GCMで機密性と完全性確保
イベントログには暗号文のみ保存

復号と運用

ダッシュボードでブラウザ内復号
CLIの--decryptフラグで復号可能
環境変数と同一の権限モデル適用
全復号操作を監査ログに記録

Vercelは、サーバーレスワークフロー基盤「Vercel Workflow」において、すべてのユーザーデータに対するエンドツーエンド暗号化を標準機能として提供開始しました。開発者側のコード変更は一切不要です。

暗号化の対象は、ワークフローの入力値、ステップの引数・戻り値、フックペイロード、ストリームデータなど、イベントログに書き込まれるすべてのデータです。APIキーやトークン、ユーザー認証情報といった機密データも安全に受け渡しできるようになります。

技術的には、各デプロイに固有の暗号鍵が割り当てられ、ワークフロー実行ごとにHKDF-SHA256で鍵を導出します。データはAES-256-GCM方式で暗号化され、機密性と完全性の両方が担保される設計です。

復号はWebダッシュボードまたはCLIから実行できます。ダッシュボードではWeb Crypto APIを用いてブラウザ内で完結するため、観測サーバーが平文データに触れることはありません。アクセス権限は環境変数の閲覧権限と連動しています。

すべての復号リクエストは監査ログに記録され、チーム全体でアクセス状況を把握できます。また、カスタム実装向けにgetEncryptionKeyForRun()メソッドを提供しており、独自のWorld実装でも暗号化機能を利用可能です。

GitHub Actions入門、YAML定義でCI/CD自動化を実現

基本構成と仕組み

YAMLワークフロー定義
イベント駆動で自動実行
ホステッドランナーで仮想実行
Marketplaceの再利用可能アクション活用

実践と運用管理

イシュー自動ラベル付けを実装
permissionsでアクセス権制御
Actionsタブで実行履歴確認
ワークフロー一時停止・再開対応

GitHubは、リポジトリに組み込まれたCI/CDおよび自動化プラットフォーム「GitHub Actions」の入門ガイドを公開しました。YAMLファイルでワークフローを定義し、プッシュやプルリクエストなどのイベントをトリガーに自動実行される仕組みです。

ワークフローイベントランナージョブの3要素で構成されます。イベントが発火するとGitHubが仮想マシン上でジョブを起動し、定義されたステップを順次実行します。Ubuntu、WindowsmacOSのホステッドランナーが提供されています。

実践例として、新規イシューに自動でラベルを付与するワークフローの作成手順が紹介されています。.github/workflowsディレクトリにYAMLファイルを配置し、トリガー条件とジョブ内容を記述します。GitHub CLIを活用したスクリプト実行も可能です。

セキュリティ面では、permissionsキーワードでジョブごとのアクセス権を制御します。環境変数にはGitHubが自動生成するGITHUB_TOKENを設定し、リポジトリへの安全なアクセスを実現しています。

GitHub Marketplaceには、コードのチェックアウトやNode.jsセットアップなど再利用可能なアクションが多数公開されています。パッケージ公開、テスト実行、セキュリティチェックなど幅広い自動化に対応しており、Actionsタブからワークフローの監視・管理・デバッグが可能です。

GitHubがエージェント型ワークフローのセキュリティ設計を公開

多層防御の仕組み

3層アーキテクチャで隔離
サブストレート層がVM境界を保証
設定層が権限・接続を制御
計画層が段階実行を管理

エージェントへの制約

シークレット非公開原則を徹底
書き込みは全件バッファ後に検査
全トラストバウンダリで完全ログ取得

GitHubは2026年3月、CI/CD環境でAIエージェントを安全に動作させる「GitHub Agentic Workflows」のセキュリティアーキテクチャを公式ブログで詳細に公開した。同ワークフローGitHub Actions上で動作し、エージェントの非決定性とCI/CDの高権限環境が組み合わさる新たな脅威モデルに対応している。

脅威モデルの核心は、エージェントが信頼できない入力を処理しながらリポジトリ状態を自律的に判断するという特性にある。プロンプトインジェクション攻撃により、悪意あるウェブページやイシューがエージェントを操作し、シークレットの漏洩や不正なコミットを引き起こす可能性があるとGitHubは指摘している。

これに対してGitHubは「多層防御」「エージェントへのシークレット非公開」「全書き込みの段階的検査」「完全ログ記録」の4原則を設計指針とした。エージェントは専用コンテナに隔離され、ファイアウォールでインターネットアクセスを制限し、LLM認証トークンはAPIプロキシが代理保持する構造をとる。

書き込み操作については、エージェントが直接GitHubへ書き込むことを禁止し、Safe Outputs MCPサーバーを経由してバッファリングする仕組みを採用した。バッファされた操作はフィルタリング・コンテンツモデレーション・シークレット除去の3段階検査を経て初めて実行される。許可する操作の種類や上限件数もワークフロー作者が宣言的に指定できる。

ログ記録はファイアウォール層・APIプロキシ・MCPゲートウェイの各トラストバウンダリで徹底される。これによりインシデント後のフォレンジック解析や異常検知が可能となる。GitHubは今後、リポジトリオブジェクトの公開範囲や作者ロールに基づく情報フロー制御を追加する計画も明らかにしている。

GitHub Security Lab、AI脆弱性スキャンの自動化フレームワークを公開

フレームワークの仕組み

YAMLベースのタスクフロー設計
脅威モデリングで誤検知を抑制
リポジトリを機能別コンポーネントに分割
エントリポイントと権限境界を自動分析
提案→監査の2段階で精度向上

発見された重大脆弱性

Outlineで権限昇格の認可バグ
WooCommerce等ECサイトで個人情報漏洩
Rocket.Chatで任意パスワード認証突破

実績と知見

40超リポジトリで80件以上報告
ロジック系バグの検出に特に有効
偽陽性率22%と低水準を実現

GitHub Security Labは、LLMを活用してオープンソースプロジェクトの脆弱性を自動検出するフレームワーク「seclab-taskflows」を公開しました。YAMLで定義したタスクフローをGitHub Copilotと連携して実行し、これまでに80件以上の脆弱性を報告しています。

フレームワークの核心は脅威モデリング段階にあります。リポジトリを機能別コンポーネントに分割し、エントリポイントや権限境界を分析した上で、LLMに脆弱性候補を提案させます。その後、別タスクで厳格な基準に基づき監査することで、幻覚や誤検知を大幅に抑制する設計です。

代表的な発見例として、コラボレーションツールOutlineでの権限昇格バグがあります。ドキュメントのグループ管理APIが弱い権限チェックしか行わず、一般ユーザーが管理者権限を付与できる深刻な問題をLLMが初回実行で特定しました。

Rocket.Chatでは、bcrypt比較関数のPromiseをawaitせずに評価していたため、任意のパスワードでログインできる致命的なバグが見つかりました。ECサイトでもWooCommerceやSpreeで顧客の個人情報が漏洩する認可バグが連鎖的に発覚しています。

40以上のリポジトリを対象とした分析では、LLMが提案した1003件のうち139件を脆弱性と判定し、手動検証後に19件を重大脆弱性として報告しました。特にIDORやビジネスロジック系の論理バグ検出に強みを発揮し、従来の静的解析ツールでは困難だった認可ロジックの欠陥を高精度で発見できることが実証されています。

Google NotebookLMが映画風AI動画生成機能を公開

映画風動画の特徴

Gemini 3Veo 3を統合活用
ナレーション付きスライドから映像表現へ進化
Geminiが構成・演出を自動決定
流動的アニメーションと詳細な視覚表現

提供条件と制約

Google AI Ultra契約者限定
英語のみで本日提供開始
1日最大20本の生成上限
Web・モバイル両対応

Googleは、AIノートツール「NotebookLM」に映画風の動画生成機能「Cinematic Video Overviews」を追加したと発表しました。ユーザーのリサーチやノートを基に、完全にアニメーション化された没入型の動画を自動生成します。

従来のVideo Overviews機能はナレーション付きスライドショーの生成に限られていましたが、新機能ではGemini 3Nano Banana Pro、Veo 3など複数のAIモデルを組み合わせることで、滑らかなアニメーションと豊かな視覚表現を実現しています。

Geminiは「クリエイティブディレクター」として機能し、最適なナラティブ構成、ビジュアルスタイル、フォーマットの決定から、一貫性を確保するための自己修正まで、数百に及ぶ構造的・様式的判断を自動的に行います。

本機能は現在、Google AI Ultraサブスクリプション契約者(18歳以上)に限定して英語版のみ提供されています。1日あたりの生成上限は20本に設定されており、Web版とモバイル版の両方で利用可能です。

Googleは近月、Veo AIモデルのアップグレードや動画生成ツールFlowのアクセス拡大、ゲーム風映像を生成する「Project Genie」のデモなど、AI動画分野への投資を加速させており、今回の機能追加もその一環に位置づけられます。

Black Forest Labs、外部教師不要の自己学習手法で訓練速度2.8倍に

Self-Flowの技術革新

外部エンコーダ依存を完全排除
二重タイムステップ方式で自己蒸留
画像動画音声統一学習を実現

性能と効率の飛躍

従来比約50倍の訓練ステップ削減
FID 3.61でREPA超えの画質達成
テキスト描画精度が大幅向上
ロボット制御タスクでも高成功率

企業への戦略的意義

計算コスト3分の1で最先端到達
外部モデル依存排除で技術負債削減

独Black Forest Labsは、生成AIモデルの訓練において外部の意味理解モデルに依存しない新手法「Self-Flow」を発表しました。従来のStable DiffusionやFLUXなどの拡散モデルはCLIPやDINOv2といった凍結エンコーダに頼っていましたが、この制約を根本から解消する技術です。

Self-Flowの核心は「二重タイムステップスケジューリング」と呼ばれる仕組みです。入力データに異なるレベルのノイズを適用し、生徒モデルには強く劣化させたデータを、教師モデル(自身のEMA版)にはより鮮明なデータを与えます。生徒が教師の見ている内容を予測する自己蒸留により、生成と意味理解を同時に学習します。

実用面での成果は顕著です。Self-Flowは現行標準のREPA手法と比較して約2.8倍高速に収束し、従来のバニラ訓練と比べると必要ステップ数は約50分の1に削減されました。40億パラメータのマルチモーダルモデルでは、画像FID 3.61、動画FVD 47.81とREPAを上回るスコアを記録しています。

特筆すべきはマルチモーダル対応力です。AIが苦手としてきたテキスト描画の精度が大幅に向上し、動画生成では手足が消える幻覚アーティファクトが解消されました。さらに映像と音声同期生成も単一プロンプトから可能になり、外部エンコーダでは困難だった領域を克服しています。

企業にとっての戦略的価値も大きく、計算予算を約3分の1に圧縮しつつ最先端性能を達成できます。ロボティクス分野では675Mパラメータ版をRT-1データセットで微調整し、複雑な多段階タスクで高い成功率を実現しました。外部エンコーダへの依存排除により、技術負債の削減とスケーラビリティの確保が可能となり、自社データに特化した独自モデル開発の現実性が大きく高まっています。

Decagon、評価額45億ドルで初の従業員株式売却を完了

資金調達と評価額

評価額45億ドルで株式売却
6月の15億ドルから3倍に急騰
Coatue・a16zら主要VCが主導
創業3年未満で急成長

事業と市場環境

AI顧客対応エージェントを提供
大手100社超が導入済み
世界1700万人のCS人員が自動化対象
AI人材獲得競争が株式流動化を加速

Decagonは、AI顧客サポートスタートアップとして初のテンダーオファー(従業員向け株式売却)を完了しました。評価額45億ドル(約6,750億円)で、300人超の従業員が保有株式の一部を現金化できるようになります。

今回の株式売却は、2カ月前に2億5,000万ドルのシリーズDを主導したCoatue、Index Ventures、a16z、Forerunnerなど同じ投資家陣が引き受けています。投資家は急成長企業への持分拡大に意欲的で、従業員への流動性提供が実現しました。

同社の評価額は2025年6月の15億ドルから3倍に跳ね上がりました。ARR(年間経常収益)は2024年末時点で8桁ドルを超えており、その後の具体的な売上は非公開ですが、評価額の急騰が事業成長の勢いを物語っています。

AI人材の獲得競争が激化するなか、ElevenLabs、Linear、Clayなど有力AIスタートアップも相次いで従業員向けテンダーオファーを実施しています。株式の現金化機会は、優秀な人材の採用・定着における強力なインセンティブとなっています。

Decagonは大企業向けにチャット・メール・音声で顧客問い合わせを自律的に解決するAI「コンシェルジュエージェントを開発しています。Avis Budget Group、1-800-Flowers、Oura Healthなど100社超が導入済みです。Gartnerによると世界に1,700万人のコンタクトセンター要員が存在し、巨大な自動化市場が広がっています。

Vercel、Slackエージェント構築ツールや大規模リダイレクト機能を一挙公開

開発者向け新機能群

Slackエージェントをワンセッションで構築
コーディングエージェントと連携するスキルウィザード提供
Sandbox SDKが環境変数の一括設定に対応
Workflowの応答速度が2倍に高速化

リダイレクト基盤の刷新

プロジェクトあたり100万件のリダイレクトに対応
Bloomフィルタで不要な検索を即時スキップ
シャーディングと二分探索で低遅延を実現
JSON全体解析のレイテンシスパイクを解消

Vercel開発者向けプラットフォームの新機能を複数同時に発表しました。Slack Agent Skillは、コーディングエージェントと組み合わせることで、Slackボットの構築からデプロイまでを1セッションで完了できるツールです。

Slack Agent Skillはウィザード形式で動作し、プロジェクトのセットアップからSlackアプリの作成、ローカルテスト、本番デプロイまでを5つのステージで案内します。マルチターン会話や人間の承認フローにも対応しており、Workflow DevKitにより中断・再開が可能です。

Vercel SandboxのSDKとCLIが更新され、サンドボックス作成時に環境変数を一括設定できるようになりました。設定した変数はすべてのコマンドに自動で継承され、コマンド単位での上書きも可能です。

Vercel Workflowのサーバーサイド性能が2倍に向上し、APIレスポンスの中央値が37msから17msに短縮されました。ステップ間のオーバーヘッドも削減され、複数ステップを持つワークフローほど恩恵が大きくなります。

大規模リダイレクト機能では、従来のルーティングルールに代わり、シャーディングとBloomフィルタを組み合わせた専用パスを構築しました。当初はJSON形式でしたが、CPU負荷によるスパイクが課題となりました。

最終的にシャード内のキーをソートし二分探索検索する方式に移行したことで、シャード全体のJSON解析が不要になり、レイテンシスパイクが解消されました。Pro・Enterpriseプランで100万件まで利用可能です。

GitHubとOpenAIがCodexとSoraでエージェントコーディングを拡張

エージェントコーディングの進化

GitHubエージェントワークフローでリポジトリタスクを自動化
OpenAICodexSoraのスケールアクセスを拡大
AIエージェントが開発ライフサイクルに深く統合

GitHubはAgenttic Workflowsを発表し、AIエージェントがリポジトリのタスク(コードレビュー、PR作成、ドキュメント更新など)を自動化できる機能を提供します。開発プロセス全体のエージェント化が加速しています。

OpenAIは同時期にCodexSoraの利用上限引き上げとアクセス拡大を発表しました。コーディングとビジュアル生成という二つの重要なAI機能のスケールが多くの開発者に開放されます。

この組み合わせは、コード生成だけでなくUI/UXのプロトタイピングにも活用できる統合的な開発環境を示唆しており、ソフトウェア開発の未来像として注目されます。

AutodeskがGoogleをFlow商標で提訴

訴訟の概要

Flow商標の侵害を主張
AI動画ツールが対象
3Dソフト大手が法的措置

背景と影響

AI製品の命名競争が激化
商標紛争の増加傾向
製品展開に遅延の可能性

3Dデザインソフト大手のAutodeskが、GoogleのAI動画制作ツール「Flow」の名称が自社商標を侵害しているとして提訴しました。

Reutersが最初に報じたこの訴訟は、AI製品の命名を巡る紛争が増加している状況を反映しています。AutodeskはFlowの名称を自社製品群で使用しています。

GoogleFlow AIは動画生成ツールとして開発されたものですが、既存ブランドとの衝突により製品展開に影響が出る可能性があります。

OpenAIの「io」ブランド断念と同日の報道であり、AI企業が商標の壁に直面するケースが目立っています。ブランド戦略の見直しが求められます。

AI市場の急拡大に伴い、知的財産を巡る法的紛争は今後も増加する見通しです。企業は製品命名時の事前調査を徹底する必要があります。

Vercelがv0を全面刷新しAIコード生成の「90%問題」に対処

新v0の特徴

既存インフラとの接続強化
プロトタイプ→本番の壁を突破
エージェントフレンドリーなページ設計

関連プラットフォーム更新

Toolbarからの視覚コンテキスト送信
コンテンツネゴシエーションエージェント対応
イベントソースワークフロー4.1

Vercelv0を全面刷新し、AIが生成したコードを既存の本番インフラに接続する「90%問題」に正面から取り組みました。400万人以上のユーザーが使う同サービスは、プロトタイプ止まりになりがちな問題を解決します。

新v0ではビジュアルコンテキストVercel Toolbarからエージェントに直接コピーする機能や、エージェントがウェブページを効率よく読み取れるコンテンツネゴシエーション対応も追加されました。

Workflow 4.1 Betaのイベントソース型アーキテクチャ、Koa対応のゼロコンフィグサポート、Turboビルドマシンのデフォルト化など、開発者体験の向上が多角的に行われています。

バイブコーディングツールとしてのv0は、アイデアを数分でアプリ化する体験を提供してきましたが、今回の更新でより実務に耐える品質のコードを既存システムに統合できるようになります。

Vercelのこれらの更新は、AI開発ツールが「デモレベル」から「エンタープライズ品質」への進化を目指す業界トレンドを象徴しています。

GitHub Security LabがAIエージェントで脆弱性トリアージを自動化

Taskflowエージェントの概要

AIエージェント脆弱性を自動分類
優先度付けの工数を大幅削減
セキュリティリサーチチームを支援
大量の報告書を高速処理
誤報率の低減に貢献

セキュリティ×AIの展望

CVEトリアージの革新
ゼロデイ検出への応用可能
人間アナリストの判断を補強
SSDLCへの統合が進む
DevSecOpsの標準ツールへ

GitHub Security LabはTaskflowという独自のAIエージェントを開発し、脆弱性報告のトリアージ(優先度付け)作業を自動化しました。毎日大量に届く脆弱性報告を人手で処理する負担を大幅に削減しています。

このエージェントは報告内容を解析し、深刻度・影響範囲・再現性などを評価して優先度を自動的に決定します。セキュリティアナリストはより高度な判断と対応に集中できます。

セキュリティ業務でのAIエージェント活用は急速に広まっており、脆弱性管理のほかにインシデント対応や脅威インテリジェンスにも応用が広がっています。

GitHubによるこの取り組みは、ソフトウェアサプライチェーンセキュリティの向上に貢献するものであり、OSS開発コミュニティ全体にとっても恩恵があります。

GoogleのAI動画生成ツールFlowがWorkspaceユーザーに開放

機能と展開

GoogleFlowがWorkspace対応
テキストから動画生成が可能
企業向けWorkspaceユーザーに開放
2025年5月のローンチ後に拡大
ビジネス用途での活用が広がる

ビジネスインパクト

動画コンテンツ制作コスト削減
マーケティング生産性が向上
研修・プレゼン資料作成に活用
競合Soraとの差別化要素
エンタープライズでの採用加速

GoogleはAI動画生成ツール「Flow」をGoogle Workspaceユーザーに提供開始しました。2025年5月にローンチして以来、アクセスを段階的に拡大しています。

Flowはテキストや画像から高品質な動画を生成できるツールで、Workspaceとの統合によりビジネスユーザーが日常業務で活用しやすくなります。

マーケティング部門や研修コンテンツプレゼン資料など企業の動画ニーズに応えるもので、専門のビデオ制作会社への外注コストを削減できる可能性があります。

OpenAISoraなど競合製品と比べ、Google Workspaceエコシステムとの親和性が差別化のポイントです。

Lovable3.3億ドル調達とAI開発台頭

Lovableの急成長

3.3億ドル調達で評価66億ドル
8ヶ月でARR1億ドル突破
1日10万件超のプロジェクト生成

飲食・物流AIの台頭

Palonaが店舗の運営自動化
PickleがTesla幹部をCFOに
ピッキングロボが精度向上
Cursor23億ドル調達済み

スウェーデンのLovableはCapitalGとMenlo Ventures主導のSeries Bラウンドで3.3億ドルを調達し、評価額が66億ドルに達するというビッグテック以外では異例の成長を見せています。

創業からわずか8ヶ月でARR1億ドル、さらにその4ヶ月後には2億ドルを突破した異例のスピードで成長を続けており、1日に10万件を超えるプロジェクトがプラットフォーム上で作成されています。

PalonaAIはレストラン向けのPalona VisionとWorkflowを新たに発表し、既存の店内カメラとPOSデータを活用して食材管理から発注まで店舗運営を包括的に自動化します。

Palonaは特定ベンダーへの依存を排除した独自のオーケストレーション層を独自に構築しており、AIモデルを柔軟に切り替えられる設計によってシステムの長期的な安定運用を実現しています。

物流ロボティクスのPickle Robotは元Tesla幹部を最高財務責任者として新たに採用し、倉庫向けピッキングロボットの精度向上と大規模商業展開に向けた体制強化を本格的に進めています。

バイブコーディング(AI支援開発)分野ではCursorも2024年11月に23億ドルの調達を実施しており、AI開発ツール全般への大型VC投資の流れが業界全体で引き続き加速しています。

オープンソースAIが独自モデルに挑む三つの新展開

動画理解・視覚AIの前進

Ai2がオープンソース動画モデル「Molmo 2」を公開
8B・4B・7Bの3バリアントを提供
動画グラウンディングとトラッキングでGemini 3 Proを上回る性能
マルチ画像動画クリップの入力に対応
ピクセルレベルの物体追跡が可能
小規模モデルで企業導入のコストを大幅に削減

エージェントメモリとAIコード開発の革新

HindsightがRAGの限界を超える4層メモリアーキテクチャを実現
LongMemEvalで91.4%の精度を達成し既存システムを凌駕
世界・経験・意見・観察の4ネットワークで知識を構造化
ZencoderがマルチモデルAIオーケストレーション「Zenflow」を無料公開
ClaudeOpenAIモデルが互いのコードをクロスレビュー
構造化ワークフローバイブコーディングを卒業しコード品質20%向上

Ai2(アレン人工知能研究所)は2025年12月16日、オープンソースの動画理解モデル「Molmo 2」を公開しました。8B・4B・7Bの3種類を揃え、動画グラウンディングや複数画像推論においてGoogleGemini 3 Proを上回るベンチマーク結果を示しています。

Molmo 2の最大の特徴は「グラウンディング」能力の強化です。ピクセルレベルでの物体追跡や時間的な理解を可能にし、これまで大型独自モデルが独占してきた動画分析領域に本格参入しています。企業が動画理解をオープンモデルで賄える現実的な選択肢となりました。

一方、Vectorize.ioはVirginia Tech・ワシントン・ポストと共同でオープンソースのエージェントメモリシステム「Hindsight」を発表しました。従来のRAGが抱えていた「情報の均一処理」という根本問題に対し、4種類のネットワークで知識を分離する新アーキテクチャを採用しています。

HindsightはLongMemEvalベンチマークで91.4%という最高精度を達成しました。マルチセッション問題の正答率が21.1%から79.7%に、時間的推論が31.6%から79.7%へと大幅に向上しており、エージェントが長期的な文脈を保持する能力が飛躍的に改善されています。

このシステムは単一のDockerコンテナとして動作し、既存のLLM API呼び出しをラップするだけで導入できます。すでにRAGインフラを構築したものの期待通りの性能が得られていない企業にとって、実用的なアップグレードパスとなります。

ZencoderはAIコーディング向けのマルチエージェントオーケストレーションツール「Zenflow」を無料のデスクトップアプリとして公開しました。計画・実装・テスト・レビューを構造化ワークフローで処理し、AnthropicClaudeOpenAIのモデルが互いのコードを検証し合う仕組みを採用しています。

Zencoder CEOのFilev氏は「チャットUIはコパイロット向けには十分だったが、スケールしようとすると崩壊する」と述べています。複数のAIエージェントを並列実行し、モデル間のクロスレビューによってコード品質を約20%向上させるとしており、ビジョンは「プロンプトルーレット」から「エンジニアリング組み立てライン」への転換です。

3つの発表に共通するのは、オープンソースや無料ツールが独自クローズドモデルと競合できる水準に達しつつあるという潮流です。動画理解・長期メモリ・コード品質という異なる課題に対し、それぞれ構造的なアプローチで解決を試みており、エンタープライズAI活用の選択肢を広げています。

GitHubが提唱するAI自動最適化の新概念

Continuous Efficiencyとは何か

グリーンソフトウェアとContinuous AIを融合した新概念
コードベースの継続的・自動的な効率改善を目指す取り組み
GitHub NextとGitHub Sustainabilityチームが共同で開発
自然言語(Markdown)でワークフローを記述できる実験的フレームワーク
Claude CodeOpenAI Codexなど複数のAIエンジンに対応
現在はオープンソースの研究プロトタイプとして公開中

実証された主な活用事例

グリーンソフトウェアルールをコードベース全体に自動適用
RegExp最適化PRがnpm月5億DL超プロジェクトでマージ済み
Web持続可能性ガイドライン(WSG)の自動適用も実施
「Daily Perf Improver」によるFSharp.Control.AsyncSeqのパフォーマンス改善を確認
リポジトリ構造に応じてビルド・ベンチマーク手順を自動推論
マイクロベンチマーク駆動の最適化PRが複数マージ済み

GitHubは「Continuous Efficiency」と呼ぶ新しいエンジニアリング手法を提唱しました。これはグリーンソフトウェアの知見とContinuous AIを組み合わせ、コードの効率を継続的かつ自動的に改善するアプローチです。

同手法の基盤となるのが「Agentic Workflows」と呼ばれる実験的フレームワークです。エンジニアはYAMLやスクリプトの代わりにMarkdownで意図を記述し、GitHub Actions上でAIエージェントが自律的にタスクを実行します。

グリーンソフトウェアに関しては、月間5億回以上ダウンロードされるnpmパッケージにRegExpのホイスティング最適化を適用し、プルリクエストが承認・マージされました。小さな改善でも、スケールすることで大きな効果をもたらすことが実証されました。

Web持続可能性ガイドライン(WSG)のワークフローでは、GitHubおよびMicrosoftのWebプロパティに対してスクリプト遅延読み込みやネイティブブラウザ機能の活用など複数の改善機会を発見・修正しました。

パフォーマンスエンジニアリングへの応用では、「Daily Perf Improver」が三段階のワークフローを通じてリポジトリのビルド・ベンチマーク手順を自動推論し、FSharp.Control.AsyncSeqで実測可能な改善を実現しました。

AIエージェントは自然言語で記述されたルールを解釈し、コード全体に横断的に適用できます。従来の静的解析やリンターを超えた意味的な汎用性と、PRやコメントとして実装まで行うインテリジェントな修正が特徴です。

現時点では研究デモンストレーター段階であり、変更や誤りが生じる可能性もあります。GitHubはアーリーアダプターやデザインパートナーの参加を呼びかけており、今後さらなるルールセットやワークフローの公開を予定しています。

Vercel WDK:あらゆるFWで耐久性処理を実現する統合の仕組み

共通する統合の構造

ビルドと実行の2段階プロセスを採用
SWCがコードを3つのモードで変換
インフラ不要でHTTPエンドポイント

環境ごとの最適化

Vite系はファイル構造を利用し自動化
HTTPサーバー系はNitroで機能拡張
HMR完備で開発サイクルを高速化

Vercelは、あらゆるWebフレームワークで耐久性のあるワークフローを構築可能にする「Workflow DevKit(WDK)」の内部構造を公開しました。開発者は既存の技術スタックを変更することなく、インフラ管理不要で堅牢なバックエンド処理を導入できます。

この汎用性の鍵は、すべての統合に共通する「ビルド時」と「ランタイム」の2フェーズ処理です。SWCコンパイラが1つのソースコードをクライアント、ステップ実行、オーケストレーターという3つの異なる出力へ自動変換し、複雑な配線を隠蔽します。

SvelteKitやAstroのようなViteベースの環境では、ファイルベースルーティングを巧みに活用します。プラグインがコンパイル時にハンドラファイルを生成・配置し、それらをフレームワークが自動的にAPIエンドポイントとして認識する仕組みです。

一方、ExpressやHonoといったバンドラーを持たないHTTPサーバー環境では、サーバーツールキット「Nitro」が活躍します。Nitroが仮想ハンドラとしてWDKの機能をラップし、ベアメタルなサーバー上でも同様のワークフロー機能を提供します。

開発者体験(DX)への配慮も徹底されており、HMR(ホットモジュール交換)を標準装備しています。「use workflow」等のディレクティブを検知して即座にリビルドを行うため、サーバー再起動なしで高速なイテレーションが可能です。

結論として、このアーキテクチャはフレームワーク選定による機能格差を解消します。エンジニアは新たなインフラや言語を学ぶコストを払うことなく、使い慣れた環境へたった数行の設定を追加するだけで、生産性と信頼性を高めることができます。

Hugging Faceがv5発表、PyTorch特化と相互運用性強化

開発効率を高める構造改革

モデル定義をモジュール化し保守性向上
開発基盤をPyTorchへ完全一本化

実用性を極めた学習・推論

大規模な事前学習への対応を強化
OpenAI互換の推論サーバー機能導入
低精度の量子化を標準機能として統合

エコシステムをつなぐハブへ

外部推論エンジンとの連携を円滑化
ローカル実行オンデバイス対応

Hugging Faceは、AI開発のデファクトスタンダードであるライブラリの最新版「Transformers v5」を発表しました。本バージョンでは「相互運用性」と「シンプルさ」を最優先し、コード構造のモジュール化やPyTorchへのバックエンド一本化を断行。急速に拡大するAIエコシステムにおいて、エンジニアがより効率的に学習・推論を行えるよう、量子化の標準サポートや外部ツールとの連携を強化した大型アップデートです。

前バージョンのリリースから5年、Transformersは爆発的な成長を遂げました。1日あたりのインストール数は2万回から300万回へと急増し、累計ダウンロード数は12億回を突破。サポートするモデルアーキテクチャも40種類から400種類以上へと拡大しており、AI技術の民主化と普及を支える重要なインフラとしての地位を確立しています。

v5の最大の焦点は「シンプルさ」の追求です。開発チームは「コードこそが製品である」という哲学のもと、モデル定義のモジュール化を推進。複雑化していたコードベースを整理し、新しいモデルの追加や保守を容易にしました。これにより、コミュニティによる貢献プロセスが簡素化され、最新モデルへの対応速度がさらに向上します。

技術的な大きな転換点として、バックエンドをPyTorchに一本化します。TensorFlowやFlaxのサポートを縮小し、PyTorch財団との連携を深めることで、パフォーマンスと安定性を最大化します。同時に、JAXエコシステムとの互換性は維持し、多様な開発環境やニーズに応える柔軟性も確保しています。

実用面では、推論機能と量子化が大幅に強化されました。新たにOpenAI互換のAPIを持つ「transformers serve」を導入し、手軽な推論サーバー構築が可能に。また、8-bitや4-bitといった低精度モデルの量子化を「第一級市民」として扱い、リソース制約のある環境でも高性能なモデルを効率的に扱えるようになります。

最終的な目標は、あらゆるAIツールとのシームレスな連携です。UnslothやAxolotlでの学習から、vLLMやllama.cppを用いた推論・ローカル実行まで、Transformers v5はエコシステムのハブとして機能します。この高い相互運用性により、開発者は最適なツールを自由に組み合わせ、生産性を最大化できるでしょう。

Google動画生成Flow 画像モデル刷新と編集機能を追加

プロ級の画像生成と編集

新モデルNano Banana Pro搭載
被写界深度や照明を精密に制御
複数画像をブレンドし詳細保持

直感的操作と動画調整

手書きによる指示入力を実現
動画内のオブジェクト追加・削除
生成後のカメラワーク再調整

Google Labsは、動画生成ツール「Flow」に新画像モデル「Nano Banana Pro」を含む4つの主要な編集機能を追加しました。5月の公開以来、生成された動画は5億本を超えており、今回の更新でクリエイターが求めるより精密な制御と表現力を提供します。

特筆すべきは、有料購読者が利用可能な最新の画像モデル「Nano Banana Pro」です。被写界深度、照明、カラーグレーディングといったプロフェッショナルレベルの調整が可能になり、静止画のクオリティを劇的に向上させます。

「Images」タブでは、プロンプトだけでキャラクターの衣装やポーズ、カメラアングルを変更可能です。複数の参照画像をブレンドして、重要な詳細を維持しながら理想のフレームを作り込む機能も備えています。

言語化が難しい指示も直感的に行えます。画像に直接手書き(ドゥードゥル)を加えることでAIが意図を理解し、テキストプロンプトを練り上げる時間を削減します。

動画の一部だけを修正する機能も強化されました。他の要素を変えずにオブジェクトの追加が可能になり、不要な要素の削除機能も来月から実験的に導入されます。

生成後の動画に対しても、カメラの位置や軌道を調整する「再撮影」機能を追加しました。一から生成し直すことなく、異なる視点や動きを試行錯誤できるようになり、制作効率が高まります。

Vercelが自動化基盤を自作できるOSSツールを公開

独自の自動化基盤を構築

Next.js製のオープンソース
直感的なビジュアルエディタ搭載
自然言語からAIが自動生成

AIとコード生成で拡張

Slack等の主要ツールと統合済み
実行可能なTypeScriptへ変換
自社製品への組み込みも容易

Vercelは、独自のワークフロー自動化プラットフォームを構築できるオープンソーステンプレート「Workflow Builder」を公開しました。Next.jsをベースとし、企業は自社専用の自動化ツールやAIエージェントを迅速に開発・展開することが可能です。

最大の特徴は、ドラッグ&ドロップで操作できるビジュアルエディタと、自然言語の指示からワークフローを生成するAI機能です。SlackやPostgreSQLなど6つの統合モジュールが標準装備されており、即座に実用的な自動化プロセスを構築できます。

作成されたワークフローは「Workflow Development Kit」により、実行可能なTypeScriptコードに変換されます。開発者は複雑なステート管理やエラー処理の実装から解放され、ビジネスロジックの構築に集中できる点が大きなメリットです。

本ツールは社内業務の効率化に加え、自社SaaS製品にZapierのような連携機能を組み込む基盤としても最適です。AIエージェントによる自律的なタスク実行やデータ処理パイプラインなど、エンジニア生産性を高める多様な用途に対応します。

テスト自動化AIのMomentic 1500万ドル調達

自然言語でテスト工程を自動化

シリーズAで1500万ドルを調達
自然言語指示でテスト自動化
従来ツールの複雑さをAIで解消

2600ユーザー導入の実績

NotionやXero等が導入済み
月間2億ステップを自動実行
モバイル環境テストにも対応

米AIスタートアップMomenticが、シリーズAラウンドで1,500万ドル(約23億円)を調達しました。自然言語による指示でソフトウェアテストを自動化するツールを提供し、開発現場における品質保証QA)プロセスの効率化を支援します。

同社の最大の特徴は、平易な英語でユーザーフローを記述するだけで、AIが自動的にテストを実行する点です。PlaywrightやSeleniumといった既存のオープンソースツールが複雑な設定を要するのに対し、AI活用で導入障壁を大幅に下げています。

既に市場での評価を獲得しており、Notion、Webflow、Retoolといった有力テック企業を含む2,600ユーザーが導入しています。先月だけで2億回以上のテストステップを自動化するなど、大規模な運用にも耐えうる性能を実証済みです。

創業者のWei-Wei Wu氏は、AIによるコード生成の普及でアプリケーションが急増し、それに伴いテスト需要も拡大すると予測しています。今回の調達資金をもとにエンジニア採用を加速させ、テストケース管理機能の強化などプロダクトのさらなる磨き込みを図ります。

音声入力Wisprが2500万ドル調達、Fortune500も採用

急成長と資金調達の背景

Notable Capital主導で2500万ドルを追加調達
Fortune 500企業の過半数が導入済み
ユーザー数は前年比100倍に急増

技術的優位性と将来展望

エラー率は競合より低い約10%を実現
入力作業の50%以上音声へ移行
単なるツールを超え自動化OSを目指す

音声AIスタートアップのWisprが、Notable Capital主導で2500万ドルの追加調達を実施しました。同社のアプリ「Wispr Flow」はFortune 500企業の270社で利用されるなど急速に普及しており、今回の資金でさらなる人材獲得と製品開発を加速させます。

特筆すべきは圧倒的な成長速度です。ユーザーベースは前年比100倍に達し、12ヶ月後の継続率も70%と高い水準を維持しています。利用者は文字入力の50%以上を同アプリで行っており、ビジネス現場での実用性と信頼性が証明されています。

技術的な優位性も明確です。独自調査によると、他社の主要モデルが27%以上のエラー率であるのに対し、Wisprは約10%に留まります。今後は独自モデルの開発を進め、個々のユーザーに最適化したさらなる精度向上を図る計画です。

将来的には単なるディクテーションツールを超え、メール返信などのタスクを自動化する「音声主導OS」への進化を目指しています。Android版の正式ローンチやAPIの公開も予定されており、開発者エコシステムの拡大も視野に入れています。

Stack OverflowがAIデータ供給へ転換、社内知見を構造化

企業AI向けの新戦略

人間の知見をAI可読形式へ変換
企業向け「Stack Internal」を強化
Model Context Protocolに対応

データの信頼性を担保

回答者情報等のメタデータを付与
AI用の信頼性スコアを算出
ナレッジグラフで概念間の連携を強化

自律的成長への期待

AIによる自律的な質問作成も視野
開発者のナレッジ蓄積負荷を軽減

米Stack Overflowは、マイクロソフトのイベント「Ignite」において、企業向けAIスタックの一翼を担う新製品群を発表しました。同社は、開発者向けQ&A;フォーラムとしての従来の役割を超え、人間の専門知識をAIエージェントが理解可能な形式に変換するデータプロバイダーへと転換を図ります。これにより、企業内の暗黙知をAI活用可能な資産へと昇華させることが狙いです。

今回の中核となるのは、企業向け製品「Stack Internal」の強化です。従来の社内Q&A;機能に加え、高度なセキュリティと管理機能を搭載。さらに、Model Context Protocol (MCP)を採用することで、AIエージェントが社内データを取り込みやすい環境を整備しました。すでに多くの企業がトレーニング用にAPIを利用しており、AIラボとのデータライセンス契約も収益の柱となりつつあります。

特筆すべきは、データの信頼性を担保する仕組みです。Q&A;データに対し、回答者や作成日時、コンテンツタグといった詳細なメタデータを付与します。これに基づき「信頼性スコア」を算出することで、AIエージェントは情報の正確度を判断できるようになります。CTOのジョディ・ベイリー氏は、将来的にナレッジグラフを活用し、AIが自律的に概念を結びつける構想も示唆しました。

さらに将来的には、AIエージェントが知識の空白を検知し、自ら質問を作成する機能も検討されています。これにより、開発者が文書化に費やす労力を最小限に抑えつつ、組織独自のノウハウを効率的に蓄積することが可能になります。単なる検索ツールではなく、AIと人間が協調してナレッジを育てるプラットフォームへの進化が期待されます。

Googleが明かす AI創造性活用の3原則

AIを使いこなす心構え

道具は使うアーティスト次第
明確なビジョンと意図が重要
創造性を代替せず拡張する
成功の鍵は旺盛な好奇心
技術的知識は障壁にならない

AIで物語を紡ぐ

温めてきた個人的な物語を表現
実体験を夢のような情景に変換
かけがえのないデジタル遺産の創出

Googleは2025年11月17日、AI映像制作ツール「Flow」を活用したアーティストとの協業プログラム「Flow Sessions」から得られた、AIと創造性に関する3つの重要な教訓を公式ブログで公開しました。このプログラムは、多様な背景を持つアーティストがAIツールをどのようにクリエイティブな作業へ応用できるかを探るもので、AI時代の創作活動における新たな指針を示唆しています。

第一に、「ディレクターの視点」を持つことの重要性です。AIは強力なツールですが、その価値は使い手のビジョンや意図に大きく左右されます。参加アーティストの一人は「AIは創造性を代替するのではなく、表現方法を拡張するものだ」と語ります。明確な物語や芸術的な方向性を持ってAIを導くことで、真に独創的な作品が生まれるのです。

第二の教訓は、「好奇心を原動力にする」ことです。プログラムの成功者は、技術的な専門知識の有無にかかわらず、新しいことへの挑戦を厭わない好奇心旺盛な人々でした。「次に何が起こるかを形作るのは、最も知識がある人ではなく、実験する勇気のある人だ」という参加者の言葉通り、不確実性を恐れずに試行錯誤する姿勢が、AI活用の鍵となります。

最後に、「語られてこなかった物語を紡ぐ」機会としてのAIの可能性です。あるアーティストは、亡き祖母との会話の録音を元に、ユーモラスで心温まる映像作品を制作しました。また、別のアーティストは台湾の祖父母との思い出の写真を、世代を超えた愛を描く幻想的な風景に変換しました。AIは、個人的な記憶や感情を形にする強力な手段となり得ます。

Googleは既にプログラムの第2期を開始しており、AIとクリエイターの協業はさらに進化していくでしょう。これらの教訓は、映像制作に限らず、AIを用いて新たな価値を創造しようとするすべてのビジネスパーソンやエンジニアにとって、大きなヒントとなるのではないでしょうか。

Copilot進化、会話だけでアプリ開発・業務自動化

「誰でも開発者」の時代へ

自然言語だけでアプリ開発
コーディング不要で業務を自動化
特定タスク用のAIエージェントも作成
M365 Copilot追加料金なしで搭載

戦略と競合優位性

9年間のローコード戦略の集大成
M365内の文脈理解が強み
プロ向けツールへの拡張性を確保
IT部門による一元管理で統制可能

Microsoftは、AIアシスタントCopilot」に、自然言語の対話だけでアプリケーション開発や業務自動化を可能にする新機能を追加したと発表しました。新機能「App Builder」と「Workflows」により、プログラミング経験のない従業員でも、必要なツールを自ら作成できる環境が整います。これは、ソフトウェア開発の民主化を加速させる大きな一歩と言えるでしょう。

「App Builder」を使えば、ユーザーは「プロジェクト管理アプリを作って」と指示するだけで、データベースやユーザーインターフェースを備えたアプリが自動生成されます。一方、「Workflows」は、Outlookでのメール受信をトリガーにTeamsで通知し、Plannerにタスクを追加するといった、複数アプリをまたぐ定型業務を自動化します。専門的なAIエージェントの作成も可能です。

これらの強力な新機能は、既存のMicrosoft 365 Copilotサブスクリプション(月額30ドル)に追加料金なしで含まれます。Microsoftは、価値ある機能を標準搭載することでスイート製品の魅力を高める伝統的な戦略を踏襲し、AIによる生産性向上の恩恵を広くユーザーに提供する構えです。

今回の機能強化は、同社が9年間にわたり推進してきたローコード/ノーコード開発基盤「Power Platform」の戦略的な集大成です。これまで専門サイトでの利用が主だった開発ツールを、日常的に使うCopilotの対話画面に統合することで、すべてのオフィスワーカーが「開発者」になる可能性を切り拓きます。

Microsoftの強みは、Copilotがユーザーのメールや文書といったMicrosoft 365内のデータをすでに理解している点にあります。この文脈理解能力を活かすことで、競合のローコードツールよりも的確で実用的なアプリケーションを迅速に構築できると、同社は自信を見せています。

従業員による自由なアプリ開発は「シャドーIT」のリスクも懸念されますが、対策は万全です。IT管理者は、組織内で作成された全てのアプリやワークフロー一元的に把握・管理できます。これにより、ガバナンスを効かせながら、現場主導のDX(デジタルトランスフォーメーション)を安全に推進することが可能になります。

Microsoftは、かつてExcelのピボットテーブルがビジネススキルの標準となったように、アプリ開発がオフィスワーカーの必須能力となる未来を描いています。今回の発表は、ソフトウェア開発のあり方を根底から変え、数億人規模の「市民開発者を創出する野心的な一手と言えるでしょう。

Vercel、AIエージェント開発を本格化する新SDK発表

AIエージェント開発の新基盤

AI SDK 6によるエージェント抽象化
人間による承認フローの組み込み
エンドツーエンドの型安全性を確保
ゼロ設定でPythonフレームワーク対応

高信頼な実行環境とエコシステム

ワークフローキットで高信頼性を実現
マーケットプレイスでAIツールを導入
Vercel Agentによる開発支援
OSSの営業・分析エージェント提供

Vercelが先週開催したイベント「Ship AI 2025」で、AIエージェント開発を本格化させる新技術群を発表しました。中核となるのは、エージェント中心の設計を取り入れた「AI SDK 6」や、タスクの信頼性をコードで担保する「Workflow Development Kit」です。これにより、ウェブ開発のように直感的かつスケーラブルなAI開発環境の提供を目指します。

新たにベータ版として公開された「AI SDK 6」は、エージェントを一度定義すれば、あらゆるアプリで再利用できるアーキテクチャが特徴です。これにより、ユースケースごとにプロンプトやAPIを連携させる手間が不要になります。また、人間のレビューを必須とするアクションを制御できる承認機能も組み込まれ、安全な運用を支援します。

長時間実行されるタスクの信頼性を高めるのが「Workflow Development Kit」です。従来のメッセージキューやスケジューラの設定に代わり、TypeScriptの関数に数行のコードを追加するだけで、失敗した処理の自動リトライや状態保持を実現します。これにより、AIエージェントのループ処理やデータパイプラインを安定して実行できます。

エコシステムの拡充も進んでいます。Vercel Marketplaceでは、CodeRabbitなどのエージェントやAIサービスをプロジェクトに直接導入可能になりました。さらに、FastAPIやFlaskといったPythonフレームワークが設定不要でデプロイ可能となり、バックエンド開発者のAIクラウド活用を促進します。

Vercel自身も、開発者を支援するAIアシスタントVercel Agent」のベータ版を提供開始しました。このエージェントは、コードレビューパッチ提案、本番環境でのパフォーマンス異常の検知と原因分析を自動化します。開発チームの一員として、生産性向上に貢献することが期待されます。

Vercelの一連の発表は、AIエージェント開発を一部の専門家から全ての開発者へと解放するものです。SDKによる抽象化、ワークフローによる信頼性確保、マーケットプレイスによるエコシステムが一体となり、アイデアを迅速に本番稼働のエージェントへと昇華させる強力な基盤が整ったと言えるでしょう。

Vercel、AI開発基盤を大幅拡充 エージェント開発を加速

AI開発を加速する新機能

長時間処理を簡易化する「WDK
ゼロ設定で動くバックエンド

エコシステムを強化

ツール導入を容易にするAIマーケット
Python開発を支援する新SDK
統一された課金と監視体制

Web開発プラットフォームのVercelは2025年10月23日、AI開発基盤「AI Cloud」を大幅に機能拡張したと発表しました。開発者の新たな「AIチームメイト」となるVercel Agentや、長時間処理を簡素化するWorkflow Development Kit (WDK)、AIツールを簡単に導入できるマーケットプレイスなどを公開。AIエージェントや複雑なバックエンドの開発における複雑さを解消し、生産性向上を支援します。

新発表の目玉の一つが「Vercel Agent」です。これは開発チームの一員として機能するAIで、コードレビューや本番環境で発生した問題の調査を自動で行います。単なるコードの提案に留まらず、Vercelのサンドボックス環境で検証済みの修正案を提示するため、開発者は品質を犠牲にすることなく、開発速度を大幅に向上させることが可能です。

長時間にわたる非同期処理の信頼性も大きく向上します。オープンソースの「Workflow Development Kit (WDK)」を使えば、データ処理パイプラインやAIエージェントの思考プロセスなど、中断と再開を伴う複雑な処理を簡単なコードで記述できます。インフラを意識することなく、耐久性の高いアプリケーションを構築できるのが特徴です。

バックエンド開発の体験も刷新されました。これまでフロントエンドで培ってきた「ゼロコンフィグ」の思想をバックエンドにも適用。FastAPIやFlaskといった人気のPythonフレームワークや、ExpressなどのTypeScriptフレームワークを、設定ファイルなしでVercelに直接デプロイできるようになりました。

AI開発のエコシステムも強化されています。新たに開設された「AI Marketplace」では、コードレビューセキュリティチェックなど、様々なAIツールを数クリックで自分のプロジェクトに導入できます。同時に、PythonからVercelの機能を直接操作できる「Vercel Python SDK」もベータ版として公開され、開発の幅がさらに広がります。

Vercelは一連のアップデートを通じて、AI開発におけるインフラ管理の複雑さを徹底的に排除しようとしています。開発者はもはやキューやサーバー設定に頭を悩ませる必要はありません。ビジネスの価値創造に直結するアプリケーションロジックの開発に、より多くの時間を注げるようになるでしょう。

OpenAI、Mac向けAI「Sky」買収でPC統合を加速

買収の狙いと目的

ChatGPTのPC統合を加速
AIを日常ツールに直接組み込む
PCでのAI利用体験の向上

Skyの特長と開発陣

Mac画面を理解しアプリ操作
自然言語でPC作業を支援
Apple「ショートカット」の元開発陣

今後の展望

Skyの機能をChatGPTに統合
数億人規模へのAI体験提供

OpenAIは2025年10月23日、Mac向けAIインターフェース「Sky」を開発するSoftware Applications Incorporatedを買収したと発表しました。この買収により、Skyのチーム全員がOpenAIに合流し、その高度なmacOS統合技術ChatGPTに組み込まれます。目的は、AIをユーザーが日常的に使用するPCツールに直接統合し、作業体験を根本から変革することです。

「Sky」は、PCのデスクトップ上で常に稼働し、ユーザーを支援する自然言語インターフェースです。最大の特徴は、画面に表示されている内容を文脈として理解し、ユーザーの指示に応じて各種アプリケーションを直接操作できる点にあります。文章作成からコーディング、日々のタスク管理まで、PC作業のあらゆる場面でAIが伴走する体験を目指します。

Skyの開発チームは、かつてApple買収され、現在の「ショートカット」アプリの基盤となった「Workflow」の創業者たちが率いています。彼らの製品開発力とmacOSに関する深い知見が、今回の買収の決め手の一つとなりました。Apple出身者が多くを占めるチームの合流は、OpenAIの製品開発力を一層強化するでしょう。

この動きは、AIの主戦場がクラウドから個人のデバイスへと拡大していることを示唆します。Appleが「Apple Intelligence」でOSレベルのAI統合を進める中、OpenAIは今回の買収を通じてエコシステムへの深い浸透を図ります。PC上でシームレスに動作するAIアシスタントの実現は、生産性向上を目指すユーザーにとって重要な選択基準となりそうです。

OpenAIは、サム・アルトマンCEO関連の投資ファンドがSkyの開発元に受動的投資を行っていたことを開示しました。買収プロセスはChatGPT責任者らが主導し、取締役会の独立した委員会によって承認されたとして、取引の透明性を強調しています。買収金額などの詳細は公表されていません。

AI開発の生産性向上、ソフトウェアの断片化解消が鍵

AI開発を阻む「複雑性の壁」

断片化したソフトウェアスタック
ハードウェア毎のモデル再構築
6割超のプロジェクトが本番前に頓挫
エッジ特有の性能・電力制約

生産性向上への道筋

クロスプラットフォームの抽象化レイヤー
最適化済みライブラリの統合
オープン標準による互換性向上
ハードとソフトの協調設計

ArmをはじめとするAI業界が、クラウドからエッジまで一貫した開発を可能にするため、ソフトウェアスタックの簡素化を急いでいます。現在、断片化したツールやハードウェア毎の再開発がAIプロジェクトの大きな障壁となっており、この課題解決が開発の生産性と市場投入の速度を左右する鍵を握っています。

AI開発の現場では、GPUやNPUなど多様なハードウェアと、TensorFlowやPyTorchといった異なるフレームワークが乱立。この断片化が非効率な再開発を招き、製品化までの時間を浪費させています。調査会社ガートナーによれば、統合の複雑さを理由にAIプロジェクトの6割以上が本番前に頓挫しているのが実情です。

このボトルネックを解消するため、業界は協調した動きを見せています。ハードウェアの違いを吸収する抽象化レイヤーの導入、主要フレームワークへの最適化済みライブラリの統合、ONNXのようなオープン標準の採用などが進んでいます。これにより、開発者はプラットフォーム間の移植コストを大幅に削減できるのです。

簡素化を後押しするのが、クラウドを介さずデバイス上でAIを処理する「エッジ推論」の急速な普及です。スマートフォンや自動車など、電力や処理能力に制約のある環境で高性能なAIを動かすには、無駄のないソフトウェアが不可欠です。この需要が、業界全体のハードウェアとソフトウェアの協調設計を加速させています。

この潮流を主導するのが半導体設計大手のArmです。同社はCPUにAI専用の命令を追加し、PyTorchなどの主要ツールとの連携を強化。これにより開発者は使い慣れた環境でハードウェア性能を最大限に引き出せます。実際に、大手クラウド事業者へのArmアーキテクチャ採用が急増しており、その電力効率の高さが評価されています。

AIの次なる競争軸は、個別のハードウェア性能だけでなく、多様な環境でスムーズに動作する「ソフトウェアの移植性」に移っています。エコシステム全体で標準化を進め、オープンなベンチマークで性能を競う。こうした協調的な簡素化こそが、AIの真の価値を引き出し、市場の勝者を決めることになるでしょう。

Google、AI動画Veo 3.1公開 編集機能で差別化

Veo 3.1の主な進化点

よりリアルな質感と音声生成
プロンプトへの忠実性が向上
最大2分半超の動画延長機能
縦型動画の出力に対応

高度な編集と競合比較

動画内の物体を追加・削除
照明や影の自然な調整
編集ツールは高評価もSora優位の声
Sora 2より高価との指摘も

Googleは2025年10月15日、最新のAI動画生成モデル「Veo 3.1」を発表しました。AI映像制作ツール「Flow」に統合され、音声生成や動画内のオブジェクトを操作する高度な編集機能を搭載しています。これにより、クリエイターはより直感的に高品質な動画を制作可能になります。激化するAI動画市場で、競合のOpenAISora 2」に対し、編集機能の優位性で差別化を図る狙いです。

Veo 3.1の大きな特徴は、音声生成機能の統合です。従来は手動で追加する必要があった音声が、静止画から動画を生成する機能や、動画を延長する機能にネイティブで対応しました。これにより、映像と音声が同期したコンテンツをワンストップで制作でき、制作工程を大幅に効率化します。

編集機能も大幅に強化されました。動画内の任意の場所にオブジェクトを自然に追加する「挿入」機能や、不要な要素を消去する「削除」機能が実装されます。さらに、照明や影を調整し、シーン全体のリアリティを高めることも可能です。作り手の意図をより精密に反映した映像表現が実現します。

新モデルは、動画編集ツール「Flow」に加え、開発者向けの「Gemini API」や企業向けの「Vertex AI」でも提供されます。これにより、個人のクリエイターから企業のコンテンツ制作まで、幅広い用途での活用が期待されます。GUIとAPIの両方を提供することで、多様なワークフローに対応する構えです。

一方で、市場の反応は賛否両論です。特に競合の「Sora 2」と比較し、動画自体の品質や価格面でSora 2が優位だとの指摘も出ています。Veo 3.1の強みである高度な編集ツールが高く評価される一方、生成品質のさらなる向上が今後の課題となりそうです。

技術面では、最大1080pの解像度と、SNSなどで需要の高い縦型動画の出力に対応しました。また、生成された動画には電子透かし技術「SynthID」が埋め込まれ、AIによる生成物であることを明示します。これにより、コンテンツの透明性を確保し、責任あるAI利用を促すとしています。

IBM、AI IDEにClaude搭載し生産性45%向上へ

Claude統合の核心

IBMの企業向けソフトへのClaudeモデル導入
開発環境IDE「Project Bob」での活用開始
レガシーコードのモダナイゼーションを自動化
Anthropicとの提携企業部門を強化

開発者生産性の成果

社内利用で平均生産性45%増を達成
コードコミット数を22〜43%増加
ClaudeLlamaなどマルチモデルを連携

AIガバナンス戦略

セキュアなAIエージェント構築ガイドを共同開発
watsonx OrchestrateでのAgentOps導入による監視

IBMはAnthropicと戦略的提携を発表し、主力エンタープライズ・ソフトウェア群に大規模言語モデル(LLM)Claudeを統合します。特に、開発環境(IDE)である「Project Bob」にClaudeを組み込むことで、レガシーコードの刷新と開発者生産性の劇的な向上を目指します。

このAIファーストIDE「Project Bob」は、既にIBM内部の6000人の開発者に利用されており、平均で45%の生産性向上という驚異的な成果を上げています。このツールは、単なるコード補完ではなく、Java 8から最新バージョンへの移行など、複雑なモダナイゼーションタスクを自動化します。

Project Bobの最大の特徴は、AnthropicClaudeだけでなく、MistralMetaLlama、IBM独自のGranite 4など、複数のLLMをリアルタイムでオーケストレーションしている点です。これにより、タスクに応じて最適なモデルを選択し、精度、レイテンシ、コストのバランスをとっています。

また、両社はAIエージェントの企業導入における課題、特に本番環境でのガバナンスに着目しています。共同でセキュアなAIエージェント構築ガイドを作成し、設計・展開・管理を体系化するAgent Development Lifecycle(ADLC)フレームワークを提供します。

IBMは、AIガバナンスを強化するため、watsonx Orchestrateに新たな機能を追加します。オープンソースのビジュアルビルダーLangflowを統合し、さらにリアルタイム監視とポリシー制御を行うAgentOpsを導入します。

企業がAI導入で直面する「プロトタイプから本番への溝」を埋めることが狙いです。この包括的なアプローチは、単にエージェントを構築するだけでなく、エンタープライズ級の信頼性、コンプライアンスセキュリティを確保するために不可欠な要素となります。

Google、賞金100万ドルのAI映画賞を発表

賞金100万ドルの大規模コンペ

優勝賞金は100万ドル(約1.5億円)
ドバイのサミットで2026年1月に授賞
テーマは「未来の再創造」など2種類

GoogleのAIツールが応募条件

Google AIツール(Gemini等)利用が必須
コンテンツ70%がAI生成であること
作品時間は7分から10分の短編映画
応募締切は2025年11月20日

Googleは2025年10月1日、世界最大級のクリエイターイベント「1 Billion Followers Summit」と共同で、優勝賞金100万ドル(約1.5億円)の「Global AI Film Award」を創設したと発表しました。このコンテストは、同社の生成AIモデル「Gemini」などを活用して制作された短編映画を世界中から募集し、AIによる創造性の新たな地平を切り拓くことを目指します。

今回のAI映画賞は、AIがクリエイターの強力なパートナーとなりつつある現状を象徴するものです。Googleは、AI技術がコンテンツ制作のハードルを下げ、誰もが映像作家になれる未来を見据えています。100万ドルという破格の賞金は、同社がAIクリエイティブ分野に寄せる大きな期待の表れと言えるでしょう。

応募作品には、いくつかの重要な条件があります。まず、作品の70%以上GoogleのAIツールで生成する必要があります。上映時間は7分から10分。テーマは「未来の再創造」または「知られざる物語」のいずれかを選択します。言語は不問ですが、英語字幕は必須です。締切は2025年11月20日となっています。

制作には、最新の動画生成モデル「Veo 3」や、より高度な制御が可能な映画制作ツール「Flow」、画像モデル「Nano Banana」など、GeminiファミリーのAIツールが活用できます。これらのツールは、キャラクターやシーン、スタイルを精緻にコントロールし、クリエイターのビジョンを忠実に映像化することを支援します。

このAI映画賞は、AIが単なる効率化ツールではなく、人間の創造性を拡張する新たな表現媒体であることを示す試金石となるでしょう。授賞式は2026年1月にドバイで開催されるサミットで行われます。今後、AIネイティブなクリエイターがどのような作品を生み出すのか、世界中から注目が集まります。

Amazon Bedrock、反復処理を強化するDoWhileループ機能を追加

アマゾン ウェブ サービス(AWS)は2025年9月25日、生成AI開発基盤「Amazon Bedrock」のワークフロー構築機能「Flows」に、反復処理を可能にする「DoWhileループ」を追加したと発表しました。これにより、AIモデルの呼び出しやカスタムコード実行などを組み合わせ、特定の条件を満たすまで処理を繰り返すワークフローをBedrock内で直接構築できます。複雑な反復処理の開発を簡素化し、企業による高度なAIソリューション導入を加速させます。 新機能のDoWhileループは、特定の条件が満たされるまで一連の処理を繰り返すためのものです。プロンプトAWS Lambda関数、Knowledge Basesといった多様な機能をループ内で組み合わせられます。これにより、外部サービスを使わずに複雑なワークフローを構築でき、開発プロセスが大幅に簡素化されます。 具体的な活用例として、ブログ記事の自動生成が挙げられます。指定した品質基準を満たすまで記事を繰り返し修正する、といったワークフローを構築できます。AIが生成した初稿を別のAIが評価し、評点が低い場合は改善指示を出して再生成させる、といった自律的なコンテンツ改善サイクルを実現可能です。 この機能はAWS Management ConsoleとAPIの両方から利用でき、ループの各反復はトレース機能で詳細に追跡できます。ただし、ループ内に別のループを配置する「ネスト」はサポートされていません。また、無限ループを避けるため、最大反復回数の設定が必須となる点には注意が必要です。 DoWhileループ機能は、AWS GovCloud(US)リージョンを除く、Amazon Bedrock Flowsが利用可能な全てのAWSリージョンで提供が開始されました。この機能追加により、これまで専門的な知識が必要だった高度な反復処理を含むAIアプリケーションの開発が、より多くの開発者にとって身近なものとなるでしょう。

Google、月額5ドルのAIプランを新興国40カ国超に拡大

Googleは9月24日、月額約5ドルの安価なAIサブスクリプションプラン「AI Plus」を、インドネシアやメキシコなど40カ国以上で提供開始しました。標準プランが高価な新興国市場で有料ユーザーを獲得し、先行するOpenAIに対抗する狙いです。この動きは、世界のAIサービス市場の勢力図に影響を与える可能性があります。 このプランでは、最新AIモデル「Gemini 2.5 Pro」へのアクセスが可能です。加えて、画像生成ツール「Flow」や動画生成ツール「Veo 3 Fast」など、クリエイティブな作業を支援する機能も含まれます。GmailやDocsといったGoogleの各種アプリ内でもAI機能が使えるようになり、業務効率の向上が期待できます。 さらに、AIリサーチアシスタントNotebookLM」の拡張機能や、200GBのクラウドストレージも提供されます。専門的な情報収集や資料作成、データ保管といったビジネスシーンでの実用性を高めており、コストパフォーマンスに優れたサービス内容となっています。 この動きの背景には、OpenAIとの激しい顧客獲得競争があります。OpenAIインドネシアなどで月額5ドル未満の「ChatGPT Go」を展開済みです。月額20ドルの標準プランが浸透しにくい市場で、両社は低価格戦略を加速させ、次なる巨大市場の主導権を争っています。 月額料金は多くの国で約5ドルに設定されていますが、ネパールやメキシコなど一部地域では、最初の6ヶ月間は50%割引が適用されます。巨大IT企業による価格競争は、今後さらに多くの地域で高機能なAIツールの普及を後押しすることになるでしょう。

感覚的AIコーディング、モバイルアプリ市場で離陸できず

自然言語でアプリを開発する「Vibe Coding(感覚的AIコーディング)」の専用モバイルアプリが、市場獲得に苦戦しています。アプリ情報分析企業Appfiguresの調査によると、多くのアプリがダウンロード数も収益もほとんどない状況です。デスクトップではユニコーン企業が生まれる一方、モバイル市場は未成熟で、技術の完成度にも課題が残っています。 Appfiguresの分析は市場の厳しい現実を示します。この分野で最大手のアプリ「Instance」でさえ、ダウンロード数は1万6000件、収益はわずか1000ドルです。2番手の「Vibe Studio」は4000ダウンロードで収益はゼロ。ほとんどのアプリがユーザー獲得と収益化に苦しんでおり、市場の立ち上がりが遅れていることがうかがえます。 では、モバイルでの未来は暗いのでしょうか。市場はまだ若く、成長の可能性は残されています。今年、Reddit共同創業者が出資する「Vibecode」が940万ドルのシード資金を調達。iOS上でAIを使ってアプリを開発するサービスを開始しており、こうした新規参入が市場を活性化させるか注目されます。 専用アプリは不振ですが、技術は別の形でモバイルに浸透し始めています。例えば、アプリ収益化基盤の「RevenueCat」では、AIアシスタント経由での新規登録が急増しました。AIが開発者を支援し、アプリ内課金の設定などを自動化する裏方として、その存在感を増しているのです。 一方で、技術そのものには課題が残ります。多くの開発者は、AIが生成したコードの品質がまだ不十分だと指摘しています。ある調査では、約95%が「AI生成コードの修正に余分な時間を費やしている」と回答。現状では、人間の開発者がAIを補助的に使う「AIベビーシッター」のような役割が実態に近いようです。 しかし、開発者の関心は非常に高いです。Stack Overflowの調査では、84%がAIツールを「利用中」または「利用予定」と回答し、昨年から増加しています。技術的な課題はありつつも、開発現場でのAI活用への需要は確実に高まっていると言えるでしょう。

Microsoft、TeamsにAIエージェントを多数投入し機能強化

マイクロソフトは2025年9月18日、コラボレーションツール「Microsoft Teams」に、会議やチャネル、コミュニティごとに特化したCopilot AIエージェントを多数追加すると発表しました。これらのエージェントは、Microsoft 365 Copilotユーザーを対象に展開され、業務の自動化と生産性向上を支援します。チームの働き方はどのように変わるのでしょうか。 最も注目されるのは、会議の生産性を向上させる「ファシリテーターエージェント」です。このAIは会議に参加し、議題の作成、議事録の記録、参加者からの質問への回答を自動で行います。各議題の時間配分を管理し、議論が長引いている場合は知らせることで、会議の円滑な進行をサポートします。 このエージェントはモバイルにも対応します。廊下での立ち話や突発的な対面での打ち合わせなど、これまで記録が難しかった非公式な会話も、スマートフォンからワンタップで起動し、内容を記録・要約させることが可能です。これにより、重要なアイデアや決定事項の取りこぼしを防ぎます。 チャネルや社内SNSにも専用エージェントが配置されます。チャネルエージェントは、過去の投稿や会議内容を基に質問に答えたり、プロジェクトの進捗報告書を自動生成したりします。社内SNS「Viva Engage」では、コミュニティ管理者を支援し、メンバーからの質問に自動で回答します。 さらに、ユーザーが意識しない裏側では「ナレッジエージェント」が活躍します。このAIはSharePoint上で動作し、ファイルの整理、タグ付け、要約を自動で実行します。これにより、組織内に散在する情報が整理され、必要な情報へのアクセスが容易になり、ナレッジマネジメントが強化されます。 ファシリテーターエージェントは既に利用可能ですが、ドキュメントやタスクの作成機能はパブリックプレビュー段階です。その他の新エージェントや、AIによるタスク自動化ツール「Workflows」の刷新版などもプレビューとして提供が始まっており、今後さらに多くの機能が追加される見込みです。

AWS、カスタムML環境と厳格な統制を両立する新手法を発表

Amazon Web Services(AWS)は、企業がカスタム構築した機械学習(ML)環境の柔軟性を維持しつつ、MLライフサイクル全体のガバナンスを強化する新手法を発表しました。多くの企業はコンプライアンスや独自アルゴリズムの最適化といった特殊な要件から、標準プラットフォームではなく独自の開発環境を構築します。しかし、こうした環境はMLライフサイクル管理の複雑化という課題を抱えていました。 この課題を解決するのが、AWS Deep Learning Containers (DLCs) とAmazon SageMakerのマネージドMLflowの統合です。DLCsはTensorFlowやPyTorchなどのフレームワークが最適化されたDockerコンテナを提供し、特定の要件に合わせた開発環境の構築を容易にします。これにより、開発者インフラ構築の手間を省き、モデル開発に集中できます。 一方、SageMakerのマネージドMLflowは、実験のパラメータ、メトリクス、生成物を自動で記録し、モデルの系統を完全に追跡します。これにより、インフラ維持の運用負荷を軽減しつつ、包括的なライフサイクル管理を実現します。誰が、いつ、どのような実験を行ったかを一元的に可視化・比較することが可能になるのです。 具体的な利用例として、Amazon EC2インスタンス上でDLCを実行し、モデルのトレーニングを行います。その過程で生成される全てのデータはマネージドMLflowに記録され、モデル成果物はAmazon S3に保存されます。開発者はMLflowのUIから、各実験の結果を直感的に比較・分析できます。 この統合の最大の利点は、モデルがどの実験から生まれたのかという来歴が明確になり、監査証跡が確立される点です。企業は、柔軟なカスタム環境でイノベーションを加速させながら、MLライフサイクル全体で高いガバナンスとコンプライアンスを維持できるようになります。本手法の詳細な実装手順やコードサンプルは、AWSが公開するGitHubリポジトリで確認できます。