主要コーディングエージェントCLI6種を仕様比較:フック・権限・サブエージェント・MCP設定の違い
Claude Code・Codex・Gemini CLIなど主要なコーディングエージェントCLI6種を、フック機構・権限モデル・サブエージェント・MCP設定という観点で横並びに比較した記事。同じ「エージェントCLI」でも権限の粒度やフックの発火点、MCPの設定方法が大きく異なることを表で整理している。どのツールをハーネスの土台にするか選ぶうえでの一次資料になる。
DAILY TECH SURVEY — 2026-10-01 · RUN 78
Claude Code・Codex・Gemini CLIなど主要なコーディングエージェントCLI6種を、フック機構・権限モデル・サブエージェント・MCP設定という観点で横並びに比較した記事。同じ「エージェントCLI」でも権限の粒度やフックの発火点、MCPの設定方法が大きく異なることを表で整理している。どのツールをハーネスの土台にするか選ぶうえでの一次資料になる。
エージェントに`.env`や認証情報を読み込ませないための除外設定を、Claude Code・Codex・Gemini CLIの三者で共通化して解説した記事。ignore設定や権限denyの書き方を具体例で示し、うっかり秘密情報がコンテキストやログに混入する経路を塞ぐ。エージェントを常用するほど重要度が上がる運用上のガードレール。
AIエージェント時代に向けてテストの位置づけを問い直す3本を束ねたストーリー。テストファーストでエージェントに実装させるワークフロー、振る舞いをテストで検証できる「仕様」として設計を書く方法、そしてAI前提でテストの役割そのものを見直す論考が並ぶ。いずれも「エージェントが書いたコードをどう信頼するか」という共通の問いに答えようとしている。
テストファーストは生成物の受け入れ基準を先に固定できる一方、仕様が固まる前の探索的な実装ではテストの書き直しコストが増える。3本とも「まず振る舞いを言語化する」点で一致しつつ、どこまでを人間が書くかで温度差がある。
skill「Grill Me」の作者Matt Pocockが、エージェントを「毎朝記憶を失う同僚」に見立て、そのためにコードベースをどう整えるかを論じたトーク要約。命名・構造・ドキュメントをエージェントが辿れる形に保つことが、人間の可読性向上とも一致すると説く。エージェント前提の基礎づくりの考え方がまとまっている。
エージェントに何を覚えさせ、何を読ませないかを設計する2本のストーリー。CLAUDE.md・自動メモリ・引き継ぎ資料の3層で記憶を使い分ける方法と、Claude CodeにもCodexにも依存せず「AIに全部読ませない」ことでトークンを節約する設計論が並ぶ。コンテキスト窓の使い方がそのままコストと精度に効くという実感に基づく。
エージェントを自律・無人で走らせたときに現れる失敗を扱う2本。ひとつは無人運用が最後の1行で全停止した顛末、もうひとつはAIが下した「効かない」という結論が実は未計測で、正しいコードを捨てさせていたという検証の落とし穴。どちらも「エージェントの自己申告を人間がどう検証するか」という同じ急所を突く。
Claude Codeのskillでallowed-toolsを指定しても挙動が変わるのかを、24回の試行で実測した検証記事。結論として、道具の明示指定は今回の条件では出力を有意に動かさなかったという。skillの設定項目が実際に効いているのかを一次データで確かめた点に価値がある。
Claude Codeで一人開発を1か月続けた運用記録を、売上0円という実測込みで率直に綴った本。何が動いて何が壊れたか、どこでコストが膨らんだかを具体的に振り返り、個人開発でエージェントを常用する際の現実的な作法を導く。理想論でなく失敗の記録として読める。
Claude Codeを日々回すうえでの実務Tipsを3本まとめたストーリー。Opus 5.5でのモデル切り替えとeffort設定、20個に増えたタブのうちどれが確認待ちかを可視化する工夫、そしてコードを1行も変えずにバグ原因を調べさせるread-only運用が並ぶ。いずれも既存機能の使い回しで効くのが共通点。
並列エージェント運用でgit worktreeを増やし続けた結果、22個中11個が中身のない「抜け殻」になっていたという棚卸しの記録。作業場を量産する運用は速い一方で、放置コストと管理の破綻を生むことを実数で示す。並列化のスケール限界を考える材料になる。
Cloudflare周辺の2つの動きを束ねたストーリー。ひとつはCLIをwranglerから新しい`cf`へ移行する手順、もうひとつはNext.jsアプリをVercel以外(Cloudflare WorkersやAWS Lambda)へデプロイできる「Vinext 1.0」のリリース。どちらもWorkersを実行基盤として使う際の選択肢を広げる。
OpenAI DevDay 2026の発表を整理した2本のまとめと、GPT-6.1 Solについて「本当のニュースは性能ではなくエージェントの請求額だ」と論じた記事を束ねたストーリー。新モデルや機能追加を俯瞰しつつ、エージェント常用時のコスト構造に注目が集まっていることを示す。LLMの課金・計測に関心がある向き。
uhyo氏がClaude Sonnet 5.5をReact習熟度ベンチマークにかけ、他モデルと違う特徴的な振る舞いを観察した記事。単なるスコアの高低でなく、どういう問題で崩れ、どこで独特の癖を見せるかを掘り下げている。モデルの実力を自作ベンチで計測する姿勢が参考になる。
AIが書くコードが増える時代の可読性とレビューを扱う2本。ひとつは設計次第でAIコードの「読む量」を減らせるという論、もうひとつはコードレビューを人の目でなく仕組み(自動チェック)に向けろという主張。どちらも人間のレビュー帯域が希少資源になる前提で、負荷を構造で下げようとしている。
Googleが公開した、脆弱性を自動で修正するオープンソースのエージェントハーネス「Mantis」を紹介した記事。従来手法に比べトークン消費を85%削減したとされ、セキュリティ修正という定型作業をエージェントで回す実例になっている。ハーネス設計とコスト削減の両面で参考になる。
3か月のテストを経て「WSL 3.0」が正式版になり、Dockerを使わずにLinuxコンテナを構築・実行できる「WSL containers」が同梱された。`wslc compose`の開発にも着手しているという。エージェント開発の関心領域からは外れるが、ローカル開発環境の土台が静かに大きく変わる話として拾った。
Rustコンパイラの高速化に長年取り組む著者による、2026年9月時点での最適化の現状レポート。どの手法が効き、どこにボトルネックが残るかを継続観測として淡々と記録している。テーマは興味の外だが、大規模プロジェクトの性能改善を地道に積む手つきそのものが読み物として面白い。
RELEASE WATCH
権限プロンプトが積み重なった際に「2 of 5」のような件数を表示。全画面の「N more」行のマウス操作対応や、`--resume`/`--continue`が並列ツール呼び出し後に履歴を失う不具合の修正など。
WebFetchを無効化する`CLAUDE_CODE_DISABLE_WEB_FETCH`、デスクトップ版を開く`claude --desktop`、プラグイン設定を扱う`claude plugin configure`と`--config`でのMCPサーバ設定を追加。
Claude Sonnet 5.5(1Mコンテキスト、$2/$10 per Mtok)を追加しAPIの既定Sonnetに。auto modeに「今回は許可、次回は再確認」の選択肢を追加し、`/usage`と行に月間支出額を表示するようにした。
LLMゲートウェイが同一プロンプト由来のリクエストをまとめられる`x-claude-code-prompt-id`ヘッダを追加。`availableModelsMatch`と`deniedModels`のmanaged設定でモデル許可・禁止を細かく制御できるようにした。
ワイド端末でClaudeの散文幅を制限する`maxProseWidth`設定を追加。無視・無効化されたテレメトリ設定を起動時通知と`/status`・`claude doctor`で表示するようにした。
アルファ版リリース(詳細なリリースノートなし)。
アルファ版リリース(詳細なリリースノートなし)。
アルファ版リリース(詳細なリリースノートなし)。
アルファ版リリース(詳細なリリースノートなし)。
Windowsで背景プロセスやサンドボックス実行時にコンソール窓が点滅する問題を抑制(バックポート)。
OSS RANKING
FETCH STATUS