【調べた】LLMサーバーの負荷検証、AIに書かせた自作スクリプトでは他プロジェクトと数字が比べられない──測定ツールは層ごとにチームで1つに統一する(アプリ層は Locust、vLLM 層は vllm bench と GuideLLM)
負荷検証スクリプトはAIに頼めば数分で書けるが、複数人・複数プロジェクトで別々に作ると同じTTFTという名前の数字が車輪ごとにずれて比べられない。Python主軸の汎用ツール(Locust/k6)とLLM特化ツール(GuideLLM/vllm bench/AIPerf)を公式ドキュメントで比較し、自作で数字がずれる場所と、層ごとに測定ツールをチームで1つに決める、という結論を整理した。
6975 文字
|
35 分
Cover Image of the Post
【調べた】「私のキャリアに関わる重要な問題です」は本当に効くのか──感情プロンプト研究3年の流れを追ったら、精度の話は終わって内部表現の話になっていた
一時期よく聞いた感情プロンプト(EmotionPrompt)に精度向上の根拠があるのかを、2023年の起点論文から2026年のAnthropic感情ベクトル研究まで追いました。精度の話は頭打ちになって焦点が内部表現へ移っていること、そして自分は「おまじない」をやめて見直しループだけ使うと決めた理由を書きます。
6903 文字
|
35 分
Cover Image of the Post
Claude Code / Codex / Cursor、スマホから作業の続きができないのはどれか──リモート操舵はエージェントループの置き場所で決まる
手元のマシンで立てた Agent CLI のセッションを、そのままスマホから続けたい。この一点でClaude Code・Codex・Cursorを比べると順位がはっきり分かれます。差を作っているのは機能の数ではなく、エージェントループがどのマシンで回っているかと、リモート接続をデフォルトにできるかどうか。2026年9月時点の各社公式ドキュメントを突き合わせて整理しました。
6301 文字
|
32 分
Cover Image of the Post
【Claude Code】/compact したら資料に書くはずだった内容が消えていた──コマンドを打つ前に宣告する運用と、同じ型の小技7つ
Claude Code で /clear や /compact を打った直後に、会話で合意した内容が資料から抜けていた問題を、コマンドの前に自然文で宣告して点検ターンを挟む運用で解消した話。効いている理由と、HANDOFF.md・/compact への指示・/rewind・フックなど同じ型の小技を公式ドキュメントと突き合わせて整理します。
4664 文字
|
23 分
Cover Image of the Post
ブランチが増えすぎて管理できない原因──git-flow・trunk-based・promote型を整理して分かった使い分け
長命ブランチが増えてカオスになる原因を、git-flow / trunk-based / GitHub Flow / promote型(環境ブランチ)という4つのブランチ戦略の一次資料から整理して切り分けました。
8498 文字
|
42 分
Cover Image of the Post
【業務投入】社内ソースをAIレビューに出せない問題を、DGX Spark 2台のQwen3.8 Flash Nextで解いた──個人には微妙、企業には効きそう
自社開発のソースコードは外部APIに投げられない。その制約のまま、DGX Spark 2台で動かしたQwen3.8 Flash NextにコードレビューのLLM部分を担当させた体験記です。前回「個人には元が取れない」と計算した構成が、企業の制約下では評価が変わるという話を書きました。
6234 文字
|
31 分
Cover Image of the Post
GPT-6 AstraとClaude Fable 5.1、どっちを使えばいいか分からない──用途別の使い分けとコスト比較
2026年9月に2日違いで登場したGPT-6 AstraとClaude Fable 5.1を、ベンチマーク・用途・実際にかかるコストの3方向から比較しました。API単価は両者とも同額ですが、キャッシュ単価と長コンテキスト課金の設計が違うため、請求額は用途で大きく変わります。
6146 文字
|
31 分
Cover Image of the Post
Kaggle AI Agent Securityコンペで銀メダル113位──本当の限界は「もう打つ手がありません」の先にある
OpenAI/Google/IEEE主催のred-teamingコンペ「AI Agent Security - Multi-Step Tool Attacks」で4,252チーム中113位・銀メダルでした。全レバーが閉じたと判断して撤退した床が実はまだ動いていた話と、AIとコンペを回すときGPU枠と資料の量が律速になる話をまとめます。
6267 文字
|
31 分
Cover Image of the Post