GPT-6 Astra
OpenAI が
コメントの要約
OpenAI が
コメントではまず価格が焦点になり、前世代の GPT-5.6 Sol が $4/$20 だったため2倍以上になるという指摘が並んだ。ARC-AGI-3 で 98.6% を出したと報じる記事へのリンクが貼られたが、リンク切れになったという報告が続いた。
出力トークン数を抑えたままサイバーセキュリティ系ベンチマークで高スコアを出したという公式記述を引用し、速度と効率の改善を評価する声もある。
OpenAI が
GPT-6 Astra
OpenAI が
OpenAI が
コメントではまず価格が焦点になり、前世代の GPT-5.6 Sol が $4/$20 だったため2倍以上になるという指摘が並んだ。ARC-AGI-3 で 98.6% を出したと報じる記事へのリンクが貼られたが、リンク切れになったという報告が続いた。
出力トークン数を抑えたままサイバーセキュリティ系ベンチマークで高スコアを出したという公式記述を引用し、速度と効率の改善を評価する声もある。
.name Termination
Verisign が
Verisign が
コメントでは申請書の記述への批判が集中した。「提案するサービスがドメイン名のライフサイクルに与える影響」の欄に「なし」と書かれている点、影響を受ける事業者との協議を問う欄に「該当なし」とだけ答えている点が引用されている。
ICANN が承認したこと自体への不信を述べる投稿が多く、公開コメント期間を設けるべきだったという意見や、移行期間を数年取らずに名前空間を閉じるのは無責任だとの指摘が並んだ。
Ask HN: Why were OpenAI, Claude, and Grok simultaneously down?
ChatGPT・Claude・Grok が
日本時間9月4日未明、
コメントでは GPT-6 Astra の公開日と重なっていることを指摘する投稿があり、OpenAI については開発者アカウントへのログインすらできない状態だったと報告された。chatgpt.com 自体が読み込まれなかったという声もある。
1つの LLM が落ちると他社にトラフィックが集中して連鎖するのではないか、という推測も出ているが、確認された原因は示されていない。
Audacity 4.0
音声編集ソフト Audacity の
音声編集ソフト Audacity の
コメントでは、Electron 製アプリが 500MB を超える時代に 50MB 未満で収まっている点を評価する声が出た。Audacity 3 系でプロジェクトが保存されない、クリップ間でクリックノイズが乗るといった不便が解消されたという使用報告もある。
開発を主導した Muse の Head of Software による解説動画が繰り返し共有され、UI 刷新の理由を知る資料として案内されている。
Any Human Ever – One life, drawn at random from all who have ever lived
これまで
これまで
コメントには自分が引いた結果を書き込む投稿が並んだ。紀元前7785年のインダス流域で生後8か月で呼吸器感染症により死亡、紀元前3394年の朝鮮半島で出生時平均余命28年・5歳未満死亡率42%といった具体例が挙がっている。
乳幼児死亡率の高さに反応する投稿が多く、自身に子どもができてから数字の受け止め方が変わったという感想や、TRPG の題材として使えるという提案が出ている。
Qwen 3.8 27B available on Cerebras at 1500 tokens/s
Cerebras が
Cerebras の
コメントでは提供条件の制約が話題になった。現時点では API のトークン課金のみでコーディングプランには入っていないこと、コンテキスト長が 128k に制限されるため長いタスクには向かず、専門特化のサブエージェント用途に留まるという指摘がある。
なぜ 2.4T 版のような大型モデルではなく小型モデルばかりホストするのか、ウェハ間の I/O 帯域が制約なのではないかという疑問も出ている。OpenRouter 経由での提供を望む声も複数ある。
Google Antigravity TOS: 3rd party usage can get Google account suspended
Google Antigravity の
Google Antigravity の
コメントでは「サードパーティ」の定義が曖昧だという批判が集まった。自作のハーネスを書く場合、Codex からサブエージェントとして `agy -p` を呼ぶ場合、OpenClaw を自前でホストする場合がそれぞれ該当するのか判別できないという声が並んでいる。CLI と OAuth インターフェイスを用意しながら利用を罰するのは筋が通らない、との指摘もある。
より大きな問題として、Google アカウントが生活の基盤サービスと密結合しているため、分類器の誤判定で失うリスクを負えないという意見が複数出ている。
K2 Horizon: A connected fleet of six open models
ifm.ai が
ifm.ai が
コメントでは公開状態への指摘が続いた。投稿されたリンクがログイン URL になっており本来のページに辿り着けないこと、事前学習・事後学習の両リポジトリが実際には空であることが報告され、公開が前倒しになったのではないかという推測が出ている。
比較対象の選び方も批判された。タスクごとに比較先のモデルが入れ替わっており、DS4Flash・GLM53Flash・Qwen38 といった最近のオープンモデルと揃えて比較すべきだという意見がある。Kimi K2 と紛らわしい命名を指摘する声も出た。
Porting my 1993 Amiga game to Godot, with an LLM reading the 68000 assembly
1993年に
1993年に
コメントでは、同種の移植を行うためのエンジニアリングガイドや、移植に使ったツール群の説明をエージェントに書き出させたら有用だという提案が出た。バイナリからのリバースエンジニアリング経験者から、ここまでの結果は見たことがないという反応もある。
一方で、記事本文が AI の生成した文体そのままで読み進められないという批判も付いている。移植を実行した会話ログやリポジトリを公開してほしいという要望も複数出ている。
VC isn't VC anymore
ベンチャーキャピタルが
ベンチャーキャピタルが
コメントは賛否が割れた。IPO も資金調達手段ではなくインサイダーと VC の出口になっているという同意がある一方、「明らかになる前に賭けられない人の書き方だ」「今も無名のアイデアに賭けている VC はいる」という反論も出ている。
主張の立て方への批判もある。VC が小さいとも大きいとも書かれ、論点が散らかっているという指摘や、特定 VC の政治的立場への反発が動機ではないかという読み方が示されている。
.name Termination
Verisign に
Verisign が
コメントは ICANN への批判が中心になった。レジストリの責任を引き受ける事業者へ売却する選択肢があったのに廃止を選んだこと、ICANN がそれを後押ししたことを問題視する投稿が並んでいる。
手続き面では、Verisign と ICANN の文書がともに、三次レベル登録に隠れていた二次レベル名がどうなるかを明示していない点が指摘された。Brexit で英国市民が .eu ドメインを保持できなくなった件を引き合いに、DNS の中央集権化の帰結として捉える意見もある。
Audacity 4.0.0 Released
Audacity 4.0 の
Audacity 4.0 の
新規プロジェクトなら Qt を選ぶのは理解できるが、動いているものを移行してまで得るものが小さく、失われた機能に見合わないのではないかという疑問が出た。これに対し、wx が Audacity の UI 上の問題を直しにくくしていたこと、OS ごとにネイティブに見せるという wx の目標が実質的に破綻していることが反論として挙げられている。
UI の見た目の変化より編集ワークフローの改善が大きいという使用者の評価もあり、その一部は wx のままでは実現できなかったと開発側が説明していると紹介されている。
I Don’t Have a Smartphone…
スマートフォンを
スマートフォンを
コメントでは、同じ選択をしている人から周囲の反応の変化が報告された。かつては「何か問題があるのか」という反応だったが、近年は「自分もそうしたい」に寄ってきているという。完全に持たないのではなく、モバイル端末を隔離領域として使い、ノート PC を汚さない用途に限る、という中間的な運用も紹介されている。
記事中の「トイレに便座用・洗浄用・換気用の3つのアプリが必要」という記述に反応が集まり、赤外線リモコンだけで動く旧型の温水洗浄便座を勧める投稿や、汎用計算機が生活領域に侵入するのを避けているという実践が並んだ。
CERN transitioning industrial computers to Debian after being a longtime RHEL institution
長年 RHEL を
長年 RHEL 系を
コメントでは移行理由の推測が並んだ。LHC の制御系に PCI や VME ベースの古いハードウェアが大量に残っており、それらを現代の Linux で動かし続けるには、古い技術を切らないディストリビューションが要る、という説明が挙がっている。カスタムのカーネルドライバが絡むため NetBSD への移行は現実的でない、という指摘もある。
AlmaLinux には x86_64 v2 版があるものの、CERN には v1 世代のハードウェアも残っており、それが決め手になったのではないかという見方が示された。
A note on subscription prices from LWN
LWN が
LWN が
コメントは値上げへの反発ではなく、購読を始めた・上位プランに切り替えたという報告が中心になった。「professional hacker」ティアに移行したという投稿や、Lobsters 経由で LWN の記事を読む機会が多かったので存続してほしくて購読したという投稿がある。
タイトルを見た瞬間に LWN の停止だと思って動揺したが、値上げの告知で安堵したという反応もある。インドからの購読者からは、ルピー安と価格改定が重なっても支払う価値があるという投稿が寄せられた。
jujutsu 0.45.0
Git 互換の
Git と
「jj のリリースは退屈になってきた。細かい改善ばかりで大きく興奮する要素がない。それがいい」という評価が最上位に付き、安定してきたことの裏返しだと受け止められている。
要望として挙がったのはフック対応。jj は常時コミットするモデルのため `pre-commit` は噛み合わないが、`pre-push` なら同じ用途を満たせるという説明があり、`jj run` を使った現状の回避策が示された。もう一つは Git 併存のワークスペースで、既定以外のワークスペースに `.git` が作られないため Nix 周辺を含む一部のツールが壊れる、という報告が出ている。
Revo Programming language
テーブルを
テーブルを
コメントでは、Lua がテーブルだけに絞った判断は正しかったという立場からの好意的な反応が出ている。Roc に興味を持っていたがこちらのほうが目を引く、という投稿もある。
半静的型(semi-typed)という設計が未開拓の領域だという評価も付いた。Rust や C++ を主に書きつつ、スクリプトを書くときに現代的でない言語に落ちる場面があり、動的型の書きやすさと型の恩恵を両立させる方向に関心が集まっている。
I Think the Military Commissary Freezers Were Hacked
米軍売店の
米軍の
コメントでは代替説明が複数示された。中央の管理システムで1台だけ霜取りを選ぶつもりが全台を選んでしまった操作ミス、本番環境とテスト環境の取り違え、単純なバグ、という指摘がある。影響を受けた冷蔵庫コントローラが共通のファームウェアを積んでいた場合の共通原因故障を挙げる投稿もある。
攻撃だとした場合の時期の妥当性も議論された。展開中の艦船や遠隔地の基地が影響を受けていないなら戦略的な効果は限定的だという意見に対し、補給線が伸びている現状はむしろ好機だという反論が出ている。
Static Allocation, Constant Work
起動時に
起動時に
コメントでは、Linux ではメモリのオーバーコミットを無効化できる、メモリロックがある、組み込み向け OS にはそもそもオーバーコミットがない、という指摘が並んだ。記事側もスーパーバイザプロセスが殺されて再起動できない可能性に触れている、という擁護もある。
型ごとにプールを分ける確保方式については、Bonwick の論文にある通りオブジェクトが資源を保持したまま再利用できる利点や、並行プログラミングで安全なメモリ回収を単純化できる点が補足された。
What's in the Emacs newcomers-presets theme?
Emacs 向けに
Branch‑Avoidant Programming
分岐予測ミスを
分岐予測ミスを
コメントでは前提の補正が入った。分岐そのものを避ける必要はなく、大半が予測しやすい分岐であれば影響は小さい、記事の冒頭も「分岐予測ミスを避ける」と書いており、そちらが正確だという指摘がある。データがソート済みなら例示のコードもそのままで問題ない、という補足も付いた。
一方、SIMD や GPU のコードでは事情が違い、分岐がダイバージェンスを起こして SIMD グループ内の疑似スレッドのサイクルを無駄にするため、分岐回避が性能上必須になるという意見が出ている。タイミング攻撃への耐性が要る暗号系コードでも同様だという指摘もある。
Maybe you don't need GraphQL
GraphQL の
GraphQL の
コメントには同意が多い一方、記事の中身がタイトルの主張を支えていないという批判も出た。必要な秒間リクエスト数が6桁に届かないなら過剰設計だ、という判断基準を示す投稿もある。
反論として挙がったのが GraphQL フェデレーションで、1つのオブジェクトのフィールドを異なるデータソースから解決できる点が記事で扱われていないという指摘がある。これに対し REST の GET でも複数のデータベースから集約できる、という再反論が付いている。
Virtual Memory: Page Tables, TLBs, and Linux Internals
仮想メモリの
Zig's Io.Threaded is Neat
Zig の
Zig の
コメントでは、言語自体にインターフェイスの仕組みがないのに新しい API がインターフェイスを中心に構成されている点が分かりにくい、という指摘が出ている。
[PDF] Lost Bytes At The Crossroads Between User- And Kernel-Level Memory Allocation
ユーザー空間の
Linked Lists in the Linux kernel
Linux カーネルで
Performance Characterization of SPEC CPU 2026 on AMD EPYC 9755 Processor
AMD EPYC 9755 プロセッサ上で
DietrichGebert/ponytail
AI エージェントに
AI エージェントに
計測は FastAPI + React の実在する OSS リポジトリを編集する Claude Code のセッションに対して行われ、スキルなしの同じエージェントとの比較で、コード量が平均約54%減、コストが約20%減、実行時間が約27%短縮と報告されている。12件の機能タスク(Haiku 4.5、n=4)の平均値。
削減率は場面依存で、エージェントが作り込みすぎる日付ピッカーでは94%に達し、元のコードがすでに最小限なら効果はほぼゼロだと明記されている。安全側のガードは削らない点も、単に「一行で書け」と指示した場合との差として挙げられている。
debpalash/VoiceStudio
ローカル実行の
ElevenLabs の
16 の TTS エンジンと 11 の ASR エンジンを内蔵し、モデルカタログまたは Ctrl/Cmd + E で切り替える。TTS のカタログ上の言語数は 646 だが、実際のカバー範囲と品質は選んだエンジンに依存すると明記されている。
対応環境は Apple Silicon の macOS 13.3 以降、Windows 10/11 x64、Linux、Docker。ローカルワークフローについてはアカウント・API キー・サブスクリプション・使用量計測のいずれも不要。現在はアクティブベータで、安定した作業には最新リリースを使うよう案内されている。
google-research/timesfm
Google Research に
Google Research が
新たに TimesFM 3.0 のチェックポイントが `google/timesfm-3.0-pytorch` として公開された。2.5 までのチェックポイントは Hugging Face のコレクションにまとまっている。
Google 自社プロダクトへの組み込みも進んでおり、BigQuery ML から SQL で呼び出す経路、Connected Sheets 経由で Google スプレッドシートから予測する経路、Vertex Model Garden 経由の経路が案内されている。
mattpocock/skills
Matt Pocock が
Matt Pocock が
設計方針として、GSD・BMAD・Spec-Kit のようにプロセス自体を所有する手法と対比している。それらは開発の流れを引き受ける代わりに制御を奪い、プロセス側のバグを直しにくくする。対してこのスキル群は小さく、差し替えやすく、組み合わせられることを狙い、どのモデルでも動くようにしてある。
導入経路は2つ。Claude Code のプラグインとして一式を読み取り専用の管理下で入れる方法(更新を購読する形になる)と、skills.sh 経由で取り込んでフォークして自分のものにする方法が用意されている。
blader/humanizer
AI が
AI が
判定基準には Wikipedia の「Signs of AI writing」の35パターンを使う。WikiProject AI Cleanup が維持している一覧で、これに照らして書き直しの要否を判断する。処理は元の構造を固定せずに一度書き直し、その後でパターンと元の主張の両方に対して照合し、残った箇所を再度直す2段構えになっている。
事実の捏造は行わない方針が明記されており、名前・数値・日付・引用・出典は原文か書き手から来たものに限る。個人的な文章では書き手の文体を保ち、技術文書や参照用の文章は中立で平易な調子に揃える。
fmtlib/fmt
C++ の
C++ 向けの
リポジトリには Linux・macOS・Windows それぞれの GitHub Actions ワークフローのバッジが並び、3プラットフォームで CI を回していることが示されている。
加えて oss-fuzz による継続的なファジング、OpenSSF Best Practices、Securityscorecards のバッジが掲げられており、供給側の健全性を外部指標で示す構成になっている。
NousResearch/hermes-agent
Nous Research に
Nous Research が
実行環境は月5ドルの VPS から GPU クラスタ、アイドル時のコストがほぼゼロになるサーバーレス構成まで選べる。ノート PC に縛られず、クラウド VM で作業させながら Telegram から話しかけられる。
モデルは Nous Portal・OpenRouter・OpenAI・自前のエンドポイントなどから選べ、`hermes model` で切り替える。インターフェイスは複数行編集・スラッシュコマンド補完・履歴・割り込みとストリーミング出力を備えた TUI に加え、Telegram / Discord / Slack / WhatsApp / Signal / CLI を単一のゲートウェイプロセスから扱う。
affaan-m/ECC
複数の
Claude Code・Codex・Opencode・Cursor などを
README の冒頭に、公式の配布経路のみを使うよう警告が置かれている。GitHub リポジトリ、npm の `ecc-universal` と `ecc-agentshield`、GitHub App、プラグイン slug `ecc@ecc`、プロジェクトサイト ecc.tools が正規で、第三者による再アップロードやミラーはマルウェアを含む可能性があると明記されている。
導入は `npx ecc-universal setup` による案内付きセットアップ。Node.js 18 以降、Git、PATH 上の Claude Code 2.1 以降が前提。バージョンやキャッシュのエラーが出た場合は `npm view ecc-universal version` でレジストリ上のバージョンを確認してから再試行するよう案内されている。
JuliusBrussee/caveman
エージェントの
エージェントの
例として、React の再レンダリング原因を説明する69トークンの回答が19トークンに縮む対比が置かれている。診断内容・修正方法・`useMemo` という結論はいずれも残っており、削られたのは前置きだけだと説明されている。1回の返答で50トークン、1日数百回の返答で効いてくるという計算を示している。
削減の対象は散文に限られ、コード、コマンド、ファイルパス、エラーメッセージの原文には手を入れないと明記されている。導入形態は2種類が用意されている。
bannedbook/fanqiang
検閲回避ツールと
中国の
ブラウザ別のワンクリックパッケージが用意されており、Chrome(Windows / Mac)、Edge、Firefox(Windows / Linux)それぞれに対応するディレクトリが置かれている。
サーバー側の構築手順も収録されている。V2ray サーバーと Shadowsocks サーバーをそれぞれ自前で立てる簡易チュートリアルが Markdown で用意されている。
すべて既出
I Built My First AWS Agent Workflow, and the Hardest Part Was Getting It to Stop Assuming Things
Amazon Bedrock AgentCore で
Udacity の
エージェントには、顧客の入力がバグ報告なのか、FAQ で答えられる質問なのか、人間の対応が要る依頼なのかを判別させる。約2日で作り切り、初回の提出で correctness スコア 0.83 を得た。
筆者が最も学んだと書いているのは評価での失敗のほう。バグ報告についてはチケット作成前に3項目を揃えるよう指示していたが、エージェントが不足分を推測で埋めてしまう挙動が出た。
20 Agentic AI Terms Every Developer Should Know (Explained Simply)
エージェント AI 周辺で
My Dev.to CLI Got Its First Community PR. Image Uploads From Terminal.
Dev.to 投稿用 CLI devpub の
Dev.to への
実装された機能は `devpub upload`。初日からあるべきコマンドだったが、Forem API に画像アップロード用のエンドポイントが存在しないために実現できていなかった。
記事では、その制約をどう回避して v0.3 で画像アップロードを成立させたかと、初の外部コントリビューターが現れるまでの経緯を並べて書いている。
The extraction returned zero memories, and nothing screamed
セッションから
セッションの
筆者が問題と見るのは、抽出ループに用意された少数のエスケープハッチが、いずれも実際に起きたのとは別の緊急事態を想定して設計されていた点。個々の判断はそれぞれ擁護できるが、組み合わさると沈黙が生まれる。
OpenViking は視覚言語モデルにセッションをメモリへ変換させる抽出ループを回しており、記事はそこに含まれる3つの小さな隙間を並べて、どう沈黙に至るかを追っている。
Four Ways Your Background Job Disappears (And How to Stop Each One)
サインアップ時の
サインアップ処理に
記事は素朴な実装から始める。サインアップの流れの中で直接メールを送る版をまず書き、そこから壊れなくなるまで壊し続けるという構成を取っている。
バックグラウンドジョブが消える経路を4つに分類し、それぞれについて対処を示す形になっている。筆者は LiveReview という AI コードレビューを開発している。
How to Become a 10x Engineer and Stay Safe in the Age of AI Layoffs
AI が
AI で
筆者の見立てでは、誰もソフトウェアを理解しなくなる未来ではなく、ソフトウェアを書くコストが劇的に下がる未来が来る。そうなればエンジニアの価値の所在も移らざるを得ない。
キャリアの安全性を「代替不可能になること」ではなく「自分の価値を可搬にすること」と定義し直している。開発者が抽象化に抵抗してきた歴史(機械語からアセンブリ、アセンブリから高級言語)を並べ、同じ構図として扱っている。
I Tried 4 Models to Save My Self-Improving Agent. All 4 Failed.
自身の
AI-assisted genealogy
AI を
息子が
進め方は通常のソフトウェアプロジェクトと同じ構成を取っている。git、git のホスティング(Codeberg と GitHub の両方)、系図を可視化するための Cloudflare Pages。
データ形式には GEDCOM(GEnealogical Data Communication)を採用した。記事は同じ手順を再現できるよう、セットアップから順に書かれている。
Forensic Receipts: From Trusted to Proven
記録が
「AI メモリスタックを
前提として Write-Side Custody は、どの書き込みがメモリになるに足るほど信頼できるかを決める仕組みである。しかし何かを信頼すると決めることと、後からそれを証明できることは別だと筆者は整理する。デプロイ記録が信頼に足ると判断されて組織の記憶になった半年後、監査人から「以降変更されていないとなぜ言えるのか」と問われる場面を例に置いている。
「信頼できる書き込みしか受け付けない」はポリシーであって証明ではない、という区別が記事の軸になっている。
I Ran git reset --hard in the Wrong Window
3コミットを
OpenAI launches GPT-6 Astra, initially for customers in its Daybreak program; Greg Brockman says it is a “generational leap” and “we are now in the AGI era”
OpenAI が
OpenAI prices GPT-6 Astra at $10/1M input tokens and $50/1M output tokens, matching Anthropic's pricing for Claude Fable 5.1
GPT-6 Astra の
GPT-6 Astra scores 62.7% on ARC-AGI-3 with the standard harness and 99.9% with a new provider adapter harness; Claude Opus 5 scored 30.2%, and GPT-5.6 Sol 7.8%
ARC-AGI-3 セミプライベートで、
OpenAI says Astra was built on its largest-ever training run, using more than 100,000 GPUs at its Stargate site in Texas
Astra の
OpenAI calls GPT-6 Astra the “world's best computer use model”; in tests, it booked DMV appointments and searched job listings faster than the average person
コンピュータ操作性能を
Nvidia agrees to acquire Hugging Face for $12.9B, its second-biggest acquisition yet, after it paid $20B to buy assets from chipmaker Groq in December 2025
Nvidia が
Microsoft will open Xbox Cloud Gaming to non-Game Pass users via a pay-as-you-go model; Ultimate subs will be limited to 15 hours per month of cloud gaming
Xbox Cloud Gaming が
Adobe names Customer Experience Orchestration president Anil Chakravarthy as CEO, effective December 1, replacing Shantanu Narayen, who becomes executive chair
Adobe が
DOD's Emil Michael says Anthropic is still a designated supply chain risk, a day after Howard Lutnick said it resolved its issues with the Trump administration
商務長官が
Microsoft AI debuts MAI-Transcribe-2, a speech recognition model that it says beats Gemini 3.5 Transcribe and GPT-Transcribe, at $0.10/audio hour through 2026
Microsoft AI の
Repo-To-Skill: Distilling GitHub Repositories Into AI4AI Skills
リポジトリや
自律エージェントが
その知識は分野に存在しないわけではなく、リポジトリや論文の中に、人間向けの形式で、タスク中に読み込むには大きすぎる状態で置かれている。これを小さく検証済みのスキルへ蒸留すれば、実行のたびに再発見するのではなく再利用できると論じる。
提案手法 DisCo は、スキルを作りながら研究に使うエージェント。蒸留はタスク非依存(分野で広く使われるリポジトリを再利用可能なスキルへ凝縮)とタスク指向(具体的なタスクが要求するスキルを生成)の2形態で行う。前者をオープンなエコシステム全体に適用して、5,000件超の検証済みスキルからなる AREX-Skill Library を構築している。
HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?
評価の
エージェントの
HarnessDev は評価の単位をタスク出力から実行可能なインフラへ移すベンチマーク。Creation ではエージェントが最小限の種と少数のケースから完全な実行システムを構築し、Evolution では自ら作ったハーネスを起点に、下流の実行フィードバックを使って反復的に改訂する。
構築されたハーネスは能力(未見のベンチマークでのタスク成功率)と効率(実行トークンのコスト)の2軸で評価される。Creation の結果は6つの作成側 LLM、4ドメイン、5つの下流ベンチマークを対象としており、自作ハーネスの能力に大きなばらつきがあることが示されている。
Aspire: Can Models Self-Evolve from Vague Goals?
「より
人間の
ASPIRE は自然言語の能力目標だけを与え、下流の評価タスクは隠したままにするベンチマーク。エージェントはデータと更新手法を選び、学習と検証の信号を自ら構成し、いつ評価するかを決める必要がある。モデル重みの進化とエージェントハーネスの進化の両方を同一の対話環境で扱う。
評価は6つの目標にまたがる、専門家が作成した非公開の520項目で行う。実験では、曖昧な目標が探索の労力を目標解釈の側へ振り向けさせることが示されている。
EarlyEval: Cheaper Agent Evaluation via Early Outcome Prediction
実行の
フロンティアモデルで
EarlyEval が導入するのは早期の結果予測という別の軸。エージェントの最終的な成否は、実行が完了するかなり前の中間的な振る舞いから見て取れることが多い、という着眼に基づく。
実装は、行動・テキスト・参照解の各特徴に対して LightGBM の成功分類器と失敗分類器を学習させ、いずれかが較正済みの確信度閾値を超えた時点でエージェントの実行を打ち切る軽量な枠組み。ステップごとのオーバーヘッドはごくわずか。SWE-bench Verified、TerminalBench、Toolathlon の3ベンチマークで評価している。
Language Models Can Control Their Own Attention
モデル自身に
言語モデルは
有力な既存手法は軽量な代理スコアで関連トークンを事前選択するが、この外在的なスコアリング自体がステップあたり O(N) のコストを持つ。本論文は「モデル自身がどこが関係するかをすでに知っているのではないか」という問いから内在的な手法を取る。
提案する Declarative Attention (DA) は、思考の連鎖の中でモデルにどこに注目するかを宣言させるプロトコル。生成を「全文脈」「特定領域」「直近の出力のみ」の3モードに分割し、推論エンジンがその宣言をツール呼び出しのように解析して KV キャッシュの読み出しの大半を省く。Gemma-4-31B と Qwen-3.6-27B に対する15の長文脈タスクのゼロショット評価で、注目トークン数を大きく削減している。
On the Design Fundamentals of Pixel Text Representation Learning
テキストを
テキストが
系統的な統制アブレーションによって、4つの重要な要素を特定している。可変の画像解像度とレンダリングフォントサイズが高解像度文書への一般化の空間的な代理になること、自然な画像とテキストの対が接地に不可欠でテキストのみへの崩壊を防ぐこと、レイアウトを意識したレンダリングがピクセルレベルのショートカットを防ぐこと、2段階の多言語カリキュラムが言語横断の整合を可能にすること。
これらをスケール可能な学習レシピに統合し、Pixel Linguist II を学習させた。オンザフライのレンダリングによるネイティブ解像度の視覚エンコーダで、統一された対照学習による接地と多言語カリキュラムを用い、2億8千万件の学習例を使っている。
Beyond Visual Similarity: Entity-Aligned Retrieval for Knowledge-Based Visual Question Answering
画像を
知識ベース視覚質問応答
提案する KBMR は、KB-VQA 向けに設計された初の MLLM ベースの埋め込み検索器。MLLM の自己回帰的な能力を利用して、画像を概念の同一性がより保たれる意味空間へ写像する。
Wikipedia 規模の検索におけるノイズの多い教師信号に対処するため、連続的なエンティティ整合度の重みを生成する MLLM ベースの意味判別器を導入した。この重みが連続的な意味蒸留の目的関数を導き、二値ラベルに縛られないハードネガティブサンプリングとソフトな教師信号を可能にしている。
S3Gym: Can LLMs Turn Self-Testing and Self-Judging into Self-Improvement?
自己テスト・自己評価・
LLM は
S³Gym は、自己テスト・自己評価・自己改善という結びついた3つの能力を通じて LLM の自己改善を評価する対話型ベンチマーク。自由な探索と厳格な未見評価を分離し、実行可能な環境検証器を備えた7つのテキストベースゲームでこのプロトコルを具体化している。
対話経験を取り込む経路として、履歴をそのまま文脈に入れる History ICL、スコアで条件付けた Summary Memory、パラメータの学習の3つを比較した。実験からは、自己改善が自動でも一様でもないことが示されている。文脈レベルの経験が有効なモデルとゲームの組み合わせはあるが、最も有効な経路はタスクの構造に強く依存する。
NeoMME: A Single-Tower Multimodal-Native Multilingual Foundation Encoder for Efficient Fine-Tuning and Inference
生成向け VLM を
マルチモーダルモデルは
NeoMME は 260M と 800M のパラメータを持つ、多言語テキストと生の画像パッチを単一の双方向 Transformer エンコーダで処理するモデル群。どちらもマスク付き離散拡散のテキスト目的関数でゼロから事前学習され、マルチモーダルな例では可視の画像パッチで条件付けられる。文脈長は16,384トークンで、4K UHD 画像2枚分を符号化できる。
密ベクトルと late-interaction のヘッドを同時学習してファインチューニングした結果、ViDoRe v3 ベンチマークで NeoMME-Retriever 260M が 800M 未満の全評価モデルを上回る nDCG@10 0.523 を達成している。
ZipTok3D: High-Fidelity 3D Tokenization with Compact Token Prefixes
3D 形状を
効率的な
ZipTok3D の中心的な着想は、物体の形状を段階的に情報量が増えるグローバルトークンの接頭辞として整理し、反復的なデコードでその圧縮表現を展開すること。学習時には nested dropout で符号化後の潜在列をランダムに打ち切り、残った各接頭辞が物体全体を復元できるよう要求することで、先頭のトークンに本質的な幾何情報を優先的に集める。
デコーダはパラメータを共有する Transformer ブロックを繰り返し適用し、各接頭辞から細部の幾何を復元する。別途の生成的サンプリング段階を必要としない構成になっている。
GitLab の
GitLab が
ブックマークコメントで最も引用されたのは「長く効く判断力を教える」という節。ツールや機能の使い方はフルエンシーのごく一部で、何をどう AI に任せるか、返ってきたものをどう評価するかが同じくらい重要だ、という記述が「結局これ」として抜き出されている。
一方で「具体的な話がない」という指摘も付いた。AI を導入しただけで満足して現場がハルシネーションに振り回される事態を防ぐ記事として評価する声もある。
MonotaRO が
MonotaRO の
ブックマークコメントでは、ローカル開発で複数の worktree を使うときに DB の初期化で手間取るため真似できそう、という具体的な適用先が挙がった。btrfs では駄目だったのかという疑問も出ている。
CoW による性能への影響を懸念するコメントもあったが、複製元は本番に近い別の DB であって本番そのものではない点を読み取り直す投稿が続いた。文中の「解く」「分身」「症状」といった語の使い方を AI 由来として指摘する声もある。
AI エージェントが
WebMCP は、
ブックマークコメントでは、ブラウザエージェント向けにフォーム定義を標準化するという発想自体が筋がいい、という評価が出た。一方で仕様がまだ動きそうだという慎重な見方もある。
仕様の背景を補足するコメントも付いた。提案元は Google と Microsoft で、ブラウザ側の対応も必要なため Chrome の Stable 版では trial flag を有効にする必要がある。Google にとっては MCP 単体が使われると検索されなくなるため死活問題だ、という読み方が示されている。掲載メディアの見出しの付け方への批判もある。
放置していた
放置していた
ブックマークコメントでは経緯の整理が共有された。セキュアに運用しようとして自動アップデートを有効にしていたところ、脆弱性のある最新版に更新され、次の修正版が出るまでの間に乗っ取られた、という構図が要約されている。
対処の方向としては静的サイトへの移行を挙げる声が多く、AI を使って DB ダンプから記事を抜き Astro へ移す案、CMS 自体をやめてブログサービスに寄せる案が並んだ。一方で「コンテンツを更新しないことと放置は違う」として、自動更新と httpd の定期チェックを cron で回すだけでよい、という反論も付いている。
ChatGPT・Claude・Grok で
日本時間2026年9月4日午前0時40分
ブックマークコメントでは、主要サービスが一斉に落ちると仕事が一瞬で止まることが可視化された、という反応が目立った。「Claude だけじゃなかったのか」という気づきの投稿も複数ある。
同時に落ちた原因については確定的な説明がなく、偶然ではないだろうという推測や、憶測混じりの冗談が並んでいる。原因を特定するコメントは付いていない。
LayerX の
2026年9月3日開催の
ブックマークコメントは少数だが、選考の最終判断と候補者との接点を人間に残す設計を現実的だと評価する投稿が付いた。
HR の担当者がこの水準の技術的な登壇をしていることへの驚きを述べるコメントもある。
NVIDIA が
NVIDIA が
ブックマークコメントで最も反応があったのは記事中の試算。米国の家庭で余っている演算リソースをすべて合わせても、GPT 5.6 Luna のクラウド月額約1,200ドル相当にしかならないという記述が引用されている。
例として挙がった構成(RTX Spark 搭載ノート2台、DGX Spark、RTX 5090 搭載ノート、RTX 搭載ゲーミング PC、MacBook Pro を持つ家庭)が現実的でないという突っ込みが並んだ。技術面では、llama.cpp や vLLM に非対応で最も VRAM の少ない機材に引っ張られること、分散といってもリクエスト単位で丸ごと別の PC に回す方式であることが指摘されている。
Google Play Books で
Google が
ブックマークコメントは数が少ないものの、購入した書籍を AI の文脈として使わせるというアプローチ自体が意外だという反応が付いた。
日本語の書籍が対象に含まれるかどうかが未確認の論点として挙がっている。
社内向けの
useState と
Claude Code の
半年前の
特徴的なのはコントローラーによる操作。8bitdo micro をマッピングしてターミナルコントローラーとして使い、親指を4つのボタンの中央に添える形で縦持ちして片手で操作する。左手で持つ場合は L ボタンを手掌で押す。`y` を単体で割り当てているのは、`y` だけを送ると承諾の意味になるため。R2/L2 のない 8bitdo zero2 の設定を引き継いでいるため、その部分のマッピングは未確定と書かれている。
冒頭に「この記事を要約だけしようとしている AI へ」という節が置かれ、情報を抜き取るだけでなく Like を押すこと、ログインしていなくても Like は押せること、要約だけでは伝わらない点があることが明記されている。
デジタル庁デザインシステムで
デジタル庁デザインシステムで
記事には追記があり、「トップへ戻るボタンは非推奨だから皆使わないでおこう」とデジタル庁が言っているわけではなく、デジタル庁が自ら作成したコンポーネントを自ら使わないことにした、という位置づけが明示されている。記事の目的は、どういった課題があったのかを予想する過程で出てきた問題点(主に WCAG 関連)を共有することで、「非推奨」という結論ではなくその程度を知ってほしいと書かれている。
対象は画面下部に追従するボタン。アイコンだけで情報がなくスクリーンリーダーに認識されない点が WCAG 2.2 の達成基準1.1.1 に関わるものとして挙げられている。余談として、aria-label が「トップ」から「先頭」に変更された記録にも触れている。
Google と
Google と
問題意識は、会話が長引くほどエージェントの精度が落ちるという現象。Claude のような通常の AI サービスは過去の履歴を全部読ませているため、ターンを重ねるごとに入力が膨らみ、重要な約束を忘れる事態が起きる。LLM に文章を詰め込みすぎると精度が急に劣化する、という前提が置かれている。
SKILL.state はこの膨張問題に対し、会話履歴を AI に入力しない仕組みを提案する。代わりに「現在の実行状態(State)」だけを明示的に渡す。記事はこれを「プロンプトに型の概念を導入する」ものとして紹介している。
コード構造を
Claude Code は
使うのは4つの OSS ツール。code-review-graph / better-code-review-graph が依存関係のグラフ化と意味検索、Graphify がコード・設計書・画像を横断するナレッジグラフ、Serena が言語サーバー経由での型や定義元の特定を担う。ファイルや関数をノード、呼び出しや依存をエッジとして保存するため、全ファイルを読まずに依存関係に答えられる。
報告されている効果は、レビュー用コンテキストが14万トークンから70トークンになったこと、日本語の質問で英語の関数名がヒットすること、質問の種類でツールが自動的に切り替わること。セットアップ手順と CLAUDE.md のルーティングルールがそのまま掲載されている。
自作 npm パッケージに
2026年8月29日早朝、
危険だった時間帯が2段階に整理されている。日本時間5:00頃〜7:51頃は通常のインストールで汚染版が入る状態、7:52頃〜13:10頃は deprecate 済みで新規の解決からは外れるがレジストリ上には残存。ただし後者の時間帯でも、lockfile に汚染版が固定済みの環境と、`npm install パッケージ名@3.0.4` のようにバージョンを明示したインストールは汚染版を取得できた。deprecate は警告を出すだけでこれらを止められない。
影響を受けたのは 0.5.4 / 0.5.5 / 1.6.3 / 1.6.4 / 2.2.1 / 2.2.2 / 3.0.3 / 3.0.4 と `0.0.0-` で始まるプレリリース2件の計10バージョン。該当する場合は、そのマシンや CI ランナーから到達できる npm・GitHub のトークン、SSH 鍵、クラウドのアクセスキー、環境変数のシークレットをすべてローテーションするよう強く勧めている。
会話セッションを
Artifact Share の
核になった設計判断は2つ。会話セッションを邪魔せずにエージェントを起こす合図は3つのエージェントで別々に作るしかなかったこと、常駐デーモンは不要で1ファイル1プロセスで足りたこと。
エージェント側の1周は2コマンドで構成される。`preview next --wait 90` で指摘が届くまで待って受け取り、`preview done --stdin` で直した結果を報告する。指摘はまとめて1バッチで送信される。公開 URL の発行は viewer の「共有する」を押したときだけで、ローカルの指摘履歴は共有に含まれない。実装は PR として公開されている。
社内向けサービスの
社内向けの
要点として、人のログインは Google OIDC を使い、OAuth 同意画面を「内部」タイプにすると Workspace 外のアカウントはログイン画面から先に進めないこと、アプリ側で hd クレームを二重に確認すること、ID トークンは JWKS で署名検証することが挙げられている。
在籍確認に使う Directory API には、鍵レスで GCP を呼ぶ Workload Identity Federation と、管理者として振る舞うドメイン全体の委任の2段が要る。人・機械・CI で認証を分けるべき理由として、CI 用トークンを在籍チェックの対象にすると発行した人が辞めた瞬間に CI が壊れる点が挙げられている。本番投入前の設計・疎通確認段階だと明記されている。
GitHub Actions の
2026年2月26日から
背景にあるのは、2026年8月時点で安定版の gh コマンドや GitHub API から PR のディスクリプションに画像を添付できないという制約。8月18日に画像や動画をアップロードできる `--attach` の preview build が公開されたが、執筆時点では正式版に入っていない。そのため AI に自動化させようとすると Chrome を立ち上げさせるといった手順が要り、不便だった。
具体的には `actions/upload-artifact@v7` の `archive: false` を使う。zip 化されずにアップロードされる代わり、対象は単一ファイルのみ。単一ファイルの HTML や画像なら Artifact の URL を開くだけでブラウザに表示され、プライベートリポジトリでは Artifact URL がリポジトリの read 権限で保護されるため、関係者への共有に向くとしている。
Claude Code の
Claude Code の
routine は cron・GitHub イベント・API トリガー(webhook)のいずれかを起点に Claude が起動し、プロンプトに書いた仕事をこなす仕組み。2026年4月に登場し、執筆時点(2026年9月)ではまだ research preview。実行環境はクラウドとローカルから選べ、筆者は PC を閉じていても動くクラウドを使っている。ただしクラウド実行はローカルマシンの skill やメモリを読み込まないため、使わせたい skill はリポジトリに置いて明示的に参照させる必要がある。
前提として、routine の実行は所有者アカウントの usage を消費する。記事中の「定額で回せる」という話は、定額プランで Claude Code を使っていることが条件になっている。
Whisper が
Whisper で
先行研究としては、非音声入力による Whisper のハルシネーションを体系的に調べた論文をアンカーに置き、Whisper API の書き起こしの約1%に捏造フレーズが含まれ無音ポーズの長い失語症話者ほど幻覚が増えると報告した FAccT 2024 の Koenecke らの論文、デコーダ末尾層の少数の attention head が非音声幻覚の大半を駆動していると特定した Calm-Whisper(Interspeech 2025)も参照している。
音声はすべて合成(30秒、16kHz mono)。完全なデジタル無音、マイクのノイズフロア相当の微小白色雑音(-80dBFS)、白色雑音とピンク雑音を -60 / -40 / -20dBFS の3レベル、50Hz ハム、440Hz 純音を用意し、実環境の音も加えている。
すべて既出
Anthropic が
9月2日に
エージェントは2種類。買い物客向けの Shopping Agent はカタログ検索、商品比較、カート投入、注文追跡・返品の Q&A を担い、店舗スタッフ向けの Merchant Agent は売上分析、在庫アラート、価格・販促の提案、キャンペーン草案を担う。表と裏の両方が入っている点を筆者は特徴として挙げている。
同じ骨格で retail / travel / telecom / entertainment の4業種分の実装が用意され、それぞれ別ポートで動く。筆者が最も参考になるとするのは実行形態が3通り書き分けられている点で、Messages API ではエージェントのループを自分で書く形になる。検証環境は Windows 10 / Python 3.11.9 / Node 22.19、測定は2026-09-03時点。
カジュアル面談で
未経験から
題材はカジュアル面談の終盤の「何か聞いておきたいことはありますか」という問いに「特にないです」と答える場面。遠慮や緊張もあるだろうとしつつ、採用担当としては非常にもったいないと感じると書いている。カジュアル面談は一方的に候補者を試す場ではない、という位置づけを示している。
面談が始まって数分で準備の深さが見えてしまう理由にも触れている。採用資料や技術ブログを読んでから来る人とそうでない人の差は数分で分かるが、求めているのは情報の暗記ではなく、会社が抱える課題と自分の関わり方への関心だとしている。
「いい
「いい
題材は社内のシャッフルランチで、80人を3〜4人のグループに分ける。ランダムに割り振ると先月と同じペアが毎月およそ5ペアできる。80人を4人×20グループにすると同席ペアは C(4,2)×20 = 120、80人で作れるペアの総数は C(80,2) = 3160 なので、特定の2人が同席する確率は約3.8%、先月の120ペアが再び同席する期待値は約4.6ペアという計算を示している。
定義を与えて解いた結果は、前月ペアの再会0ペア(12か月連続)、6か月以内に会った人との再会0ペア(12か月連続)、計算時間約2秒、小規模での厳密最適解との一致140/140ケース。ソルバーもライブラリも使わず Google Apps Script だけで書いている。
Claude Fable 5.1 で
9月1日に
公式が挙げる破壊的変更は3つ。1つ目は強制ツール使用が使えなくなった点で、`tool_choice` に `any` や `tool` を渡すと 400 が返る。エラー文は `tool_choice: type "tool" and "any" are not supported for this model.`。Messages API だけでなく Batch API とトークン計測でも同じで、必ずツールを呼ばせて構造化出力を取る手が使えない。2つ目は以前のモデルが 5.1 の thinking ブロックを読めないこと、3つ目は過去のターンを編集すると thinking ブロックが無効化されること。
エラーにならず気づきにくい挙動変更も3つ挙げられている。並列ツール呼び出しが減り、長いエージェントループで1ターン1呼び出しになることがある、など。筆者は API を直接叩いておらず、エラーは自分では踏んでいないと明記している。検証環境は Windows 10 / Claude Code 2.1.258、測定は2026-09-02時点。
日本の
中
比較対象は MCP と、REST・SOAP・GraphQL・gRPC といった既存の API 方式。どれが実際に使えるのかを、製品ごとの対応状況として整理している。
情報システム担当が「調べてみます」を繰り返す状況を具体的な調査結果で埋めることを狙った構成になっている。
未経験から
ChatGPT・Copilot・Gemini など
企業向け Microsoft 365 Copilot に
ネットワークフロー理論の
ネットワークフロー理論に
最小カット問題は、情報系の大学の「アルゴリズムとデータ構造」の講義の終盤に少しだけ登場するマニアックな話題という印象を持たれがちだ、という前置きが置かれている。
それに対して、とても美しい構造を持ち、現実世界への応用も多方面に広がっているという立場から、カットの理論から応用例までを順に扱う構成になっている。
アンケートの